科大讯飞发布Spark-Audio-1.0-Preview:全国产算力训练的语音基座大模型,支持99种语言及202种方言 - 果核剥壳

9月17日消息,科大讯飞宣布Spark-Audio-1.0-Preview上线,这是一款基于全国产化算力训练的语音基座大模型。

据介绍,过去大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法存在两个明显短板:一是信息丢失,文字只能记录“说了什么”,会丢掉语音里自带的语气、情绪以及背景环境音等关键信息,导致模型对场景的判断不完整;二是链路割裂,语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行,模块之间存在断点,不仅容易累积错误,使用体验上也会出现延迟、卡顿。

科大讯飞发布Spark-Audio-1.0-Preview:全国产算力训练的语音基座大模型,支持99种语言及202种方言

语音基座大模型则解决了这些问题:不再只做语音转文字,而是直接理解语音,一次性听懂人声、环境音、音乐等,并理解声音里的语义、情绪和场景。

架构方面,Spark-Audio-1.0-Preview采用0.65B(Dense结构)的音频编码器,搭配30B-A3B(MoE结构)的大语言模型,使用1300万小时音频及大量文本数据,基于纯国产算力集群训练完成。它在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务,让机器从“听清”进一步走向“听懂”。

能力表现方面,Spark-Audio-1.0-Preview支持99种语言及202种方言的识别:与同尺寸的Qwen3.5-omni-flash(35B-A3B)相比,在多语言、多方言语音识别上平均效果占优;与尺寸高一个数量级的Qwen3.5-omni-plus效果接近。在Fleurs、Kespeech、LibriSpeech等中英文、多语言、多方言语音识别评测任务中,得分高于Gemini-3.1 Pro;Fleurs-中文测试集中取得SOTA。在复杂场景高噪声、小音量等真实应用类任务上,也有较为明显的领先优势。

官方同时坦承,此次发布的模型在通用知识、数学与代码等任务上没有出现明显降智,但在指令遵循、对话、音频理解等任务上仍有进步追赶空间。与讯飞星火大模型的1+N体系类似,该模型支持微调,开发者可在此基础上开发语音识别、语音同传、语音交互等专用模型或系统落地相关语音业务。

 

如果您喜欢本站,点击这儿不花一分钱捐赠本站

这些信息可能会帮助到你: 下载帮助 | 报毒说明 | 进站必看

修改版本安卓软件,加群提示为修改者自留,非本站信息,注意鉴别

(1)
上一篇 7小时前
下一篇 6小时前

相关推荐

发表回复

评论问题之前,点击我,能帮你解决大部分问题

您的电子邮箱地址不会被公开。 必填项已用*标注