新模型 2026-09-16

科大讯飞发布全国产语音大模型 Spark-Audio,能听懂 202 种方言

来源:站长之家

科大讯飞发布全国产语音大模型 Spark-Audio,能听懂 202 种方言

一句话说清:科大讯飞发布用全国产算力训练的语音基座大模型 Spark-Audio-1.0-Preview,支持 99 种语言、202 种方言,已经开放体验。

发生了什么

2026 年 9 月 16 日,科大讯飞发布语音基座大模型 Spark-Audio-1.0-Preview。它和以往「先把语音转成文字、再交给大模型理解」的做法不同,是直接「听语音、懂意思」:同一个模型能同时处理文本和语音两种输入,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情绪分析和复杂的音频问答。

几个硬信息:

  • 采用 0.65B 音频编码器 + 30B(MoE 结构)大语言模型,用 1300 万小时音频和大量文本数据训练;
  • 完全基于华为昇腾、海光等全国产算力集群训练,是业界首个全国产算力的语音基座大模型;
  • 支持 99 种语言、202 种方言识别,在 Fleurs 中文测试集上取得最佳成绩,高噪声、小声说的复杂场景里明显领先;
  • 目前已正式开放体验,API 后续上线讯飞开放平台。

对我有什么用

  • 方言多、口音重也不怕:202 种方言覆盖粤语、闽南语等,对做客服、会议转写、跨语言沟通很有用。
  • 它能「听懂情绪和环境」:不只记下了说了什么,还能分辨谁在说、什么语气、背景什么声音,比单纯转文字更聪明。
  • 对开发者:基于这个语音基座可以微调出语音识别、同声传译、语音交互等专用模型,落地到汽车座舱、机器人、医疗病历等场景。

我可以怎么做

第一步:打开体验入口 https://iflytekresearch.iflytek.com/experience/spark-audio

第二步:用麦克风说一段话(或上传音频),看它怎么转写、翻译、识别方言。

第三步:试试方言或带环境噪音的录音,感受它在复杂场景下的识别效果。

温馨提醒

  • 现在还是预览版(Preview),通用知识、数学、代码方面还有提升空间,别拿它当万能大脑。
  • API 还没上线,企业批量调用要等讯飞开放平台后续通知。
  • 「全国产算力」是它的卖点之一,对数据不出境、信创合规的场景特别合适。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发