新模型 2026-09-12

小米开源 CocktailASR-1:在嘈杂人群里只「听清一个人」,会议纪要更准了

来源:AIBase

小米开源 CocktailASR-1:在嘈杂人群里只「听清一个人」,会议纪要更准了

发生了什么

小米近日正式开源了工业级「目标说话人」语音识别大模型 CocktailASR-1(Apache 2.0 协议,代码和权重已在 GitHub、HuggingFace 放出,可商用)。

它的本事很直观:你给它一段目标人的参考音频(比如同事张三说的一句话),再给它一段好多人同时说话的录音,它只把张三的话转成文字,别人的声音、混响、背景噪声统统过滤掉。如果参考的那个人根本不在场,它直接返回空文本,不会张冠李戴。

这是冲着困扰语音识别几十年的「鸡尾酒会难题」去的——人天生能在嘈杂饭局里只听清对面那个人,但机器一直做不好。

对我有什么用

在模拟多说话人测试里,CocktailASR-1 的字错率(WER)低到 2.90%(LibriSpeechMix 2mix);而同赛道知名通用模型在类似混合场景里字错率能冲到 76%–121%(超过 100% 意味着它不仅没听对,还把别人的话也写进去了)。在真实会议录音(AMI、AliMeeting 远场中文会议)里也大幅领先现有方案。

它的两个实用细节很加分:

  • 负样本拒识:参考的人不在场就输出空文本,防止智能音箱、车载助手被旁人声音误唤醒;
  • 思维链:能先展示「怎么认出这个人」的推理过程,方便调试和看懂结果。

我可以怎么做

  • 你不一定自己部署。但它代表的趋势是:以后会议纪要、采访整理、课堂/讲座录音,能精准区分「谁说了什么」,不再是糊成一团。
  • 开发者可以把它接进自己的工具:把会议录音 + 每位发言者的几秒参考音丢进去,直接产出按人分好的文字稿。
  • 对车载语音、智能音箱也是利好——更不容易被别人声音带偏。

温馨提醒

  • 它是语音识别模型,不是「会议总结 AI」,只负责把指定人的话转成文字;要总结还得接一步大模型。
  • 需要你提供目标人的参考音频(1–4 秒即可),没有参考音它无从锁定。
  • 开源可商用,但部署需要基础 Python 环境(torch、transformers 等),纯小白建议等现成产品集成。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发