新模型 2026-09-27

Nvidia 开放 Nemotron 3 语音分离模型:免费、能分清 8 个人谁在说话

Nvidia 开放 Nemotron 3 语音分离模型:免费、能分清 8 个人谁在说话

一句话说清:Nvidia 免费开放了一个小模型 Nemotron 3 Diarization,专门干一件事——听一段录音,标出「哪一秒是说话人 1、哪一段是说话人 3」,最多同时分清 8 个人;它只标「谁在说」,不负责把声音变成文字。

发生了什么

2026 年 9 月 27 日,Nvidia 发布开源模型 Nemotron 3 Diarization。

  • 参数只有约 1 亿,很小、跑得快,权重免费下载;
  • 任务是「说话人分离(diarization)」:给音频打时间戳,标出每段是谁在说话,最多支持 8 个人同时说话,也能识别多人抢话;
  • 在 VoiceArena 的 Diarization-Bench 基准上,错误率 14.72% 排第一,比第二名(19.3%)低一截,比上一代 Sortformer 平均降错 41%;
  • 它只标说话人,不出文字——要和语音识别模型(如 Nvidia Parakeet)配合,才能产出「带名字标签的逐字稿」。

对我有什么用

  • 开会被录音的人:能自动分出「谁承诺了什么、谁反对了什么」,复盘会议纪要不用自己听完全程。
  • 做客服 / 播客分析的人:把长录音按说话人切好,再做总结或质检,效率大增。
  • 开发者:1 亿参数意味着它很轻,能实时跑,不用花大钱上云 API。
  • 趋势信号:语音里的「谁在说」这种能力正在变成免费、开源的标配件。

我可以怎么做

  1. 到 Hugging Face 搜 nvidia/nemotron-3-diarization 下载权重(免费)。
  2. 准备一段录音或开一个直播音频流,把缓冲设好(缓冲越短越实时、但越容易出错,最低 0.32 秒)。
  3. 用它对音频跑一遍,得到「说话人 1 在 4–17 秒、说话人 3 在 17 秒插话」这样的时间轴。
  4. 再接一个语音识别模型,把每段声音转成文字,拼成带标签的稿子。

温馨提醒

  • 它不翻译、不转写,只告诉你「谁在哪一秒说话」;要文字必须再接一个识别模型。
  • 人越多、环境越吵、回音越大,错误率越高——真实会议里的误差通常会高于宣传的 14.72%。
  • 说话人标签是匿名的(比如「speaker_2」),模型本身不存音频、不上传,但用它搭出来的应用要自己注意隐私合规。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发