新模型
2026-09-27
Nvidia 开放 Nemotron 3 语音分离模型:免费、能分清 8 个人谁在说话
Nvidia 开放 Nemotron 3 语音分离模型:免费、能分清 8 个人谁在说话
一句话说清:Nvidia 免费开放了一个小模型 Nemotron 3 Diarization,专门干一件事——听一段录音,标出「哪一秒是说话人 1、哪一段是说话人 3」,最多同时分清 8 个人;它只标「谁在说」,不负责把声音变成文字。
发生了什么
2026 年 9 月 27 日,Nvidia 发布开源模型 Nemotron 3 Diarization。
- 参数只有约 1 亿,很小、跑得快,权重免费下载;
- 任务是「说话人分离(diarization)」:给音频打时间戳,标出每段是谁在说话,最多支持 8 个人同时说话,也能识别多人抢话;
- 在 VoiceArena 的 Diarization-Bench 基准上,错误率 14.72% 排第一,比第二名(19.3%)低一截,比上一代 Sortformer 平均降错 41%;
- 它只标说话人,不出文字——要和语音识别模型(如 Nvidia Parakeet)配合,才能产出「带名字标签的逐字稿」。
对我有什么用
- 开会被录音的人:能自动分出「谁承诺了什么、谁反对了什么」,复盘会议纪要不用自己听完全程。
- 做客服 / 播客分析的人:把长录音按说话人切好,再做总结或质检,效率大增。
- 开发者:1 亿参数意味着它很轻,能实时跑,不用花大钱上云 API。
- 趋势信号:语音里的「谁在说」这种能力正在变成免费、开源的标配件。
我可以怎么做
- 到 Hugging Face 搜
nvidia/nemotron-3-diarization下载权重(免费)。 - 准备一段录音或开一个直播音频流,把缓冲设好(缓冲越短越实时、但越容易出错,最低 0.32 秒)。
- 用它对音频跑一遍,得到「说话人 1 在 4–17 秒、说话人 3 在 17 秒插话」这样的时间轴。
- 再接一个语音识别模型,把每段声音转成文字,拼成带标签的稿子。
温馨提醒
- 它不翻译、不转写,只告诉你「谁在哪一秒说话」;要文字必须再接一个识别模型。
- 人越多、环境越吵、回音越大,错误率越高——真实会议里的误差通常会高于宣传的 14.72%。
- 说话人标签是匿名的(比如「speaker_2」),模型本身不存音频、不上传,但用它搭出来的应用要自己注意隐私合规。
📤 一键转发小助手
帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发
💬 说说你的看法