新模型
2026-09-12
小米开源 CocktailASR-1:在嘈杂人群里只「听清一个人」,会议纪要更准了
来源:AIBase
小米开源 CocktailASR-1:在嘈杂人群里只「听清一个人」,会议纪要更准了
发生了什么
小米近日正式开源了工业级「目标说话人」语音识别大模型 CocktailASR-1(Apache 2.0 协议,代码和权重已在 GitHub、HuggingFace 放出,可商用)。
它的本事很直观:你给它一段目标人的参考音频(比如同事张三说的一句话),再给它一段好多人同时说话的录音,它只把张三的话转成文字,别人的声音、混响、背景噪声统统过滤掉。如果参考的那个人根本不在场,它直接返回空文本,不会张冠李戴。
这是冲着困扰语音识别几十年的「鸡尾酒会难题」去的——人天生能在嘈杂饭局里只听清对面那个人,但机器一直做不好。
对我有什么用
在模拟多说话人测试里,CocktailASR-1 的字错率(WER)低到 2.90%(LibriSpeechMix 2mix);而同赛道知名通用模型在类似混合场景里字错率能冲到 76%–121%(超过 100% 意味着它不仅没听对,还把别人的话也写进去了)。在真实会议录音(AMI、AliMeeting 远场中文会议)里也大幅领先现有方案。
它的两个实用细节很加分:
- 负样本拒识:参考的人不在场就输出空文本,防止智能音箱、车载助手被旁人声音误唤醒;
- 思维链:能先展示「怎么认出这个人」的推理过程,方便调试和看懂结果。
我可以怎么做
- 你不一定自己部署。但它代表的趋势是:以后会议纪要、采访整理、课堂/讲座录音,能精准区分「谁说了什么」,不再是糊成一团。
- 开发者可以把它接进自己的工具:把会议录音 + 每位发言者的几秒参考音丢进去,直接产出按人分好的文字稿。
- 对车载语音、智能音箱也是利好——更不容易被别人声音带偏。
温馨提醒
- 它是语音识别模型,不是「会议总结 AI」,只负责把指定人的话转成文字;要总结还得接一步大模型。
- 需要你提供目标人的参考音频(1–4 秒即可),没有参考音它无从锁定。
- 开源可商用,但部署需要基础 Python 环境(torch、transformers 等),纯小白建议等现成产品集成。
📤 一键转发小助手
帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发
💬 说说你的看法