新模型
2026-09-10
腾讯混元开源语音模型 AuK:一句话改口音、去噪、分离人声,小白也能玩
腾讯混元开源语音模型 AuK:一句话改口音、去噪、分离人声,小白也能玩
发生了什么
9 月 9 日,腾讯混元联合上海交通大学、上海创智学院等开源了语音生成与编辑基础模型 AuK(参数 1.5B,MIT 协议,代码和权重同步放出)。
它不是一个普通 TTS(文字转语音),而是把语音这条链上原本分散在十几个专用模型里的活,收进同一个入口:你用自然语言指令加一段参考音频,说清楚要做什么,模型就输出改好的音频。官方把任务分成几类:
- 生成:零样本配音(给一段参考声音就能模仿)、指令式 TTS(只写“低沉男声、语速慢”就能合成,不用参考音)。
- 内容编辑:替换、插入、删除录音里的字词,甚至保留旋律改歌词。
- 声学/副语言编辑:改音高、语速、音量,改情绪、音色、去掉口音,加或删笑声/咳嗽。
- 处理:降噪、去混响、人声分离、目标说话人提取。
蒸馏版 AuK-Flash 固定 4 步采样、不开 CFG,推理速度约为完整版的 4.5 倍。
对我有什么用
过去做配音要装一套 TTS、改情绪要另一套音色转换、去背景音再找一套分离模型,三者格式还各不相同,工程大头花在“把它们串起来”。AuK 把指令当成统一接口,模型自己判断走哪条路——就像图片编辑从“换一堆滤镜软件”变成“用一句话改图”。而且 MIT 协议意味着可以放心拿来做商业产品,对配音、无障碍、播客后期、音频制作很实用。
我可以怎么做
- 做自媒体的朋友:录好的口播有杂音、说错词、想换个情绪?以后可能一句话就能改,不用重录。
- 想做配音/有声书:给一段参考音就能生成同款声音,或只写描述就合成新声音。
- 处理会议/采访录音:用它做说话人分离、去混响,提取某个人说的话。
- 开发者可在 GitHub(Tencent-Hunyuan/AuK)拿到代码、权重、Gradio 界面和 ComfyUI 节点直接玩。
温馨提醒
- 它是能力强、可自由下载的语音克隆模型,请只用于自己有权处理的音频;拿别人声音生成内容需获得授权,避免侵权。
- 目前模型卡/论文未强调生成音频的水印或来源标识,用于正式内容时建议保留“AI 生成”标注,防止被误当作真实录音。
- 性能数据主要来自作者方评测,独立复现对比尚少,实际效果建议先试官方 Demo 再决定。
📤 一键转发小助手
帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发
💬 说说你的看法