腾讯混元 9 月 9 日开源了语音生成与编辑模型 AuK,代码放在 GitHub 的 Tencent-Hunyuan 组织下,权重同时上了 Hugging Face 和魔搭,技术报告编号 arXiv 2609.08936。
这个模型的定位不是又一个 TTS。它把语音这条链上原本分散在十几个专用模型里的活,收进了同一个入口:用自然语言指令加一段参考音频,说清楚要做什么,模型输出改好的音频。
十几件事,一个入口
官方文档把任务分成六类。生成侧是零样本文本转语音和指令式 TTS;编辑侧分三层——内容层改说出来的词和歌词,声学层改音高、语速、音量,副语言层改情绪、音色、口音和非语言声音,还包括把正常说话转成气声;处理侧是降噪、去混响、音乐分离和目标说话人提取。
过去每一项基本对应一个独立模型。做配音的团队要装一套 TTS,改情绪要另一套音色转换,去背景音再找一套分离模型,三者的音频格式、采样率、依赖版本各不相同,工程上的大头往往花在把它们串起来。AuK 的做法是把指令当成统一接口,模型自己判断该走哪条路径。
编码器部分用的是 Qwen2.5-Omni-3B 作为多模态大模型底座。仓库里除了 Python API,还带了 Gradio 界面和 ComfyUI 节点,两个都是当下开源音视频社区的常用入口。演示视频里的例子是中文和英文。
AuK-Flash 快在哪
AuK-Flash 是从基座模型蒸馏出来的快速版本,NFE 固定为 4、CFG 设为 0。官方描述的蒸馏分两阶段:先用轨迹级一致性初始化把少步学生模型带起来,再切到按任务路由的解耦 DMD 目标,分离任务另用干净预测回归做监督。
对使用者来说,这些细节的意思是:常规扩散类语音模型一次生成要走几十步采样,还要为了质量再跑一遍无条件分支,AuK-Flash 把这两笔开销都省了,代价是从教师模型那里”接近”而非等同的质量。官方给的是 4.5 倍墙钟加速,没有公布对应的客观指标损失。
和这条赛道上的其他开源模型比
今年开源语音这块的密度不低。Mistral 放出过 4B 的语音模型,评测对标 ElevenLabs;阿里的 Qwen3.5-Omni 把文字、音频、视频做进一套并支持语音克隆;混元自己此前已经开源过 Hy4 基座和推理加速框架。
AuK 的差异点不在跑分,而在”编辑”这两个字。上面那几个模型的主线是生成,给定文本产出语音;AuK 的一半功能是拿一段已有音频进来改,改完还要保住原说话人的音色和节奏。这是两类不同的工程问题,后者对一致性的要求更严,也更贴近实际的后期制作流程。
MIT 协议这一点值得单独说。它允许商用、修改和再分发,只要保留署名,比不少国产开源模型附带的自定义许可宽松。对想把语音能力做进产品里的小团队,许可证的条款有时比参数量更能决定选型。
官方尚未公布与其他模型对比的 WER、说话人相似度或 MOS 数字,仓库里列了跨生成、编辑、增强、分离四类任务的性能对照,但具体分数需要自行复现。发布即最优的说法目前来自社区转述,还没有第三方评测跟进。
参考来源:Tencent-Hunyuan/AuK 仓库与技术报告、CocoLoop、Hugging Face 论文页;参数量、许可证与加速比按官方仓库说明核对,评测分数未获独立验证。