小米开源语音模型,三人混说字错率 12.29%

小米 9 月 11 日开源了一个叫 Xiaomi-CocktailASR-1 的语音识别模型,专门解决”鸡尾酒会问题”:一屋子人同时说话时,只把你想听的那个人转写出来。代码放在 GitHub 的 xiaomi-research 组织下,权重在 Hugging Face,技术报告 9 月 10 日提交到 arXiv。

它的输入比一般语音识别模型多一段:目标说话人的参考音频。模型拿这段音频当声纹提示,在混叠的音轨里把这个人的语音挑出来转写,其他人说的一律不出文字。

数字

多说话人测试集上的字错率,报告给的是这几组:LibriMix 两人混说 4.11%,三人混说的 LibriMix3mix 12.29%,LibriSpeechMix2mix 2.90%。同一批三人测试里,通用语音识别模型的字错率在 76% 到 121% 之间。超过 100% 的意思是插入的错字比原话还多,模型在混音里把两三个人的话揉成了一串。

真实场景数据用的是 AliMeeting 会议录音,远场条件下 TS-WER 20.63%,比此前公开的最好成绩 27.5% 低了将近七个百分点。单人干净音频上 LibriSpeech 1.73%,和主流通用模型基本齐平,这一项决定了它能不能当一个通用 ASR 来用,而不只是混音场景的专用件。

还有一项是拒识。目标说话人根本没出声的时候,模型应该输出空文本。英语负样本集上它的拒绝率 79.59%;报告拿 Gemini-2.5-pro 做对照,后者的虚假拒绝率是 21.31%,也就是该转写的时候误判成”没人说话”。

结构不复杂,数据量不小

三段结构:一个基于 Data2Vec2 的自监督音频编码器,参数约 0.6 亿,输出 1280 维的帧级嵌入;一个线性适配器把音频嵌入投到语言模型的隐藏空间;主干是 Qwen3-8B。整体是端到端的大语言模型架构,不是传统 ASR 那套声学模型加语言模型的拼装。

训练分四个阶段,第二阶段用掉超过 40 万小时的多说话人数据和 60 万小时的单说话人数据。这个量级说明模型的能力主要来自数据规模和混音合成的覆盖面,架构本身留给外部复现的门槛不高。

模型还支持思维链模式,先把”这段音频里有几个人、目标声纹匹配到哪一段”推理出来再转写。报告称开了 CoT 之后词错率再降 0.24 个百分点(绝对值)。对工程上来说,0.24 个点的收益大概率抵不过多出来的推理开销,这个模式的价值更多在可解释性,出错时能看到模型判断错在哪一步。

对国内落地意味着什么

国内语音识别这块商用方案不缺,缺的是能在多人对话里稳定锁定一个人的开源件。会议纪要、车载多人座舱、客服双录质检、助听设备,这几个场景都卡在同一个地方:麦克风收进来的不止一个人。

小米自己的落地方向不难猜,车和 IoT 设备上的语音助手都要面对多人同处一个空间。但这次是按开源方式放出的完整权重加代码,第三方能直接拿去跑,不需要等某个云服务开放接口。报告里所有测试集也都是公开数据集,别人复现和挑刺的门槛因此降下来了。

需要留一句:LibriMix 一类数据是把干净语音人工混叠出来的,和真实房间里的混响、方向、打断不完全对得上。更贴合日常使用的口径是 AliMeeting 那个 20.63%,离”好用”还有一段距离。小米也没有单独公布模型在中文多人场景下的成绩。

参考来源:小米开源仓库 xiaomi-research/xiaomi-cocktailasr-1、CocoLoop、arXiv 技术报告 2609.11274、IT之家;各数据集字错率与拒绝率数字以技术报告口径为准。