Hume AI 的七名研究员贴出一组诊断实验,测试对象是 11 款主流语音识别模型。他们想验证的事情很简单:公开基准上错误率最低的系统,是不是把音频听得更准。结果指向另一个方向——分数最好的那几个,最有可能在照抄基准数据集里本身就写错的参考文本。
参与测试的包括 OpenAI Whisper-large-v3、Qwen3-ASR、Nvidia 的 canary-qwen 与 parakeet、Microsoft Phi-4、Mistral Voxtral-Mini、Moonshot Kimi-Audio、IBM granite-speech、CohereLabs 的 cohere-transcribe,以及 bosonai higgs-audio 和 Moonshine 的流式中号模型。研究者把这类行为称作”基准优化”:模型的分数上升,可能来自它记住了某个数据集的书写约定,而不来自听力本身变好。
三把探针分别测什么
第一把叫参考不一致探针。公开语音数据集的参考文本并不干净,团队分析的 VoxPopuli 测试片段里约四成存在参考错误的迹象,波及大约 3% 的词。探针的做法是找出音频与文本对不上的位置,看模型跟谁走。表现出基准优化的模型有 18% 到 30% 的比例复现了错误的参考文本,宁可不听音频,也要写出数据集里的那个版本。
第二把是掩码实体检索。团队把音频里的数字静音,再让模型转写。多个模型在 LibriSpeech 上以 30% 到 40% 的比例把消失的数字补了回来。声音已经不在,词还在。
第三把测正字法切换。同一个词在不同数据集里有不同写法约定,比如 Mr. 与 Mister、any one 与 anyone。部分模型在跨数据集判断”此处该用哪种写法”上的准确率接近 90%,高到不像巧合。
模型靠什么认出考卷
最能说明问题的是一组重合成实验。VoxPopuli 中有一句话的参考文本漏掉了开头的 Thank you,用原始录音测,11 款里有 6 款跟着漏掉;把同一句用原说话人的克隆声音重新合成,漏掉的降到 5 款;换成另一位议员的声学克隆之后,只剩 1 款还在漏。
文字没变,语义没变,变的只有声音的来源。研究者的判断是,模型有能力照实转写字面上说出口的词,却在用周围的声学特征判断自己身处什么场合,再决定跟音频走还是跟某个数据集的转写政策走。
“Models are able to faithfully transcribe the literal spoken words, but are using surrounding acoustic context to decide whether to follow the audio or a benchmark-specific transcription policy.” 模型能忠实转写说出口的词,却在用周围的声学环境决定要不要照实写。
这条链路和大模型圈熟悉的基准污染是同一件事,语音这边隐蔽得多。文本基准里题目泄漏还能靠字符串比对查出来,声学层面的”认卷子”不留明面痕迹,一张 WER 表格上看不出任何异常。
一列错误率能撑起多少决策
散点图呈现的形态更值得警惕:错误率最低的那批模型,同时是复现错误参考文本比例最高的那批。选型的人若只看一列 WER,排序方向恰好和”谁更会应付考题”重合。
研究者并没有主张废掉公开榜单,他们的说法是这些榜单透明、可重复、易于运行、被社区充分理解。给出的处方偏工程:用完全保留的评估集;避免简单的同分布随机划分,改按时间、说话人或元数据切分;在榜单里加一个”基准拟合”标签页,长期跟踪参考错误率与正字法切换现象;把评估脚本和未经标准化的原始输出开源,供人复查。
对国内做语音落地的团队,这份实验的实用价值在于给选型流程加一步。粗算一下,找 200 到 500 条自家业务的真实录音、按自家规范转写一遍做保留集,人力成本在几个人日的量级,拿它对照几家供应商的公开排名跑一轮,就能看出排序方向是否同向。客服录音、会议纪要、车载语音这些场景的口音、噪声与术语分布和 LibriSpeech 相去甚远,榜单上零点几个百分点的差距,放到自家数据上大概率会被口径差异淹没。
参考来源:Hume AI 研究团队公开的探针实验记录、Hugging Face 社区技术博客、CocoLoop、各模型官方卡片;核验参测模型清单、三类探针的比例口径与重合成实验的计数。