音檔裡沒有的數字,語音模型照樣念出來

Hume AI 七名研究員發表了一組診斷實驗,測試對象是 11 款主流語音辨識模型。他們想驗證的問題很單純:公開榜單上錯誤率最低的系統,是不是真的把音檔聽得更準?結果卻指向另一個方向——分數最好的那幾款,反而最可能照抄榜單資料集裡本身就寫錯的參考文字。

參與測試的包括 OpenAI 的 Whisper-large-v3、Qwen3-ASR、Nvidia 的 canary-qwen 與 parakeet、Microsoft 的 Phi-4、Mistral 的 Voxtral-Mini、Moonshot 的 Kimi-Audio、IBM 的 granite-speech、CohereLabs 的 cohere-transcribe,以及 bosonai 的 higgs-audio 和 Moonshine 的串流中型模型。研究團隊把這類行為稱作「基準優化」:模型的分數上升,可能來自它記住了某個資料集的書寫慣例,而不是聽力本身變好

三支探針分別測什麼

第一支叫參考不一致探針。公開語音資料集的參考文字並不乾淨,團隊分析的 VoxPopuli 測試片段裡約四成存在參考錯誤的跡象,波及大約 3% 的詞。探針的做法是找出音檔與文字對不上的位置,看模型跟誰走。表現出基準優化的模型有 18% 到 30% 的比例複製了錯誤的參考文字,寧可不聽音檔,也要寫出資料集裡的那個版本。

第二支是遮蔽實體檢索。團隊把音檔裡的數字消音,再讓模型轉寫。多款模型在 LibriSpeech 上以 30% 到 40% 的比例把消失的數字補了回來。聲音已經不在,詞還在。

第三支測正字法切換。同一個詞在不同資料集裡有不同寫法慣例,比如 Mr. 與 Mister、any one 與 anyone。部分模型在跨資料集判斷「此處該用哪種寫法」的準確率接近 90%,高到不像巧合。

模型靠什麼認出考卷

最能說明問題的是一組重新合成實驗。VoxPopuli 中有一句話的參考文字漏掉了開頭的 Thank you,用原始錄音測試,11 款裡有 6 款跟著漏掉;把同一句話用原說話者的克隆聲音重新合成,漏掉的降到 5 款;換成另一位議員的聲學克隆之後,只剩 1 款還在漏。

文字沒變,語意沒變,變的只有聲音的來源。研究者的判斷是,模型有能力照實轉寫字面上說出口的詞,卻在用周遭的聲學特徵判斷自己身處什麼場合,再決定要跟著音檔走,還是跟著某個資料集的轉寫規則走。

"Models are able to faithfully transcribe the literal spoken words, but are using surrounding acoustic context to decide whether to follow the audio or a benchmark-specific transcription policy."

模型能忠實轉寫說出口的詞,卻在用周遭的聲學環境決定要不要照實寫。

這條鏈路和大模型圈熟悉的基準污染是同一件事,只是語音這邊隱蔽得多。文字榜單裡題目外洩還能靠字串比對查出來,聲學層面的「認考卷」不留明面痕跡,一張 WER 表格上看不出任何異常。

一欄錯誤率能撐起多少決策

散布圖呈現的形態更值得警惕:錯誤率最低的那批模型,同時是複製錯誤參考文字比例最高的那批。選型的人若只看一欄 WER,排序方向恰好和「誰更會應付考題」重合。

研究者並沒有主張廢掉公開榜單,他們的說法是這些榜單透明、可重現、容易執行、也被社群充分理解。給出的處方偏工程面:用完全保留、不公開的評估集;避免簡單的同分布隨機切分,改按時間、說話者或詮釋資料切分;在榜單裡加一個「基準擬合」分頁,長期追蹤參考錯誤率與正字法切換現象;把評估腳本和未經標準化的原始輸出開源,供他人複查。

對正在做語音落地的團隊來說,這份實驗的實用價值在於為選型流程多加一步。粗算一下,找 200 到 500 筆自家業務的真實錄音、按自家規範轉寫一遍做保留集,人力成本大約在幾個人天的量級,拿它對照幾家供應商的公開排名跑一輪,就能看出排序方向是否同向。客服錄音、會議紀錄、車用語音這些場景的口音、噪音與術語分布,跟 LibriSpeech 相差甚遠,榜單上零點幾個百分點的差距,放到自家資料上很可能會被口徑差異淹沒。

參考來源:Hume AI 研究團隊公開的探針實驗記錄、Hugging Face 社群技術部落格、CocoLoop、各模型官方卡片;核對受測模型清單、三類探針的比例口徑與重新合成實驗的計數。