小米(Xiaomi)9月11日開源了一款叫做Xiaomi-CocktailASR-1的語音辨識模型,專門用來解決「雞尾酒會問題」:一屋子人同時講話時,只把你想聽的那個人的話轉成文字。程式碼放在GitHub的xiaomi-research組織底下,權重放在Hugging Face,技術報告則在9月10日送上arXiv。
它的輸入比一般語音辨識模型多了一段:目標說話者的參考音訊。模型把這段音訊當作聲紋提示,在混雜的音軌裡把這個人的聲音挑出來轉寫,其他人講的話一律不會出現在文字結果裡。
數字說話
在多說話者測試集上,報告給出的字錯率是:LibriMix兩人混說4.11%,三人混說的LibriMix3mix為12.29%,LibriSpeechMix2mix則是2.90%。在同一批三人測試中,通用語音辨識模型的字錯率落在76%到121%之間。超過100%代表模型插入的錯字比原本的話還多,等於把兩三個人的話揉成了一團亂碼。
真實場景的資料用的是AliMeeting會議錄音,遠場條件下的目標說話者字錯率(TS-WER)是20.63%,比先前公開的最佳成績27.5%低了將近七個百分點。單人乾淨音訊的LibriSpeech成績是1.73%,跟主流通用模型基本打平,這一項決定了它能不能拿來當一般用途的語音辨識工具,而不只是混音場景的專用零件。
還有一項是拒識率。目標說話者根本沒開口時,模型應該輸出空白文字。在英文負樣本集上,它的拒識率是79.59%;報告拿Gemini-2.5-pro做對照,後者的誤拒率是21.31%,也就是本該轉寫的時候誤判成「沒人在說話」。
架構不複雜,資料量卻不小
整體分成三段:一個以Data2Vec2為底的自監督音訊編碼器,參數量約6000萬,輸出1280維的幀級嵌入;一個線性適配器把音訊嵌入投影到語言模型的隱藏空間;主幹則是Qwen3-8B。整體是端到端的大型語言模型架構,不是傳統語音辨識那套聲學模型加語言模型拼裝起來的做法。
訓練分成四個階段,光是第二階段就用掉超過40萬小時的多說話者資料和60萬小時的單說話者資料。這個量級說明模型的能力主要來自資料規模和混音合成的覆蓋範圍,架構本身留給外界複現的門檻並不高。
模型還支援思維鏈(CoT)模式,會先推理出「這段音訊裡有幾個人、目標聲紋對應到哪一段」,再進行轉寫。報告指出開啟CoT之後,字錯率會再降0.24個百分點(絕對值)。就工程面來說,0.24個百分點的收益多半抵不過多出來的推理成本,這個模式的價值更多在於可解釋性,出錯時能看出模型是在哪一步判斷錯的。
對大陸市場落地的意義
中國大陸語音辨識這塊商用方案並不缺,缺的是能在多人對話中穩定鎖定單一目標的開源元件。會議紀錄、車用多人座艙、客服雙錄品質檢核、助聽裝置,這幾個場景都卡在同一個地方:麥克風收到的不只一個人的聲音。
小米自己的落地方向不難猜,車機和IoT裝置上的語音助理都得面對多人共處一室的情境。但這次是以開源方式釋出完整的權重加程式碼,第三方能直接拿去用,不用等哪個雲端服務開放API。報告裡用到的測試集也全都是公開資料集,別人要複現、要挑毛病的門檻因此降低了。
有一點得提醒:LibriMix這類資料集是把乾淨語音用人工方式混疊出來的,跟真實房間裡的殘響、方向感、被打斷等情況不完全對得上。比較貼近日常使用情境的數字是AliMeeting的20.63%,離「好用」還有一段距離。小米也沒有另外公布模型在中文多人場景下的成績。
參考來源:小米開源倉庫xiaomi-research/xiaomi-cocktailasr-1、CocoLoop、arXiv技術報告2609.11274、IT之家;各資料集的字錯率與拒識率數字均以技術報告為準。