Mistral 開源 4B 語音模型,評測超越 ElevenLabs

3 月 26 日,Mistral 發布了 Voxtral TTS,這是他們的第一個語音模型。

4B 參數、開放權重、人工評測自然度超越 ElevenLabs Flash v2.5、API 定價每千字 0.016 美元、可直接在自己的伺服器上運行——這是這款產品的核心賣點。

4B 參數的構成方式

Voxtral TTS 的架構由三個模組組成:

元件參數量功能
變換器解碼器主幹3.4B基於 Ministral 3B,負責語言理解與文字處理
聲學變換器390Mflow-matching 架構,處理音訊特徵生成
神經音訊編解碼器300M對稱編解碼設計,音訊壓縮與還原

延遲數據:輸入 500 字文字、10 秒參考音訊,首幀音訊在 70 毫秒內輸出。即時因子約 9.7 倍,也就是說生成 1 秒語音大約只需要 0.1 秒計算時間。

與 ElevenLabs 相比是什麼水準

Mistral 在發布公告中的說法:人工評測顯示,Voxtral TTS 的語音自然度超越 ElevenLabs Flash v2.5,與 ElevenLabs v3 品質持平。

ElevenLabs 是目前語音 AI 賽道的頭部玩家,v3 是他們的旗艦產品。「持平旗艦、超越次旗艦」這個定位,放在一個 4B 的開放權重模型身上,算是相當大膽的聲明。

聲音克隆方面,3 秒參考音訊就足夠了。不是簡單複製音色,而是能捕捉口音、語調起伏、停頓習慣,甚至「呃、嗯」這類語言習慣的節奏感。此外支援零樣本跨語言遷移——同一組聲音配置,切換語言朗讀,口音理論上能保持一致。

支援語言

英語、法語、德語、西班牙語、荷蘭語、葡萄牙語、義大利語、印地語、阿拉伯語,共 9 種。

中文不在列表裡——對台灣與華語用戶來說這是硬傷,現階段可以直接跳過不考慮這款。

開放程度要說清楚

這裡有個細節值得注意:Voxtral TTS 的權重協議是 CC BY NC 4.0,不是 Apache 2.0。

「NC」就是 Non-Commercial——非商業用途可以自由下載、修改、散佈,商業用途需要走 API。如果做學術研究、個人專案、內容展示,直接去 Hugging Face 下載權重,沒有使用限制。如果要整合進商業產品,使用 API:每千字元 0.016 美元。

競品價格參考:ElevenLabs Flash v2.5 大約是每千字 0.066 美元,Voxtral API 大約是它的四分之一,價格優勢相當明顯。

誰會受這款產品影響

語音 AI 這幾年格局變動不小。ElevenLabs 之前幾乎是預設選擇,之後 Deepgram、OpenAI、微軟陸續補上 TTS 能力,字節跳動的語音產品也在中國國內競爭。Mistral 進來走的是「開放權重 + 低價 API」的路線——與它做語言模型的策略一模一樣。

語音 agent、播客製作、語言學習、客服系統是 TTS 的主要落地場景。對於想控制成本、數據不想出境的企業,自部署選項確實有吸引力——哪怕你要商用,可以先使用開放權重做測試,確認效果再切到 API。

但重申一遍:中文不支援。這款產品現在的主要受眾是歐洲、南亞或者多語言出海團隊,台灣與華語市場直接使用的場景不多。

參考來源:Mistral AI just released a text-to-speech model it says beats ElevenLabs(VentureBeat);Mistral releases a new open source model for speech generation(TechCrunch);CocoLoop、Speaking of Voxtral(Mistral AI 官方部落格)