阿里旗下千問(Qwen)9月23日發表Qwen-Audio-3.1系列語音模型,一口氣推出五款,涵蓋辨識、合成、即時對話與音訊創作,同時調降整條語音產品線的價格:語音合成(TTS)降約70%、即時語音(Realtime)降約85%、語音辨識(ASR)最高降95%。
五款模型分兩類。三款是既有產品線的升級版:
- Qwen-Audio-3.1-ASR:單一模型支援30種語言與16種中文方言,官方表示在11個方言測試子集拿下最佳成績,溫州話這類難度較高的方言進步明顯,首字回應時間約160毫秒;
- Qwen-Audio-3.1-TTS:支援多語言合成與跨語言音色轉換,可用自然語言指定語氣,例如要求「用強硬、不容置疑的口吻朗讀」;
- Qwen-Audio-3.1-Realtime:支援全雙工對話,能邊說邊聽、隨時被打斷,並支援工具呼叫;官方表示它偵測到使用者情緒低落時會放慢語速。
另外兩款是全新產品:
- TTS-Next:結合語言模型與擴散模型的統一框架,一次生成人聲、音效與背景音樂,鎖定有聲書、Podcast、遊戲與廣告;
- ASR-Next:能在多人對話中區分說話者、提供時間戳記與對齊文字,還能辨識情緒、環境音與機器聲,執行聲音描述、事件定位與音訊問答。
方言成績單
Qwen在發表資料中公布了幾組方言數據:中文方言語音辨識的平均字元錯誤率為10.38%,方言翻譯的平均語意句準確率為82.10%。這些都是官方自行測試的結果,測試集組成並未完整公開,目前也還沒有第三方複現數據。
對中國開發者來說,方言辨識是實際存在的需求。客服中心、政府服務專線、縣級電商直播裡,普通話辨識準確,方言一出現就容易出錯,是許多語音產品落地時卡關的環節。把16種方言塞進同一個模型,至少省去依地區切換模型的麻煩。
和ElevenLabs比一比
語音合成這條線,海外的比較對象通常是ElevenLabs。第三方路由服務OrcaRouter整理的價格顯示:上一代Qwen-Audio-3.0的TTS Plus級別約每百萬字元27.6美元,Flash級別約15美元;ElevenLabs的Eleven v3標準價約每百萬字元100美元,Flash級別約50美元。
按「降約70%」粗估,3.1版Plus級別價格會落在每百萬字元8美元出頭。這僅是估算,官方公告只給出降幅,實際新價格仍以阿里雲「百煉」平台的價目表為準。
品質方面,Artificial Analysis語音競技場8月的資料顯示,Qwen-Audio-3.0-TTS-Plus的Elo為1234分,Eleven v3為1168分。3.1版TTS尚未進入任何公開競技場,新版本在音質上究竟是進步還是退步,目前只有廠商自己的說法可參考。
用在哪些地方
Qwen這次把語音模型和一系列自家產品綁在一起宣傳:程式設計代理Qoder、千問辦公室,以及QwenNote、A2、Eva、Qwen AI眼鏡與樂奇(Leqi)AI眼鏡等硬體。眼鏡、錄音筆這類裝置多半按分鐘、按次數呼叫語音介面,辨識與即時對話降價85%到95%,對硬體廠商的單機服務成本影響最直接。
降幅排第二的是即時對話。一段即時通話通常要同時跑辨識、推論與合成,是語音產品中單位成本偏高的一類。這次降價後,語音助理能否長期對免費用戶開放,要看各家業者下一季怎麼訂價。
參考來源:千問官方發表、IT之家、The Decoder、CocoLoop、OrcaRouter價格整理;降價幅度與方言測試數據為Qwen官方口徑,舊版與ElevenLabs價格由第三方整理,競技場分數以Artificial Analysis公開排行榜為準。