8 月 4 日,騰訊混元正式發布新一代語音識別模型 Hy ASR 3.0 preview。量子位報導顯示,這個版本基於 Hy3 大語言模型,融合語音識別和語義理解能力;騰訊雲文件也已上線對應入口,開發者在即時語音識別 WebSocket API 中把 engine_model_type 選為 Hy-ASR-3.0-preview,即可使用混元語音識別。
數字先落在 WER 上
量子位與 IT之家均核驗同一組開源評測集資料:Hy ASR 3.0 preview 的中文普通話 WER 為 3.34%,英語 WER 為 2.62%,粵語 WER 為 3.12%。騰訊雲文件另列出 20 路免費併發,以及普通話、英語和 20 種中文方言支援。
這些數字不能混成單一準確率。WER 對應模型效果,併發和方言清單對應雲端產品邊界。對開發者而言,API 可用性、配額和業務城市語言覆蓋同樣影響上線成本。
抓手是上下文
騰訊官方材料稱,Hy ASR 3.0 preview 要從「逐字轉寫、單點優化」演進為「理解語境、相容場景、一鍵直出」。換成產品語言,就是模型要靠前後文判斷同音詞、專業術語和專案代號。
量子位提到,團隊圍繞 context、專業名詞、聲學環境和多樣人群語音構建 SFT recipe;方言資料覆蓋 10 大方言片區和 20 餘個二級小片區。騰訊還提到多階段強化學習,針對通用轉寫、Any-context 能力與長尾聲學場景優化。
內測限制很清楚
騰訊雲文件寫明,目前 preview 僅支援即時 ASR、1 分鐘以內音訊,以及 16k 單聲道 PCM 輸入;話者分離、VAD、詞彙替換、噪音參數閾值暫不支援;上下文傳入和熱詞功能仍是即將開放體驗。
因此它最先適合短語音輸入、即時字幕、客服片段、語音搜尋和助手指令。長會議、播客和多人訪談仍需要更成熟的產品能力。
參考來源:量子位、IT之家、騰訊雲文件、CocoLoop、財聯社;核驗 Hy ASR 3.0 preview 發布時間、WER 口徑、20 路免費併發、20 種方言、內測版輸入限制、API 呼叫參數與元寶首發狀態。