階躍星辰 9 月 15 日發布 StepAudio 3 系列,一口氣推出五款模型:StepAudio 3 Realtime、ASR、TTS、Gen 和 Music,全數上線階躍星辰開放平台。
根據第三方評測機構 Artificial Analysis 的榜單,Realtime 在 Conversational Dynamics 這項拿下 98.9% 的綜合得分,排名第一;同一家機構的 Speech Reasoning 榜上,其語音推理準確率為 99.7%,同樣居冠。ASR 在非串流語音辨識準確度榜上詞錯率 1.7%,並列第一。
五款各司其職
分工大致如下:Realtime 負責全雙工即時對話,模型不經文字轉寫、直接在語音上做推理;ASR 把大模型的語意理解接進辨識環節,官方說法是能處理方言、中英夾雜和專業領域詞彙;TTS 做真人等級合成,除了發音要準,還得還原停頓、語氣這類副語言資訊;Gen 把人聲、音效、環境音和背景音樂放進同一個生成介面;Music 支援多輪互動式創作,還能用 ABC 記譜法直接控制旋律。
五款裡最見真章的是 Realtime 那套「原生語音推理」。傳統做法是語音轉文字、文字推理、文字再轉語音,三段拼起來,語氣、重音、情緒在第一段就流失了。跳過轉寫這一步,模型才有機會聽懂「你講得真好」到底是誇獎還是諷刺。
是否開源、怎麼計費,發布內容隻字未提。
1.7% 這個數字該怎麼看
詞錯率 1.7% 是非串流口徑下的成績,這個限定條件不能省略。非串流指的是拿到整段音訊再轉寫,模型可以前後文都看過一遍;串流則要求邊聽邊出字,只能看到已經過去的部分,錯誤率通常會高出一截。兩條賽道的數字擺在一起比較沒有意義。
「並列第一」本身也是一種訊息。它說明這個位置不是獨占的,至少還有一家模型停在同一個小數點上——非串流辨識這一項,頭部之間的差距已經細到千分位。
真正的區隔更可能落在榜單之外:方言涵蓋多少種、中英夾雜時切換得乾不乾淨、專業術語要不要額外設定。這些階躍都有提到,但沒有給出可比較的數字。
對中國團隊意味著什麼
這一年中國公開發布的語音模型密度不低。騰訊混元開源過 AuK,小米開源過多說話者辨識模型,通義的語音模型加進了工具呼叫功能。差別在於路線:開源的那幾家把權重放出來,誰都能拿去改;階躍這次五款是直接掛在自家開放平台上,按 API 呼叫,對不打算自建推理叢集的團隊門檻更低,代價是模型跑在別人的機器上。
對做語音產品的團隊來說,決定要不要接的通常是另外三件事:Realtime 的端到端延遲能壓到多少毫秒、TTS 的音色能不能自訂、Gen 生成的音效有沒有商用授權。這三項發布裡都沒寫,得等開放平台的文件。
參考來源:階躍星辰官方發布、CocoLoop、Artificial Analysis 榜單、IT之家;五款模型名稱、Conversational Dynamics 與 Speech Reasoning 的得分口徑、非串流詞錯率均以官方發布與榜單頁面為準。