阶跃星辰 9 月 15 日发布 StepAudio 3 系列,一次放出五款模型:StepAudio 3 Realtime、ASR、TTS、Gen 和 Music,全部上线阶跃星辰开放平台。
按第三方评测机构 Artificial Analysis 的榜单,Realtime 在 Conversational Dynamics 这项拿到 98.9% 的综合得分,排名第一;同一家机构的 Speech Reasoning 榜上,它的语音推理准确率是 99.7%,同样第一。ASR 在非流式语音识别准确性榜上词错率 1.7%,并列第一。
五款各管一段
分工大致是这样:Realtime 负责全双工实时对话,模型不经过文字转写直接在语音上做推理;ASR 把大模型的语义理解接进识别环节,官方说法是能处理方言、中英混说和专业领域词汇;TTS 做真人级合成,除了念对字,还要还原停顿、语气这类副语言信息;Gen 把人声、音效、环境音和背景音乐放进同一个生成接口;Music 支持多轮交互式创作,还能用 ABC 记谱法直接控制旋律。
**五款里最见功夫的是 Realtime 那条”原生语音推理”。**传统做法是语音转文字、文字推理、文字再转语音,三段拼起来,语气、重音、情绪在第一段就丢了。跳过转写这一步,模型才有机会听懂”你说得真好”到底是夸还是刺。
开源与否、怎么计费,发布里一个字没提。
1.7% 这个数字怎么读
词错率 1.7% 是非流式口径下的成绩,这个限定条件不能省。非流式指的是拿到整段音频再转写,模型可以前后文都看一遍;流式要求边听边出字,只能看到已经过去的部分,错误率通常高出一截。两条赛道的数字放在一起比没有意义。
“并列第一”同样是信息。它说明这个位置不是独占的,至少还有一家模型停在同一个小数点上——非流式识别这一项,头部之间的差距已经进入了千分位。
区分度更可能落在榜单之外:方言覆盖多少种、混说时切换得干不干净、专业术语要不要额外配置。这些阶跃都提到了,但没有给出可比的数字。
对国内团队意味着什么
这一年国内公开发布的语音模型密度不低。腾讯混元开源过 AuK,小米开源过多说话人识别模型,通义的语音模型加进了工具调用。区别在于路线:开源的那几家把权重放出来,谁都能拿去改;阶跃这次五款是直接挂在自家开放平台上,按 API 调用,对不打算自建推理集群的团队门槛更低,代价是模型跑在别人的机器上。
对做语音产品的团队来说,决定要不要接的通常是另外三件事:Realtime 的端到端延迟能压到多少毫秒、TTS 的音色能不能自定义、Gen 生成的音效有没有商用授权。这三项发布里都没写,得等开放平台的文档。
参考来源:阶跃星辰官方发布、CocoLoop、Artificial Analysis 榜单、IT之家;五款模型名称、Conversational Dynamics 与 Speech Reasoning 的得分口径、非流式词错率均以官方发布与榜单页面为准。