阶跃放出五款语音模型,词错率压到 1.7%
五款模型同一天上线开放平台。Realtime 在 Conversational Dynamics 榜综合得分 98.9%,Speech Reasoning 的语音推理准确率 99.7%;ASR 的非流式词错率 1.7%,并列榜首;另外三款覆
收录 语音识别 相关 AI 新闻、产品动态和产业观察。 本页收录 4 篇已发布文章。
五款模型同一天上线开放平台。Realtime 在 Conversational Dynamics 榜综合得分 98.9%,Speech Reasoning 的语音推理准确率 99.7%;ASR 的非流式词错率 1.7%,并列榜首;另外三款覆
三人同时说话的 LibriMix3mix 测试里,字错率 12.29%,同场竞品落在 76% 到 121% 之间。两人混说 4.11%,单人 1.73%,真实会议录音的 AliMeeting Far 是 20.63%。
把 LibriSpeech 音频里的数字消音,多个高分模型仍有三到四成概率照念不误。它们学到的是数据集的书写习惯,拿 WER 排名去挑生产环境的语音方案,选中的可能恰好是最会应付考题的那一个。
腾讯把混元大模型接进语音识别,公开 WER、方言覆盖和 API 限制,竞争轴已经从“听清字”转向“听懂场景”。