阿里千问 9 月 23 日发布 Qwen-Audio-3.1 系列语音模型,一次放出五款,覆盖识别、合成、实时对话和音频创作,并同步下调整条语音产品线的价格:语音合成(TTS)降约 70%,实时语音(Realtime)降约 85%,语音识别(ASR)最高降 95%。
五款模型分两类。三款是老产品线升级:
- Qwen-Audio-3.1-ASR:单个模型支持 30 种语言和 16 种中文方言,官方称在 11 个方言测试子集上取得最好成绩,温州话这类难度高的方言提升明显,首字响应约 160 毫秒;
- Qwen-Audio-3.1-TTS:多语言合成,支持跨语言音色迁移,可以用自然语言指定语气,例如要求”用强硬、不容置疑的口吻读”;
- Qwen-Audio-3.1-Realtime:全双工对话,边说边听,可随时打断,支持调用工具;官方称它在察觉用户情绪低落时会放慢语速。
两款是新面孔:
- TTS-Next:语言模型加扩散模型的统一框架,一次生成人声、音效和背景音,面向有声书、播客、游戏和广告;
- ASR-Next:多人说话时能区分说话人、给出时间戳和对齐文本,还能识别情绪、环境声和机器声,做声音描述、事件定位和音频问答。
方言成绩单
千问在发布材料里给了几组方言数据:中文方言语音识别的平均字错误率为 10.38%,方言翻译的平均语义句准率为 82.10%。这些是官方自测口径,测试集构成没有完整公开,第三方复现结果暂时没有。
对国内开发者,方言识别是个实打实的需求。客服、政务热线、县域电商直播里,普通话识别准、方言一上来就乱,是很多语音产品落地卡住的地方。16 种方言装进同一个模型,至少省掉了按地区切换模型的麻烦。
和 ElevenLabs 比一比
语音合成这条线,海外对标对象通常是 ElevenLabs。第三方路由服务 OrcaRouter 整理过一组价格:上一代 Qwen-Audio-3.0 的 TTS Plus 档约每百万字符 27.6 美元,Flash 档约 15 美元;ElevenLabs Eleven v3 标准价约每百万字符 100 美元,Flash 档约 50 美元。
按”降约 70%“粗算,3.1 版 Plus 档会落到每百万字符 8 美元出头。这只是估算,公告本身只给了降幅,具体新价以阿里云百炼的价目表为准。
质量这边,Artificial Analysis 的语音竞技场 8 月数据里,Qwen-Audio-3.0-TTS-Plus 的 Elo 为 1234,Eleven v3 为 1168。3.1 版 TTS 还没有进入任何公开竞技场,新版本在音质上是进是退,眼下只有厂商自己的说法。
用在哪里
千问这次把语音模型和一串自家产品绑在一起讲:编程智能体 Qoder、千问办公,以及 QwenNote、A2、Eva、千问 AI 眼镜和乐奇 AI 眼镜等硬件。眼镜、录音笔这类设备按分钟、按次调用语音接口,识别和实时对话降价 85% 到 95%,对硬件厂商的单机服务成本影响最直接。
实时对话降幅排第二。一路实时通话通常要同时跑识别、推理和合成,是语音产品里单位成本偏高的一类,这次降价后语音助手能不能对免费用户长期开放,要看各家接入方下一季度的产品定价。
参考来源:千问官方发布、IT之家、The Decoder、CocoLoop、OrcaRouter 价格整理;降价幅度与方言测试数据为千问官方口径,旧版与 ElevenLabs 价格为第三方整理,竞技场分数以 Artificial Analysis 公开榜单为准。