阿里千问 9 月 19 日发布实时同声传译模型 Qwen3.8-LiveTranslate,字均延迟从上一代的 2.8 秒降到 2.3 秒。模型支持 60 种语言的理解、29 种语言的语音输出,同时放出体验页和 API。
同传这件事的难点不在翻译质量,在于翻译质量和延迟之间的取舍。等的字数越多,句子结构越完整,译文越准;等得越久,听众越难跟上。这半秒的压缩,是这次发布的主线。
Interleave 把三段流程咬在一起
模型采用基于 Hybrid MoE 的 Thinker–Talker 双模块设计。Thinker 负责处理音频与视频输入并完成翻译,Talker 负责生成语音并保留原说话人的音色。两个模块之间用 Interleave 的方式衔接流式理解、文本输出和语音生成三个环节。
这个结构的意义在于,三段流程不再串行等待彼此完成。传统做法是听完一段、译完一段、再合成一段,每一段都要攒够输入;Interleave 让后一段在前一段还没结束时就开始工作,延迟因此被压下来。代价是对模型的流式稳定性要求更高,一旦前半句的理解出错,后半句的语音已经播出去了。
除了延迟,这一版新增了三项能力:实时说话人分离并各自保留音色、原文译文同帧同屏输出、长上下文消歧。前两项是会议场景的刚需,多人混说时能分清是谁在讲、译文和原文能对照看;第三项针对的是前后文决定词义的情况。
两组评测,覆盖面差 5 倍
阿里给出两组数据。一组在公开的 FLEURS 音频测试集上,覆盖 70 个语言方向,阿里称模型在翻译质量、字均延迟、语音识别准确率和语音合成质量四个维度上领先上一代及当前主流实时同传系统。另一组在 Omnilingua-MSpeaker 上,这是阿里自建的多说话人长音频评测集,覆盖 14 个语向,比的是翻译忠实度、流畅度、简洁度和说话人识别错误率。
两组的覆盖面差了 5 倍,而恰恰是覆盖面更窄的那一组,测的是这次主推的说话人分离能力。公开集上没有对应的多说话人指标,外部复现只能先从 FLEURS 那 70 个方向入手。四个维度具体各领先多少,官方材料没有逐项给出数字。
横向看,这一档的对手在哪
实时同传目前有几条不同的技术路线。一条是把成熟的语音识别、机器翻译、语音合成三件套串起来,工程成熟、可替换,延迟通常在 3 秒以上;另一条是端到端的语音到语音模型,延迟低但语种覆盖往往做不宽。Qwen3.8-LiveTranslate 报的 60 种理解、29 种输出,加上 2.3 秒延迟,落在这两条路线中间偏端到端的位置。
真要比,得看同一测试集、同一语向下的数字。目前公开的对比只有阿里自己那一组,第三方在 FLEURS 上的独立复现还没有出现。
还没说的那几项
这次发布没有提开源和许可协议,也没有公布 API 定价。以阿里今年在 Qwen 系列上的节奏看,Flash 档位的模型多数先上 API、后放权重,但这一款会不会照此办理,官方没有表态。
会议、直播、跨境客服这些场景对同传的要求不只是延迟数字。断句错误的恢复速度、口音鲁棒度、专有名词的一致性,这些都要在真实音频里跑过才知道。体验页已经开了,答案在用的人手里。
参考来源:阿里千问官方发布、CocoLoop、腾讯新闻、凤凰科技;延迟数值、语种数量与两组评测集的语向覆盖按官方口径核对,四个维度的领先幅度官方未逐项披露。