阿里千問團隊於9月19日發表即時同步口譯模型Qwen3.8-LiveTranslate,逐字延遲從上一代的2.8秒降到2.3秒。模型支援60種語言的理解、29種語言的語音輸出,發表同時開放體驗頁與API。
同步口譯的難處不在翻譯品質本身,而在品質與延遲之間的取捨。等待的字數越多,句子結構越完整,譯文越精準;但等得越久,聽眾越容易跟不上。這半秒的壓縮,正是這次發表的主軸。
用Interleave把三段流程咬合在一起
模型採用以Hybrid MoE為基礎的Thinker-Talker雙模組設計。Thinker負責處理音訊與影片輸入並完成翻譯,Talker負責生成語音,同時保留原說話者的音色。兩個模組透過Interleave方式,將串流理解、文字輸出與語音生成三個環節銜接起來。
這個架構的意義在於,三段流程不再依序等待彼此完成。傳統做法是聽完一段、譯完一段、再合成一段,每個階段都要先累積足夠的輸入;Interleave讓下一段在前一段還沒結束時就開始運作,延遲因此被壓低。代價是對模型串流穩定度的要求更高,一旦前半句理解出錯,後半句的語音早已播出。
除了降低延遲,這個版本新增三項能力:即時說話者分離並各自保留音色、原文與譯文同畫面同步顯示、長上下文語意消歧。前兩項是會議場景的剛性需求,多人交錯發言時能分清是誰在說話,譯文與原文也能對照查看;第三項則針對前後文決定詞義的情況。
兩組評測,涵蓋範圍差了5倍
阿里公布兩組數據。一組在公開的FLEURS音訊測試集上,涵蓋70個語言方向,阿里表示模型在翻譯品質、逐字延遲、語音辨識準確率與語音合成品質四個維度上,領先上一代及目前主流的即時口譯系統。另一組在Omnilingua-MSpeaker上,這是阿里自建的多語者長音訊評測集,涵蓋14個語向,比較的是翻譯忠實度、流暢度、簡潔度與說話者辨識錯誤率。
兩組涵蓋範圍相差5倍,而涵蓋範圍較窄的那一組,測的恰好是這次主打的說話者分離能力。公開測試集上沒有對應的多語者指標,外部要複現只能先從FLEURS那70個語向下手。四個維度各自領先多少,官方資料並未逐項給出數字。
橫向比較,這個等級的對手在哪
目前即時口譯有幾條不同的技術路線。一條是把成熟的語音辨識、機器翻譯、語音合成三件套串接起來,工程成熟、元件可替換,延遲通常在3秒以上;另一條是端到端的語音對語音模型,延遲低但語言涵蓋往往做不寬。Qwen3.8-LiveTranslate公布的60種理解、29種輸出,加上2.3秒延遲,落在這兩條路線中間、偏端到端的位置。
真要比較,得看同一測試集、同一語向下的數字。目前公開的比較只有阿里自己這一組,第三方在FLEURS上的獨立複現尚未出現。
還沒說的那幾件事
這次發表沒有提到開源與授權方式,也沒有公布API定價。以阿里今年在Qwen系列上的節奏來看,Flash等級的模型多數先上API、後放權重,但這一款是否會照此辦理,官方尚未表態。
會議、直播、跨境客服這些場景對口譯的要求不只是延遲數字。斷句錯誤的恢復速度、口音的穩健度、專有名詞的一致性,這些都得在真實音訊裡跑過才知道。體驗頁已經開放,答案在使用的人手裡。
參考來源:阿里千問官方發布、CocoLoop、騰訊新聞、鳳凰科技;延遲數值、語言數量與兩組評測集的語向涵蓋範圍已按官方口徑核對,四個維度的領先幅度官方並未逐項揭露。