阿里發布 Qwen3.5-Omni,文字音訊影片一體還能語音複製

3 月 30 日,阿里 Qwen 團隊推出了 Qwen3.5-Omni,這是他們第一個真正意義上的全模態模型——文字、圖片、音訊、影片全部放進同一個模型裡處理,不是那種把幾個專門模型拼在一起的拼接式架構。

一個模型,四種模態

之前市面上的多模態系統大多是「分工合作」:視覺一個模型,聽覺一個模型,最後再接一個文字模型統合輸出。Qwen3.5-Omni 不一樣,用的是 Thinker-Talker 雙架構加混合注意力 MoE(30B 總參數,每次激活 3B),所有模態在同一套參數裡運行。

這意味著模型能做到以前做不到的事:

  • 音影片聯合理解:看完一段影片後同時結合裡面的對話聲音來作答,不是先轉文字再看影片
  • 即時語音複製:上傳一段聲音樣本,模型能複刻這個聲線進行後續輸出(目前透過 API 存取)
  • 音影片 Vibe Coding:對著螢幕錄製講解,Qwen3.5-Omni 直接生成對應程式碼,不需要打字

規格一覽

規格數值
總參數量30B MoE
每次激活參數3B
上下文視窗256K tokens
最大音訊處理時長10 小時以上
最大影片處理量400 秒 720p @1FPS
語音辨識語言數113 種
語音輸出語言數36 種

三個版本:Plus(旗艦複雜任務)、Flash(均衡速度與效能)、Light(輕量快速)。

跑分表現

在 215 個測試資料集和 benchmark 上取得 SOTA,其中音訊部分直接超越 Gemini 3.1 Pro:

  • MMAU 音訊綜合理解:82.2 vs Gemini 3.1 Pro 的 81.1
  • 音樂理解 RUL-MuchoMusic:72.4 vs 59.6,差距拉開不少
  • 多語言語音複製穩定性:超越 ElevenLabs、GPT-Audio 和 Minimax

即時對話延遲壓到了 234 毫秒,採用 ARIA 技術(Adaptive Rate Interleave Alignment)動態調節語音節奏,讓輸出聽起來更自然,而不是機械式唸稿。

通用能力也沒有退步,MMMU 視覺理解 82.0%,HumanEval 程式碼 92.6%,LibriSpeech 語音辨識詞錯率 1.7%,基本都在第一梯隊。

語音 AI 格局正在改變

ElevenLabs 一直是語音複製領域的標竿,但 Qwen3.5-Omni 在多語言語音穩定性上超越了它。更重要的是,它把語音複製做成了全能多模態模型的內建功能,而不是一個單獨的垂直產品。

當然,語音複製目前只開放 API,還沒有進入產品介面,估計要等商業化節奏跟上再開放。

整個模型的訓練資料用了超過一億小時的音影片內容,這個量級才能撐起真正意義上的跨模態理解。

音影片 Vibe Coding 這個功能倒是個有意思的方向——以前 Vibe Coding 是用自然語言描述需求,現在是直接對著螢幕錄個影片講解,模型看影片寫程式碼。這條路能走通的話,會是一種很不一樣的程式設計互動方式。

參考來源:Qwen 3.5 Omni: Alibaba's AI Model Can Now Hear, Watch, and Clone Your Voice(Decrypt);Qwen3.5-Omni: 10-Hour Audio, 4M Frame Video, SOTA in 215 Benchmarks(StableLearn);CocoLoop、Alibaba Qwen Team Releases Qwen3.5 Omni(MarkTechPost)