Vào ngày 30 tháng 3, nhóm Qwen của Alibaba đã phát hành Qwen3.5-Omni, mô hình toàn diện thực sự đầu tiên của họ — xử lý văn bản, hình ảnh, âm thanh và video trong cùng một mô hình, thay vì kiến trúc ghép nối nhiều mô hình chuyên biệt.
Một mô hình, bốn phương thức
Các hệ thống đa phương thức trước đây trên thị trường chủ yếu hoạt động theo kiểu "phân công lao động": một mô hình cho thị giác, một mô hình cho thính giác, và cuối cùng là một mô hình văn bản để tổng hợp đầu ra. Qwen3.5-Omni khác biệt, sử dụng kiến trúc kép Thinker-Talker với MoE chú ý hỗn hợp (tổng 30B tham số, kích hoạt 3B mỗi lần), tất cả các phương thức chạy trên cùng một bộ tham số.
Điều này cho phép mô hình thực hiện những việc trước đây không thể:
- Hiểu kết hợp âm thanh và video: Sau khi xem một đoạn video, mô hình có thể trả lời dựa trên cả nội dung hình ảnh và giọng nói trong video, thay vì phải chuyển đổi giọng nói thành văn bản trước.
- Nhân giọng nói thời gian thực: Tải lên một mẫu giọng nói, mô hình có thể tái tạo âm sắc đó cho các đầu ra tiếp theo (hiện có thể truy cập qua API).
- Vibe Coding với âm thanh và video: Ghi lại màn hình với lời giải thích, Qwen3.5-Omni trực tiếp tạo mã nguồn tương ứng mà không cần gõ chữ.
Thông số kỹ thuật
| Thông số | Giá trị |
|---|---|
| Tổng tham số | 30B MoE |
| Tham số kích hoạt mỗi lần | 3B |
| Cửa sổ ngữ cảnh | 256K token |
| Thời lượng âm thanh tối đa | 10 giờ+ |
| Xử lý video tối đa | 400 giây 720p @1FPS |
| Số ngôn ngữ nhận dạng giọng nói | 113 |
| Số ngôn ngữ đầu ra giọng nói | 36 |
Ba phiên bản: Plus (tác vụ phức tạp hàng đầu), Flash (cân bằng tốc độ và hiệu suất), Light (nhẹ và nhanh).
Hiệu suất điểm chuẩn
Mô hình đạt SOTA trên 215 bộ dữ liệu thử nghiệm và điểm chuẩn, trong đó phần âm thanh vượt qua Gemini 3.1 Pro:
- MMAU hiểu tổng hợp âm thanh: 82,2 so với 81,1 của Gemini 3.1 Pro
- Hiểu nhạc RUL-MuchoMusic: 72,4 so với 59,6, cách biệt đáng kể
- Độ ổn định nhân giọng nói đa ngôn ngữ: vượt qua ElevenLabs, GPT-Audio và Minimax
Độ trễ hội thoại thời gian thực được giảm xuống còn 234 mili giây, sử dụng công nghệ ARIA (Adaptive Rate Interleave Alignment) để điều chỉnh nhịp điệu giọng nói một cách linh hoạt, giúp đầu ra nghe tự nhiên hơn thay vì đọc máy móc.
Ngoài ra, khả năng tổng quát không bị suy giảm: MMMU hiểu thị giác 82,0%, HumanEval mã 92,6%, LibriSpeech nhận dạng giọng nói với tỷ lệ lỗi từ 1,7%, tất cả đều ở hàng đầu.
Bối cảnh AI giọng nói đang thay đổi
ElevenLabs từ lâu đã là tiêu chuẩn trong lĩnh vực nhân giọng nói, nhưng Qwen3.5-Omni đã vượt qua nó về độ ổn định giọng nói đa ngôn ngữ. Quan trọng hơn, nó biến nhân giọng nói thành một tính năng tích hợp của mô hình đa phương thức toàn diện, thay vì một sản phẩm độc lập.
Tất nhiên, nhân giọng nói hiện chỉ khả dụng qua API, chưa có trong giao diện sản phẩm, có lẽ sẽ được mở rộng khi thương mại hóa theo kịp.
Dữ liệu huấn luyện của toàn bộ mô hình sử dụng hơn 100 triệu giờ nội dung âm thanh và video, một khối lượng đủ lớn để hỗ trợ khả năng hiểu đa phương thức thực sự.
Tính năng Vibe Coding với âm thanh và video là một hướng đi thú vị — trước đây Vibe Coding yêu cầu mô tả nhu cầu bằng ngôn ngữ tự nhiên, giờ đây bạn chỉ cần ghi lại màn hình với lời giải thích, mô hình xem video và viết mã. Nếu hướng đi này khả thi, nó sẽ là một cách tương tác lập trình rất khác biệt.
Nguồn tham khảo: Qwen 3.5 Omni: Alibaba's AI Model Can Now Hear, Watch, and Clone Your Voice (Decrypt); Qwen3.5-Omni: 10-Hour Audio, 4M Frame Video, SOTA in 215 Benchmarks (StableLearn); CocoLoop, Alibaba Qwen Team Releases Qwen3.5 Omni (MarkTechPost)