Le 30 mars, l'équipe Qwen d'Alibaba a publié Qwen3.5-Omni, son premier modèle véritablement multimodal — traitant texte, images, audio et vidéo dans un seul modèle, plutôt qu'une architecture composite de plusieurs modèles spécialisés.
Un modèle, quatre modalités
Les systèmes multimodaux précédents sur le marché fonctionnaient principalement selon le principe de la « division du travail » : un modèle pour la vision, un pour l'audition, et enfin un modèle de texte pour consolider les sorties. Qwen3.5-Omni est différent, utilisant une architecture double Thinker-Talker avec MoE à attention mixte (30B paramètres totaux, activant 3B à chaque fois), toutes les modalités fonctionnant sur le même ensemble de paramètres.
Cela permet au modèle d'effectuer des tâches auparavant impossibles :
- Compréhension conjointe audio et vidéo : Après avoir regardé une vidéo, le modèle peut répondre en se basant à la fois sur le contenu visuel et la parole qu'elle contient, sans avoir à transcrire l'audio au préalable.
- Clonage vocal en temps réel : Téléchargez un échantillon vocal, et le modèle peut reproduire ce timbre pour les sorties suivantes (actuellement accessible via API).
- Vibe Coding audio et vidéo : Enregistrez l'écran avec des explications vocales, et Qwen3.5-Omni génère directement le code correspondant, sans avoir à taper.
Aperçu des spécifications
| Spécification | Valeur |
|---|---|
| Paramètres totaux | 30B MoE |
| Paramètres activés par passage | 3B |
| Fenêtre de contexte | 256K tokens |
| Durée audio maximale | 10 heures+ |
| Traitement vidéo maximal | 400 secondes 720p @1FPS |
| Langues de reconnaissance vocale | 113 |
| Langues de sortie vocale | 36 |
Trois versions : Plus (tâches complexes de pointe), Flash (équilibre entre vitesse et performance), Light (léger et rapide).
Performances des benchmarks
Le modèle a obtenu des résultats SOTA sur 215 ensembles de données de test et benchmarks, la partie audio dépassant directement Gemini 3.1 Pro :
- MMAU compréhension audio complète : 82,2 contre 81,1 pour Gemini 3.1 Pro
- Compréhension musicale RUL-MuchoMusic : 72,4 contre 59,6, un écart significatif
- Stabilité du clonage vocal multilingue : dépasse ElevenLabs, GPT-Audio et Minimax
La latence de conversation en temps réel a été réduite à 234 millisecondes, en utilisant la technologie ARIA (Adaptive Rate Interleave Alignment) pour ajuster dynamiquement le rythme de la parole, rendant la sortie plus naturelle plutôt qu'une lecture mécanique.
De plus, les capacités générales n'ont pas été compromises : MMMU compréhension visuelle 82,0 %, HumanEval code 92,6 %, LibriSpeech reconnaissance vocale avec un taux d'erreur de mots de 1,7 %, tous dans le peloton de tête.
Le paysage de l'IA vocale évolue
ElevenLabs a longtemps été la référence en matière de clonage vocal, mais Qwen3.5-Omni le dépasse en stabilité vocale multilingue. Plus important encore, il fait du clonage vocal une fonctionnalité intégrée d'un modèle multimodal complet, plutôt qu'un produit vertical distinct.
Bien sûr, le clonage vocal n'est actuellement disponible que via API, pas encore dans l'interface produit, et devrait être ouvert lorsque la commercialisation suivra.
Les données d'entraînement de l'ensemble du modèle utilisent plus de 100 millions d'heures de contenu audio et vidéo, une échelle nécessaire pour soutenir une compréhension véritablement multimodale.
La fonctionnalité Vibe Coding audio et vidéo est une direction intéressante — auparavant, Vibe Coding nécessitait de décrire les besoins en langage naturel ; maintenant, il suffit d'enregistrer l'écran avec des explications, le modèle regarde la vidéo et écrit le code. Si cette voie est viable, ce sera une façon très différente d'interagir en programmation.
Source de référence : Qwen 3.5 Omni: Alibaba's AI Model Can Now Hear, Watch, and Clone Your Voice (Decrypt) ; Qwen3.5-Omni: 10-Hour Audio, 4M Frame Video, SOTA in 215 Benchmarks (StableLearn) ; CocoLoop, Alibaba Qwen Team Releases Qwen3.5 Omni (MarkTechPost)