Alibaba veröffentlicht Qwen3.5-Omni: Text, Audio, Video und Sprachklonierung in einem Modell

Am 30. März veröffentlichte das Qwen-Team von Alibaba Qwen3.5-Omni, das erste wirklich multimodale Modell des Unternehmens – es verarbeitet Text, Bilder, Audio und Video in einem einzigen Modell, anstatt eine zusammengesetzte Architektur aus mehreren spezialisierten Modellen zu verwenden.

Ein Modell, vier Modalitäten

Bisherige multimodale Systeme auf dem Markt arbeiteten meist nach dem Prinzip der "Arbeitsteilung": ein Modell für das Sehen, eines für das Hören und schließlich ein Textmodell zur Zusammenführung der Ausgaben. Qwen3.5-Omni ist anders und verwendet eine Thinker-Talker-Doppelarchitektur mit Mixed-Attention-MoE (30B Gesamtparameter, 3B pro Aktivierung), bei der alle Modalitäten im selben Parametersatz laufen.

Dies ermöglicht dem Modell bisher nicht mögliche Aufgaben:

  • Gemeinsames Verstehen von Audio und Video: Nach dem Ansehen eines Videos kann das Modell Fragen unter Berücksichtigung der darin enthaltenen Dialoge beantworten, ohne diese erst in Text umwandeln zu müssen.
  • Echtzeit-Sprachklonierung: Nach dem Hochladen einer Sprachprobe kann das Modell diese Stimme für nachfolgende Ausgaben nachbilden (derzeit über die API zugänglich).
  • Audio-Video-Vibe-Coding: Nehmen Sie eine Bildschirmaufnahme mit Erklärungen auf, und Qwen3.5-Omni generiert direkt den entsprechenden Code, ohne dass Sie tippen müssen.

Technische Daten im Überblick

Spezifikation Wert
Gesamtparameter 30B MoE
Aktivierte Parameter pro Durchlauf 3B
Kontextfenster 256K Token
Maximale Audiodauer 10+ Stunden
Maximale Videoverarbeitung 400 Sekunden 720p @1FPS
Spracherkennungssprachen 113
Sprachausgabesprachen 36

Drei Versionen: Plus (komplexe Spitzenaufgaben), Flash (ausgewogen zwischen Geschwindigkeit und Leistung), Light (leicht und schnell).

Benchmark-Ergebnisse

Das Modell erzielte SOTA-Ergebnisse in 215 Testdatensätzen und Benchmarks, wobei der Audiobereich direkt Gemini 3.1 Pro übertraf:

  • MMAU Audio-Gesamtverständnis: 82,2 gegenüber 81,1 von Gemini 3.1 Pro
  • Musikverständnis RUL-MuchoMusic: 72,4 gegenüber 59,6, ein deutlicher Abstand
  • Mehrsprachige Sprachklon-Stabilität: übertrifft ElevenLabs, GPT-Audio und Minimax

Die Echtzeit-Gesprächslatenz wurde auf 234 Millisekunden reduziert, unter Verwendung der ARIA-Technologie (Adaptive Rate Interleave Alignment), die den Sprachrhythmus dynamisch anpasst, sodass die Ausgabe natürlicher klingt und nicht wie ein mechanisches Ablesen.

Darüber hinaus blieben die allgemeinen Fähigkeiten erhalten: MMMU visuelles Verständnis 82,0 %, HumanEval Code 92,6 %, LibriSpeech Spracherkennung mit einer Wortfehlerrate von 1,7 %, allesamt in der Spitzenklasse.

Die Sprach-KI-Landschaft verändert sich

ElevenLabs war lange Zeit der Maßstab für Sprachklonierung, aber Qwen3.5-Omni übertrifft es in der mehrsprachigen Sprachstabilität. Noch wichtiger ist, dass es die Sprachklonierung zu einer integrierten Funktion eines umfassenden multimodalen Modells macht, anstatt zu einem separaten vertikalen Produkt.

Allerdings ist die Sprachklonierung derzeit nur über die API verfügbar und noch nicht in die Produktoberfläche integriert. Es wird erwartet, dass sie geöffnet wird, sobald die Kommerzialisierung Schritt hält.

Die Trainingsdaten des gesamten Modells umfassen über 100 Millionen Stunden Audio- und Videoinhalte – eine Größenordnung, die erforderlich ist, um ein wirklich modalitätsübergreifendes Verständnis zu ermöglichen.

Die Audio-Video-Vibe-Coding-Funktion ist eine interessante Richtung – früher erforderte Vibe Coding die Beschreibung von Anforderungen in natürlicher Sprache, jetzt nehmen Sie einfach eine Bildschirmaufnahme mit Erklärungen auf, das Modell sieht sich das Video an und schreibt den Code. Wenn dieser Ansatz funktioniert, wäre dies eine ganz andere Art der Programmierinteraktion.

Quellenangabe: Qwen 3.5 Omni: Alibaba's AI Model Can Now Hear, Watch, and Clone Your Voice (Decrypt); Qwen3.5-Omni: 10-Hour Audio, 4M Frame Video, SOTA in 215 Benchmarks (StableLearn); CocoLoop, Alibaba Qwen Team Releases Qwen3.5 Omni (MarkTechPost)