Alibabas Qwen hat am 23. September die Modellreihe Qwen-Audio-3.1 vorgestellt und dabei gleich fünf Sprachmodelle veröffentlicht, die Erkennung, Synthese, Echtzeit-Dialog und Audioerstellung abdecken. Gleichzeitig senkt Qwen die Preise für die gesamte Sprachproduktlinie: Sprachsynthese (TTS) wird um rund 70% günstiger, Echtzeit-Sprache (Realtime) um rund 85%, Spracherkennung (ASR) um bis zu 95%.
Die fünf Modelle lassen sich in zwei Gruppen einteilen. Drei sind Upgrades bestehender Produktlinien:
- Qwen-Audio-3.1-ASR: Ein einzelnes Modell unterstützt 30 Sprachen und 16 chinesische Dialekte. Laut Hersteller erzielt es die besten Ergebnisse in 11 Dialekt-Testreihen, bei besonders schwierigen Dialekten wie dem Wenzhou-Dialekt sei die Verbesserung deutlich spürbar, die Reaktionszeit bis zum ersten Zeichen liegt bei rund 160 Millisekunden;
- Qwen-Audio-3.1-TTS: Mehrsprachige Synthese mit sprachübergreifender Stimmübertragung; der Tonfall lässt sich per natürlicher Sprache festlegen, etwa mit der Anweisung, "in einem harten, unnachgiebigen Ton vorzulesen";
- Qwen-Audio-3.1-Realtime: Vollduplex-Dialog, gleichzeitiges Sprechen und Zuhören, jederzeit unterbrechbar, mit Unterstützung für Tool-Aufrufe; laut Hersteller verlangsamt das Modell sein Sprechtempo, wenn es eine gedrückte Stimmung beim Nutzer erkennt.
Zwei Modelle sind komplett neu:
- TTS-Next: Ein einheitliches Framework aus Sprachmodell und Diffusionsmodell, das in einem Durchgang Stimme, Soundeffekte und Hintergrundmusik erzeugt, gedacht für Hörbücher, Podcasts, Spiele und Werbung;
- ASR-Next: Kann bei mehreren Sprechern zwischen den Stimmen unterscheiden, liefert Zeitstempel und abgeglichenen Text und erkennt zusätzlich Emotionen, Umgebungsgeräusche und maschinelle Geräusche für Audio-Beschreibungen, Ereigniserkennung und Audio-Frage-Antwort.
Dialekt-Ergebnisse
In den Veröffentlichungsmaterialien nennt Qwen mehrere Dialektwerte: Die durchschnittliche Zeichenfehlerrate bei der Erkennung chinesischer Dialekte liegt bei 10,38%, die durchschnittliche semantische Satzgenauigkeit bei der Dialektübersetzung bei 82,10%. Dabei handelt es sich um herstellereigene Tests, die Zusammensetzung der Testdaten wurde nicht vollständig offengelegt, unabhängige Nachtests gibt es bisher nicht.
Für Entwickler in China ist die Dialekterkennung ein handfestes Bedürfnis. Im Kundenservice, bei Behörden-Hotlines und bei E-Commerce-Livestreams auf Kreisebene erkennen Modelle Hochchinesisch zuverlässig, scheitern aber oft, sobald Dialekt gesprochen wird – ein Punkt, an dem viele Sprachprodukte in der Praxis hängenbleiben. 16 Dialekte in einem einzigen Modell zu vereinen, erspart zumindest den Aufwand, je nach Region das Modell zu wechseln.
Im Vergleich zu ElevenLabs
Bei der Sprachsynthese ist ElevenLabs international der übliche Vergleichsmaßstab. Der Drittanbieter-Router-Dienst OrcaRouter hat eine Preisübersicht zusammengestellt: Die Vorgängerversion Qwen-Audio-3.0 kostete in der TTS-Plus-Stufe rund 27,6 US-Dollar pro Million Zeichen, in der Flash-Stufe rund 15 US-Dollar; ElevenLabs Eleven v3 kostet im Standardtarif rund 100 US-Dollar pro Million Zeichen, im Flash-Tarif rund 50 US-Dollar.
Grob gerechnet mit der genannten Senkung von rund 70% würde die Plus-Stufe der Version 3.1 auf etwas über 8 US-Dollar pro Million Zeichen fallen. Das ist nur eine Schätzung – die Ankündigung selbst nennt nur die Rabattspanne, die konkreten neuen Preise richten sich nach der Preisliste von Alibaba Cloud Bailian.
Bei der Qualität lag Qwen-Audio-3.0-TTS-Plus in den August-Daten der Sprach-Arena von Artificial Analysis bei einem Elo-Wert von 1234, Eleven v3 bei 1168. Die Version 3.1 der TTS ist bislang in keiner öffentlichen Arena gelistet, ob die Klangqualität der neuen Version besser oder schlechter ausfällt, lässt sich derzeit nur anhand der Herstellerangaben beurteilen.
Einsatzbereiche
Qwen verknüpft die Sprachmodelle diesmal mit einer Reihe eigener Produkte: dem Coding-Agenten Qoder, Qwen Office sowie Hardware wie QwenNote, A2, Eva, der Qwen-KI-Brille und der Leqi-KI-Brille. Geräte wie Brillen oder Diktiergeräte rufen die Sprach-APIs minuten- oder nutzungsbasiert auf, sodass die Preissenkung von 85 bis 95% bei Erkennung und Echtzeit-Dialog sich am unmittelbarsten auf die Servicekosten pro Gerät bei Hardware-Herstellern auswirkt.
Der zweitgrößte Preisnachlass betrifft den Echtzeit-Dialog. Ein Echtzeit-Gespräch muss in der Regel gleichzeitig Erkennung, Inferenz und Synthese ausführen und gehört damit zu den Sprachprodukten mit vergleichsweise hohen Stückkosten. Ob Sprachassistenten nach dieser Preissenkung dauerhaft kostenlos für Nutzer bleiben können, hängt von der Preisgestaltung der jeweiligen Anbieter im kommenden Quartal ab.
Quellen: offizielle Ankündigung von Qwen, ITHome, The Decoder, CocoLoop, Preisübersicht von OrcaRouter; Rabattangaben und Dialekt-Testdaten stammen von Qwen selbst, Preise der Vorgängerversion und von ElevenLabs sind Drittanbieter-Zusammenstellungen, die Arena-Werte basieren auf dem öffentlichen Ranking von Artificial Analysis.