Qwen casse les prix de toute sa gamme vocale, la reconnaissance chute jusqu'à 95%

Le 23 septembre, Qwen, filiale d'Alibaba, a présenté la série de modèles vocaux Qwen-Audio-3.1, avec cinq modèles lancés d'un coup couvrant la reconnaissance, la synthèse, le dialogue en temps réel et la création audio, tout en abaissant les prix de l'ensemble de sa gamme de produits vocaux : la synthèse vocale (TTS) baisse d'environ 70%, la voix en temps réel (Realtime) d'environ 85%, et la reconnaissance vocale (ASR) jusqu'à 95%.

Les cinq modèles se répartissent en deux catégories. Trois sont des mises à niveau de gammes existantes :

  • Qwen-Audio-3.1-ASR : un seul modèle prend en charge 30 langues et 16 dialectes chinois ; selon l'entreprise, il obtient les meilleurs résultats sur 11 sous-ensembles de test dialectaux, avec une amélioration nette sur des dialectes difficiles comme celui de Wenzhou, et un temps de réponse au premier caractère d'environ 160 millisecondes ;
  • Qwen-Audio-3.1-TTS : synthèse multilingue avec transfert de timbre entre langues, permettant de préciser le ton en langage naturel, par exemple en demandant de "lire d'un ton ferme et sans appel" ;
  • Qwen-Audio-3.1-Realtime : dialogue en duplex intégral, parole et écoute simultanées, interruptible à tout moment, avec prise en charge des appels d'outils ; selon l'entreprise, le modèle ralentit son débit lorsqu'il détecte une baisse de moral chez l'utilisateur.

Les deux autres sont des modèles entièrement nouveaux :

  • TTS-Next : un cadre unifié combinant modèle de langage et modèle de diffusion, capable de générer en une seule passe voix, effets sonores et musique de fond, destiné aux livres audio, podcasts, jeux vidéo et publicités ;
  • ASR-Next : capable de distinguer les interlocuteurs lors de conversations à plusieurs, en fournissant des horodatages et un texte aligné, tout en reconnaissant les émotions, les bruits d'ambiance et les sons mécaniques, utile pour la description audio, la localisation d'événements et les questions-réponses sur l'audio.

Bulletin des dialectes

Dans son dossier de présentation, Qwen a communiqué plusieurs chiffres sur les dialectes : le taux d'erreur moyen par caractère pour la reconnaissance des dialectes chinois est de 10,38%, et la précision sémantique moyenne par phrase pour la traduction dialectale est de 82,10%. Ce sont des chiffres issus de tests internes de l'entreprise, la composition de l'ensemble de test n'a pas été entièrement divulguée, et aucune reproduction indépendante par un tiers n'existe pour l'instant.

Pour les développeurs chinois, la reconnaissance des dialectes répond à un besoin bien réel. Dans le service client, les lignes directes des administrations ou les diffusions en direct de commerce électronique dans les zones rurales, la reconnaissance du mandarin standard est fiable, mais tout se brouille dès qu'un dialecte entre en jeu — un point de blocage fréquent pour le déploiement concret de nombreux produits vocaux. Réunir 16 dialectes dans un seul modèle évite au moins d'avoir à changer de modèle selon la région.

Face à ElevenLabs

Sur le terrain de la synthèse vocale, le point de comparaison à l'international est généralement ElevenLabs. Le service de routage tiers OrcaRouter a compilé une série de prix : la génération précédente, Qwen-Audio-3.0, coûtait environ 27,6 dollars par million de caractères pour le palier TTS Plus et environ 15 dollars pour le palier Flash ; ElevenLabs Eleven v3 coûte environ 100 dollars par million de caractères au tarif standard et environ 50 dollars au palier Flash.

En calculant grossièrement avec la baisse annoncée d'environ 70%, le palier Plus de la version 3.1 tomberait à un peu plus de 8 dollars par million de caractères. Ce n'est qu'une estimation : l'annonce elle-même ne donne que le pourcentage de baisse, les nouveaux prix précis dépendront de la grille tarifaire d'Alibaba Cloud Bailian.

Côté qualité, selon les données d'août de l'arène vocale d'Artificial Analysis, Qwen-Audio-3.0-TTS-Plus affichait un score Elo de 1234, contre 1168 pour Eleven v3. La version 3.1 du TTS ne figure pour l'instant dans aucune arène publique ; savoir si la qualité audio de la nouvelle version progresse ou recule ne repose donc, pour l'heure, que sur la parole du fabricant.

Cas d'usage

Cette fois, Qwen associe ses modèles vocaux à toute une série de produits maison : l'agent de programmation Qoder, Qwen Office, ainsi que des équipements comme QwenNote, A2, Eva, les lunettes IA Qwen et les lunettes IA Leqi. Des appareils comme les lunettes ou les dictaphones sollicitent les API vocales à la minute ou à l'usage, si bien que la baisse de 85 à 95% sur la reconnaissance et le dialogue en temps réel affecte le plus directement le coût de service par appareil pour les fabricants de matériel.

La baisse sur le dialogue en temps réel arrive en deuxième position. Un appel en temps réel doit généralement exécuter simultanément reconnaissance, inférence et synthèse, ce qui en fait l'une des catégories à coût unitaire le plus élevé parmi les produits vocaux ; la question de savoir si les assistants vocaux pourront rester durablement gratuits pour les utilisateurs après cette baisse dépendra de la politique tarifaire que chaque intégrateur adoptera au prochain trimestre.

Sources : annonce officielle de Qwen, ITHome, The Decoder, CocoLoop, compilation de prix d'OrcaRouter ; les pourcentages de baisse et les données de test dialectal proviennent des chiffres officiels de Qwen, les prix de la version précédente et d'ElevenLabs sont des compilations tierces, et les scores d'arène suivent le classement public d'Artificial Analysis.