Le 19 septembre, l'équipe Qwen d'Alibaba a présenté Qwen3.8-LiveTranslate, un modèle d'interprétation simultanée en temps réel qui fait passer la latence moyenne par caractère de 2,8 secondes, sur la génération précédente, à 2,3 secondes. Le modèle comprend 60 langues et produit de la voix dans 29 langues ; une page de démonstration et une API ont été ouvertes en même temps.
La difficulté de l'interprétation simultanée ne tient pas à la qualité de la traduction elle-même, mais à l'arbitrage entre qualité et latence. Plus le modèle attend de mots, plus la structure de la phrase est complète et la traduction précise ; plus l'attente est longue, plus il est difficile pour l'auditoire de suivre. Cette demi-seconde gagnée est le fil conducteur de cette annonce.
Interleave entrelace les trois étapes
Le modèle repose sur une architecture à deux modules, Thinker-Talker, bâtie sur un Hybrid MoE. Le Thinker traite les entrées audio et vidéo et effectue la traduction, tandis que le Talker génère la voix en conservant le timbre du locuteur d'origine. Les deux modules sont reliés par un mécanisme d'Interleave qui entrelace trois étapes : la compréhension en flux continu, la production du texte et la génération de la voix.
L'intérêt de cette architecture est que les trois étapes n'attendent plus tour à tour que les précédentes se terminent. La méthode classique consiste à écouter un segment jusqu'au bout, à le traduire, puis à le synthétiser, chaque étape devant accumuler suffisamment d'entrée avant de démarrer ; l'Interleave permet à l'étape suivante de commencer avant même que la précédente ne soit achevée, ce qui fait baisser la latence. Le prix à payer est une exigence bien plus élevée de stabilité du traitement en flux continu : si la compréhension de la première moitié de phrase se trompe, la voix de la seconde moitié a déjà été diffusée.
Outre la latence, cette version ajoute trois nouvelles capacités : séparation des locuteurs en temps réel avec conservation du timbre de chacun, affichage du texte original et de la traduction sur la même image et le même écran, et levée d'ambiguïté sur un contexte long. Les deux premières répondent à un besoin essentiel en réunion, en permettant de distinguer qui parle quand plusieurs personnes s'expriment en même temps et de comparer traduction et original côte à côte ; la troisième vise les cas où le sens d'un mot dépend du contexte qui précède et qui suit.
Deux jeux d'évaluation, une couverture qui varie du simple au quintuple
Alibaba présente deux jeux de données. Le premier, sur le corpus de test audio public FLEURS, couvre 70 directions linguistiques ; selon Alibaba, le modèle y devance la génération précédente ainsi que les principaux systèmes d'interprétation simultanée en temps réel actuels sur quatre dimensions : qualité de traduction, latence moyenne par caractère, précision de la reconnaissance vocale et qualité de la synthèse vocale. Le second, sur Omnilingua-MSpeaker, un benchmark audio long multi-locuteurs constitué en interne par Alibaba, couvre 14 directions linguistiques et compare la fidélité de la traduction, la fluidité, la concision et le taux d'erreur d'identification des locuteurs.
La couverture des deux jeux varie du simple au quintuple, et c'est justement le jeu à la couverture la plus étroite qui mesure la capacité de séparation des locuteurs, mise en avant comme l'atout principal de cette version. Le corpus public ne comporte pas de métrique équivalente pour les scénarios multi-locuteurs, si bien qu'une reproduction externe ne peut partir, pour l'instant, que des 70 directions de FLEURS. Quant à l'ampleur exacte de l'avance sur chacune des quatre dimensions, les documents officiels ne donnent pas de chiffres poste par poste.
En comparaison, où se situent les concurrents de cette catégorie
L'interprétation simultanée en temps réel repose aujourd'hui sur plusieurs approches technologiques distinctes. La première enchaîne trois briques déjà matures, reconnaissance vocale, traduction automatique et synthèse vocale ; l'ingénierie y est éprouvée et chaque brique remplaçable, mais la latence dépasse généralement 3 secondes. La seconde est un modèle de bout en bout, de la voix à la voix, avec une latence faible mais une couverture linguistique souvent limitée. Les chiffres annoncés par Qwen3.8-LiveTranslate, 60 langues comprises et 29 parlées, combinés à une latence de 2,3 secondes, se situent entre ces deux approches, plutôt du côté du bout en bout.
Pour une comparaison sérieuse, il faudrait des chiffres établis sur le même corpus de test et la même direction linguistique. Pour l'instant, la seule comparaison publique disponible est celle d'Alibaba lui-même ; aucune reproduction indépendante par un tiers sur FLEURS n'est encore apparue.
Ce qui n'a pas encore été dit
Cette annonce n'a évoqué ni l'open source ni les conditions de licence, et le prix de l'API n'a pas non plus été publié. Au vu du rythme adopté par Alibaba cette année avec la série Qwen, la plupart des modèles de catégorie Flash sont d'abord mis à disposition via l'API avant que les poids ne soient publiés ; reste à savoir si ce modèle suivra le même schéma, l'entreprise ne s'est pas encore exprimée sur ce point.
Des scénarios comme les réunions, les diffusions en direct ou le service client transfrontalier exigent de l'interprétation simultanée bien plus qu'un simple chiffre de latence. La vitesse de récupération après une erreur de découpage des phrases, la robustesse face aux accents, la cohérence des noms propres : tout cela ne se vérifie qu'à l'épreuve d'un audio réel. La page de démonstration est déjà ouverte, la réponse est entre les mains de ceux qui l'utilisent.
Sources : annonce officielle d'Alibaba Qwen, CocoLoop, Tencent News, Ifeng ; les valeurs de latence, le nombre de langues et la couverture des directions linguistiques des deux jeux d'évaluation ont été vérifiés d'après les indications officielles, l'ampleur exacte de l'avance sur les quatre dimensions n'ayant pas été détaillée poste par poste par l'entreprise.