Qwen3.8-Max en tête du classement de programmation, à un quart du prix du deuxième

L'équipe Qwen d'Alibaba a mis à jour son modèle phare Qwen3.8-Max vers la version 0902, en y ajoutant un nouveau cycle de post-entraînement axé sur la programmation et les tâches bureautiques professionnelles. Dans le classement général de programmation frontend de Code Arena, cette version obtient 1691 points et se classe première, soit 22 points de plus que la version précédente.

Un autre chiffre communiqué par Alibaba en même temps révèle encore mieux la position visée : le prix moyen combiné de la nouvelle version est d'environ 5 dollars par million de tokens, tandis que les deuxième et troisième du classement facturent respectivement 20 et 12 dollars.

22 points et 15 dollars

L'écart en tête de classement était déjà faible. Entre les 1691 points et la version précédente, il n'y a que 22 points, un écart de cet ordre étant souvent rattrapé en une ou deux semaines lors d'évaluations humaines à l'aveugle. Ce qui creuse vraiment l'écart se trouve dans la colonne d'à côté : pour la même tâche de programmation frontend, passer au modèle classé deuxième quadruple la facture.

Selon des informations publiques, le prix de l'API de la nouvelle version est de 2 dollars par million de tokens en entrée et 6 dollars par million de tokens en sortie. En recalculant ces deux chiffres à partir du prix moyen officiel de 5 dollars (estimation approximative), les tokens de sortie devraient représenter environ trois quarts de l'usage total pour aboutir à ce chiffre de 5. Cette proportion n'a rien d'étonnant pour les tâches de programmation frontend : le contexte du prompt ne compte souvent que quelques centaines de lignes, alors que le modèle restitue des pages entières de code de composants, la sortie absorbe naturellement l'essentiel. Ce prix moyen de 5 dollars est calculé sur la structure d'usage réelle de 'l'écriture de code' ; pour des tâches comme le résumé de longs documents, où l'entrée est lourde et la sortie légère, le prix effectif serait encore plus bas.

Pour les équipes chinoises, ce repère tarifaire est très clair. Au cours de l'année écoulée, les entreprises ayant intégré la programmation par agents dans leur production se sont souvent heurtées au service financier : que le modèle écrive juste ou non n'est plus la question depuis longtemps, la vraie question est de savoir si une facture quotidienne de plusieurs millions de tokens peut être validée. Égaler le score des meilleurs tout en réduisant le prix au quart pèse plus lourd dans la décision d'achat que 22 points supplémentaires à eux seuls.

2 400 milliards de paramètres, 95 milliards à l'œuvre

Derrière la version 0902 se trouve la base Qwen3.8-2.4T-A95B. Sur un total de 2 400 milliards de paramètres, chaque passe avant n'en active qu'environ 95 milliards, une architecture MoE (mélange d'experts) parcimonieuse typique : parmi 512 experts, chaque token en active 11, dont 10 acheminés par routage et 1 expert partagé.

Les choix structurels favorisent eux aussi les tâches longues. Le modèle compte 23 couches, alternant Gated DeltaNet et Gated Attention, avec un contexte natif de 262 144 tokens, extensible à environ 1,01 million. Le mélange d'attention linéaire et d'attention à portes est une direction suivie depuis six mois par plusieurs équipes chinoises travaillant sur les longs contextes, avec un objectif clair : ramener la consommation de mémoire et le coût d'inférence des longs contextes à un niveau commercialement viable, sinon, un contexte d'un million de tokens n'est qu'un chiffre flatteur sur une fiche technique.

Le taux d'activation explique aussi d'où vient ce prix de 5 dollars. Les 2 400 milliards de paramètres au total déterminent la capacité de connaissance du modèle, tandis que les 95 milliards activés déterminent le coût en 'électricité' de chaque appel. À ce degré de parcimonie, le coût d'inférence par unité est naturellement bien inférieur à celui d'un modèle dense de taille équivalente.

L'interface est déjà déployée sur toute la gamme de produits maison

La nouvelle version est désormais directement accessible via le service API de la plateforme Qwen AI, et a été intégrée simultanément à Qwen Office, à Qoder et à l'application Qwen. Les clients entreprises, les développeurs et le grand public sont ainsi débloqués d'un seul coup, sans fenêtre de déploiement progressif.

Alibaba positionne cette version comme 'plus adaptée aux tâches complexes réelles des entreprises, à la recherche scientifique et aux tâches de longue durée', affirmant que le modèle a 'repoussé un nouveau plafond mondial' en matière de raisonnement multi-étapes, d'appel d'outils et de génération d'applications de bout en bout. La seconde partie relève du discours commercial, mais la première, sur les 'tâches de longue durée', correspond bien aux deux choix techniques que sont le contexte d'1,01 million de tokens et l'activation parcimonieuse : ce n'est qu'en pouvant charger une base de code entière d'un coup, sans faire exploser les coûts, qu'on peut envisager de faire tourner un modèle en continu pendant des heures.

La convention de nommage révèle elle aussi le rythme adopté. Qwen3.8-Max utilise la date comme numéro de sous-version, ce qui montre qu'Alibaba adopte, sur sa ligne Max en code fermé, un rythme d'itérations rapides à petits pas : la génération du modèle reste la même, mais les capacités s'accumulent en continu. Depuis le passage de 3.6-Max au code fermé, le rôle de la série Max s'est distingué de celui de la série Flash, en open source : l'une se charge de dominer les classements et les budgets des entreprises, l'autre d'étendre l'écosystème des développeurs. Cette fois, la version 0902, en ramenant le prix au quart de celui du haut du classement, resserre encore un peu plus cette répartition des rôles entre les deux lignes.

Sources: Annonce officielle d'Alibaba Qwen, CocoLoop, page du classement de programmation frontend de Code Arena, ITHome, fiche du modèle sur Hugging Face ; les données de 1691 points et de la hausse de 22 points, les prix moyens de 5/20/12 dollars par million de tokens, ainsi que les 2 400 milliards de paramètres au total et les 95 milliards de paramètres activés ont tous été vérifiés point par point.