Zhipu lance GLM-5.3-FlashX : 5 fois plus rapide, 2,5 fois plus cher

Zhipu a lancé GLM-5.3-FlashX le 18 septembre, avec l'API ouverte en parallèle, sous l'identifiant GLM-5.3-FlashX. Le seul indicateur officiel publié est une vitesse de sortie maximale de 200 tokens par seconde, soit, selon Zhipu, cinq fois celle de l'actuel GLM-5.3-Flash.

Les capacités du modèle dans cette gamme n'ont pas bougé. Selon la documentation ouverte, Flash et FlashX partagent les mêmes spécifications : une fenêtre de contexte d'un million de tokens, une sortie maximale de 128 000 tokens, une entrée compatible vidéo, image, texte et fichiers, une sortie en texte, avec mode de raisonnement, appel d'outils, diffusion en continu, mise en cache du contexte et sortie structurée en JSON. La différence est énoncée clairement : FlashX gagne en débit, Flash conserve le prix le plus bas.

Le prix grimpe avec la vitesse

Selon des informations publiques, le tarif est de 2 yuans par million de tokens en entrée et 7 yuans par million de tokens en sortie, soit 2,5 fois la gamme Flash d'origine. Zhipu n'a pas mis ce point en avant dans son annonce officielle, et sur les réseaux sociaux, la discussion porte presque entièrement sur cet échange vitesse contre coût.

En remontant avec le facteur 2,5, le prix de sortie de la gamme Flash se situe à environ 2,8 yuans par million de tokens. Pour une activité d'agents consommant en moyenne 1 milliard de tokens de sortie par jour, le coût mensuel de la sortie avec Flash avoisine 84 000 yuans, contre environ 210 000 yuans avec FlashX — l'écart de 126 000 yuans achète le même volume de travail, mais exécuté plus vite. La rentabilité dépend de si l'activité est bridée par la latence du premier token et la longueur de la file d'attente : pour les produits conversationnels, les sous-titres en temps réel ou la complétion de code, où une seconde de retard pèse déjà lourd, 200 tokens par seconde et un peu plus de quarante tokens par seconde relèvent de deux expériences différentes ; pour le traitement par lots hors ligne, l'analyse de documents ou les traitements de données de nuit, où quelques minutes de plus ne coûtent rien, continuer avec Flash reste plus adapté.

D'où viennent ces 200 tokens par seconde

L'explication de Zhipu est que, sur la base de la puissance d'inférence de 100 000 puces nationales, l'optimisation de l'inférence a été renforcée. La phrase reste vague : l'annonce ne précise pas si l'optimisation porte sur le décodage spéculatif, l'ordonnancement parallèle ou l'organisation de la mémoire ; on ne sait pas non plus si ces 100 000 puces couvrent uniquement le cluster propre de l'entreprise ou incluent des partenaires.

Le prédécesseur de FlashX a un passé public. GLM-5.3-Flash a circulé un temps sous le nom de code Ox Alpha dans les cercles de développeurs à l'étranger, avec un volume d'appels que Zhipu a affirmé, à un moment, dépasser le double de celui de DeepSeek. De Ox Alpha à Flash puis à FlashX, la logique de Zhipu sur cette ligne de produits reste constante : d'abord utiliser des prix bas pour faire grimper le volume d'appels, comprendre la forme réelle de la charge, puis facturer par palier de vitesse. Lors du lancement officiel de GLM-5.3, le prix de sortie par million de tokens était affiché à 4,4 dollars ; la gamme Flash a réduit les paramètres activés à 18 milliards pour comprimer les coûts ; FlashX est un cran supplémentaire sur la même courbe, du côté de la vitesse.

Ce que signale cette hausse de prix

Le mouvement par défaut des grands modèles chinois depuis plus d'un an a été la baisse des prix : le premier à baisser rafle le volume. FlashX fait l'inverse : mêmes capacités, prix plus élevé, vendu comme de la vitesse. Cela ne fonctionne que si l'offre côté inférence n'est plus infiniment bon marché, et si la marge de concurrence du cluster devient elle-même quelque chose que l'on peut tarifer.

Pour savoir si cela tient, deux éléments à surveiller : si des concurrents nationaux du même segment suivent avec des hausses de prix dans les semaines à venir, et si FlashX parvient à tenir le plafond de 200 tokens par seconde en période de forte concurrence. Aucune donnée de test de charge indépendante n'est publique pour l'instant.

Sources : documentation de la plateforme ouverte de Zhipu, annonce officielle de Zhipu, CocoLoop, Sina Technology, Chinaz ; les spécifications de vitesse et de contexte ont été vérifiées avec la documentation officielle, les prix selon des informations publiques.