Zhipu passe GLM-5.3-Flash en open source, paramètres actifs réduits à 18 milliards

Le 26 août, Zhipu a levé le voile sur Ox Alpha, ce modèle qui tournait de façon anonyme depuis plus d'une semaine sur OpenCode et OpenRouter. Son nom officiel est GLM-5.3-Flash, et ses poids ont été mis en ligne le jour même sur HuggingFace, sous licence MIT.

Il s'agit du premier membre nativement multimodal de la série GLM-5. Le nombre total de paramètres atteint 320 milliards, mais chaque token n'en active que 18 milliards ; le nombre de couches est passé des 92 de GLM-5.3 à 45, et les paramètres actifs sont tombés des 32 milliards de la génération précédente à 18 milliards. Les économies de calcul se traduisent directement dans le prix : le tarif officiel affiché représente environ un dixième de celui de GLM-5.3, et pendant la période promotionnelle limitée, il est encore divisé par deux, ce qui équivaut à peu près à un quarantième du prix de Claude Opus 4.8. Selon un autre chiffre communiqué par Z.ai, au tarif réduit, le coût moyen pour mener une tâche à terme est de 0,045 dollar.

Paramètres réduits de moitié, le score n'a pas suivi

Sur l'Intelligence Index v4.1.1 d'Artificial Analysis, GLM-5.3-Flash obtient 57 points, entrant dans la fourchette des modèles de pointe mondiaux, au même niveau qu'Opus 4.8, actuellement le modèle le plus populaire d'Anthropic. Les écarts sont plus marqués sur les tests individuels : DeepSWE v1.1 passe de 46,2 points pour GLM-5.2 à 63,4 ; Terminal-Bench 2.1 atteint 84,3 ; Toolathlon Verified, 78,4 ; AutomationBench v1.0.6, 48,8. Sur le Z.ai Code Bench maison de Zhipu, au niveau de difficulté le plus élevé, le modèle obtient 29,0, contre 29,5 pour le groupe témoin Opus.

Le multimodal est la nouveauté de cette génération : OfficeQA Pro atteint 62,4, CharXiv avec raisonnement outillé 89,4, Chartography avec outils 78,0, et côté vidéo, MVBench affiche 77,8 et MMVU, 80,5. Cette combinaison vise davantage un « agent de bureau capable de lire des tableaux et des plans » qu'une simple vitrine de scores de compréhension d'image généraliste.

Côté architecture, c'est le premier modèle ouvert de pointe à combiner attention parcimonieuse (sparse attention) et attention linéaire (linear attention), en y ajoutant IndexPool et mHC (hyper-connexions à contrainte de variété). L'effet se voit dans deux chiffres : par rapport à GLM-5.3, le volume de calcul d'attention tombe à environ un tiers (réduction de 3,0 fois), et le cache KV à environ un quart (réduction de 4,4 fois). Sur les longs contextes, l'essentiel du coût provient justement du cache KV ; c'est ce ratio qui détermine si une fenêtre d'un million de tokens est réellement exploitable, et pas seulement une ligne sur une fiche technique.

Tout le trafic tourne sur des puces nationales

Pendant la phase de test anonyme, Ox Alpha a été, à certains moments, le modèle le plus sollicité sur OpenCode. Zhipu affirme que tout le trafic d'inférence de cette période a été pris en charge par des puces IA chinoises, que les performances du service de bout en bout ont été multipliées par 3 par rapport à avant, et que les coûts sont désormais alignés sur ceux des solutions GPU Nvidia grand public.

Cette information ne vaut pas moins que les scores de benchmarks. Le récit dominant des modèles ouverts chinois au cours de l'année écoulée était : « des scores proches, mais un déploiement qui dépend encore des cartes de la série H ». Dès lors que le volet inférence peut tourner à pleine charge sur du silicium national avec un coût unitaire équivalent, la marge de manœuvre tarifaire des fabricants de modèles n'est plus contrainte par le prix d'achat des cartes. Une partie de l'audace de GLM-5.3-Flash à ramener son prix affiché à un dixième de la génération précédente vient de là.

Un calcul rapide : au tarif promotionnel limité de 0,075 dollar par million de tokens en entrée et 0,25 dollar par million de tokens en sortie, une application de type Agent de taille moyenne, consommant en moyenne 50 millions de tokens en entrée et 10 millions en sortie par jour, afficherait une facture de modèle d'environ 6,25 dollars par jour (estimation approximative, hors remises de cache et nouvelles tentatives en cas d'échec). Avec le même volume d'appels sur Opus 4.8, l'écart est d'un ordre de grandeur. Pour les équipes chinoises qui développent des produits Agent, cela ramène la question « peut-on passer en production ? » du terrain budgétaire au terrain de l'ingénierie.

Côté déploiement, SGLang, vLLM et KTransformers prennent déjà le modèle en charge, et l'API a été mise en ligne simultanément sur docs.z.ai. La licence MIT constitue cette fois une démarche rare : les générations précédentes de GLM utilisaient le plus souvent une licence maison, alors que sous MIT, la redistribution commerciale n'est quasiment assortie d'aucune condition supplémentaire, et les équipes situées hors de Chine peuvent le modifier sans repasser par un service juridique.

Une semaine plus tôt, Zhipu avait déjà reconnu publiquement qu'Ox Alpha était sa propre itération, avec des chiffres montrant à l'époque un volume d'appels plus de deux fois supérieur à celui de DeepSeek. Désormais, le nom, les poids et le prix sont tous les trois sur la table ; reste à savoir combien d'équipes seront prêtes à le faire passer du statut de « modèle de test bon marché » à celui de modèle principal en production.

Sources : blog officiel de Z.ai, page du modèle sur HuggingFace, CocoLoop, Artificial Analysis ; l'ampleur des paramètres, les scores de benchmarks et les tarifs de l'API ont été vérifiés d'après la page de lancement officielle.