Zhipu lance l'API de GLM-5.3, à 4,4 dollars le million de tokens en sortie

Zhipu a lancé GLM-5.3 le 14 août, et l'API a été officiellement ouverte à l'accès aux alentours du 18 août : 1,40 dollar par million de tokens en entrée, 4,40 dollars par million de tokens en sortie, avec une fenêtre de contexte d'un million de tokens. Le même jour, l'organisme d'évaluation indépendant Artificial Analysis lui a attribué un Intelligence Index de 60 points, le plaçant 8e parmi les 182 modèles qu'il suit ; la médiane des modèles de raisonnement dans la même tranche de prix est de 35 points.

Le premier niveau de lecture de cette nouvelle, c'est le score ; le second, seulement ensuite, c'est le prix. En plaçant côte à côte plusieurs modèles à poids ouverts ou accessibles publiquement issus de la même série de données d'Artificial Analysis : GLM-5.3 atteint au maximum 59,5 points (la page du modèle arrondit et affiche 60), coûte 0,68 dollar par tâche et génère 41 107 tokens en sortie par tâche ; Kimi K3 atteint au maximum 59,7 points, coûte 0,84 dollar et génère 25 474 tokens ; Qwen 3.8 Max obtient 58,1 points, coûte 1,13 dollar et génère 38 287 tokens ; Grok 4.6 (high) de xAI obtient 60,9 points, coûte 0,84 dollar et génère 21 735 tokens. Côté score, GLM-5.3 ne devance Kimi K3 que de 0,2 point, quasiment à égalité en tête du camp des poids ouverts ; mais pour accomplir la même tâche, il produit environ soixante pour cent de tokens en plus, ce qui grignote en partie son avantage tarifaire unitaire à force d'être "bavard" — une fois converti, le coût reste toutefois le plus bas du groupe, à 0,68 dollar par tâche.

Le jour du lancement, Zhipu a mis l'accent sur le code et la sécurité

Dans les notes de version du 14 août, Zhipu présente GLM-5.3 comme le fruit d'un "post-entraînement extrême" sur la même base que GLM-5.2 : l'environnement et la durée d'entraînement ont été fortement allongés, mais le modèle de base n'a pas changé. Les résultats mis en avant se concentrent sur les tâches de codage et d'agents : Terminal Bench 3.0 est passé de 4,6 pour GLM-5.2 à 28,3, DeepSWE v1.1 de 46,2 à 66,9, Agents' Last Exam de 23,8 à 28,5 ; sur le Z.ai Code Bench (High) propre à Zhipu, la précision atteint 31,4 %, supérieure aux 29,5 % qu'elle attribue à Claude Opus. L'évaluation interne de l'entreprise avance une amélioration de 50 % de la capacité de codage par rapport à GLM-5.2.

"GLM-5.3 is the open-source model with the strongest programming ability."

C'est ainsi que Zhipu se positionne elle-même : le modèle le plus performant en programmation dans le camp open source.

Autre point mis en avant séparément : la capacité en cybersécurité. Zhipu affirme qu'une capacité de sécurité émergente "au-delà des attentes" est apparue pendant le post-entraînement ; la phase de tests par équipe rouge (red team) a permis de découvrir au total 2 436 vulnérabilités. Sur CyberGym, le score atteint 84,5 %, comparable au 83,8 % de Mythos 5 d'Anthropic ; sur ExploitBench, il est de 54,4 %, nettement en deçà des 78,0 % de Mythos 5. Selon l'entreprise, cette couverture s'étend du logiciel aux protocoles internet et aux systèmes robotiques.

Les poids ouverts sous deux semaines, en priorité pour les outils de codage

Le calendrier d'ouverture prévoit la publication des poids sur Hugging Face dans les deux semaines suivant le lancement (aux alentours du 28 août), à condition que l'évaluation de sécurité et le durcissement du modèle soient achevés ; les termes de la licence n'ont pas encore été communiqués. D'ici là, le modèle est d'abord proposé via l'API et une série d'outils de codage ; parmi les intégrations citées par Zhipu figurent ZCode et AutoClaw, ainsi que des plateformes de codage tierces comme TraeWork, WorkBuddy, Qoder et CatPaw.

La discussion sur Hacker News autour des données d'Artificial Analysis apporte un éclairage complémentaire côté utilisateurs : certains développeurs estiment que la visibilité des tokens de raisonnement de GLM-5.3 est un atout, permettant "de l'arrêter à temps quand il part dans la mauvaise direction" ; d'autres soulignent directement que sa consommation de tokens dépasse celle de Kimi K3. Pour les équipes facturées au token, le tarif unitaire de 1,4/4,4 dollars doit être multiplié par une sortie plus longue avant toute comparaison — s'en tenir à la seule grille tarifaire fausse la lecture.

Le calcul pour les développeurs chinois

En replaçant cette tarification dans la séquence des prix des modèles chinois : au lancement de GLM-5.2, le discours était que ses scores en codage se rapprochaient des modèles propriétaires pour un prix équivalant au sixième de celui de GPT-5.5 ; GLM-5.3 fait encore grimper le score absolu d'un cran, tout en maintenant le prix unitaire au même niveau. Pour les acteurs chinois qui utilisent l'API, le véritable point de comparaison reste les tarifs API de DeepSeek V4 Pro et de Kimi K3, ainsi que les remises heures pleines/heures creuses de chaque fournisseur — côté score, GLM-5.3 s'est déjà invité dans cette conversation ; reste à savoir si une guerre des prix s'ensuivra, ce qui dépendra des tarifs annoncés une fois les poids ouverts dans deux semaines et intégrés par les plateformes d'inférence tierces.

Sources : notes de version de GLM-5.3 par Zhipu, page du modèle sur Artificial Analysis, CocoLoop, discussion sur Hacker News, VentureBeat ; vérification des tarifs API en entrée/sortie, des scores et du classement à l'Intelligence Index, du coût par tâche et des critères de comptage des tokens en sortie (environnement d'évaluation unifié d'Artificial Analysis), des chiffres officiels de benchmark et du calendrier d'ouverture des poids.