GLM-5.1 domine SWE-Bench Pro, entièrement entraîné sur Huawei Ascend

Le 7 avril, Z.ai (anciennement Zhipu AI) a publié GLM-5.1, avec 754B paramètres, architecture MoE et open source sous licence MIT.

Résultat de benchmark : SWE-Bench Pro 58,4 %, premier mondial. GPT-5.4 obtient 57,7 %, Claude Opus 4.6 obtient 57,3 %.

Ce seul chiffre suffit à créer un buzz — un modèle open source dépasse deux fleurons propriétaires dans la dimension de la capacité de programmation. Mais le plus intéressant est un autre aspect :

L'entraînement de ce modèle a été entièrement réalisé sur des puces Huawei Ascend 910B et le framework MindSpore, sans aucun GPU NVIDIA.

Paramètres techniques du modèle

D'abord, les indicateurs techniques :

Paramètre Valeur
Nombre total de paramètres 754B
Paramètres activés par étape 40B
Architecture MoE + Dynamic Sparse Attention
Fenêtre de contexte 200K tokens
Sortie maximale 131072 tokens
Taille du fichier du modèle 1,51 To (HuggingFace)
Licence MIT

Résultats de quelques benchmarks :

  • SWE-Bench Pro : 58,4 % (premier mondial)
  • CyberGym : 68,7 %
  • BrowseComp : 68,0 %
  • AIME 2026 : 95,3 %

SWE-Bench Pro mesure la correction de problèmes réels sur GitHub, pas des ensembles de données synthétiques faciles à manipuler pour obtenir des scores élevés. Les 58,4 % ont une valeur réelle.

Agent capable de fonctionner 8 heures

GLM-5.1 possède une capacité peu mentionnée mais importante : capacité d'exécution autonome.

La description officielle est « exécution indépendante de tâches pendant plus de 8 heures, couvrant des centaines de cycles d'opérations et des milliers d'appels d'outils » — peut travailler en continu pendant plus de 8 heures, traitant des centaines de cycles de tâches et des milliers d'appels d'outils.

La plupart des modèles dans des tâches d'agent complexes perdent le contrôle après quelques dizaines de cycles : la fenêtre de contexte est pleine, le raisonnement commence à dérailler, les appels d'outils entrent en boucle. GLM-5.1 a été clairement optimisé pour cela, pas seulement en s'appuyant sur une grande fenêtre de contexte.

C'est une avancée substantielle pour le déploiement d'agents au niveau entreprise, pas seulement un score de benchmark.

Le plus remarquable : Aucun NVIDIA

Matériel d'entraînement : Huawei Ascend 910B
Framework d'entraînement : Huawei MindSpore

Ce n'est pas un petit détail.

Pendant longtemps, la voie optimale pour entraîner des modèles à grande échelle était presque exclusivement CUDA de NVIDIA. H100, H800, A100 — on utilisait ce qui était disponible, et MindSpore a toujours eu un écart significatif en maturité technique par rapport à PyTorch.

GLM-5.1 a prouvé que cette voie est praticable : non seulement ça a fonctionné, mais ça a entraîné un modèle qui bat GPT-5.4 et Claude Opus 4.6.

« GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware »
— Awesome Agents

La signification politique de cela est aussi grande que la signification technique. Les restrictions d'exportation de puces IA des États-Unis vers la Chine sont désormais une contrainte de production réelle, pas une menace future. GLM-5.1 est un résultat expérimental : ce que les équipes d'IA chinoises peuvent accomplir dans des conditions de ressources de calcul limitées.

La réponse actuelle est : premier mondial sur SWE-Bench Pro, open source sous licence MIT, prix API $1,26/M token.

Comparaison des prix

Prix de l'API GLM-5.1 :

  • Entrée : $1,26/M tokens
  • Sortie : $3,96/M tokens

À titre de comparaison : Claude Opus 4.6 coûte environ $15/$75, GPT-5.4 est dans la même fourchette.

La capacité de programmation leader mondial sur SWE-Bench Pro à ce prix rend le choix clair pour les développeurs d'infrastructure de programmation IA.

Bien sûr, SWE-Bench Pro ne représente pas tous les scénarios. GLM-5.1 est encore en retard sur les principaux modèles propriétaires en matière de raisonnement mathématique et de benchmarks généraux, l'article original ne le cache pas. Ce n'est pas un champion polyvalent, mais un modèle spécialisé qui se différencie dans la direction Programmation + Agent.

Une tendance notable

Au cours de la dernière année, des modèles open source chinois comme Z.ai (GLM-5.1), DeepSeek (V3.2) et Kimi K2 ont successivement atteint le sommet de divers benchmarks spécialisés, sous licence MIT ou Apache, avec des prix d'API écrasant les concurrents propriétaires.

Meta annonce une fermeture partielle, OpenAI n'a jamais vraiment ouvert ses fleurons — tandis que les entreprises chinoises continuent de publier les poids.

Cette configuration était presque inimaginable au début de 2025.

Source de référence : Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer) ; CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents) ; GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)