GLM-5.1 führt SWE-Bench Pro an, trainiert ausschließlich auf Huawei Ascend

Am 7. April veröffentlichte Z.ai (ehemals Zhipu AI) GLM-5.1, ein Modell mit 754B Parametern, MoE-Architektur und Open-Source-Lizenz MIT.

Benchmark-Ergebnis: SWE-Bench Pro 58,4 %, weltweit führend. GPT-5.4 erreicht 57,7 %, Claude Opus 4.6 liegt bei 57,3 %.

Allein diese Zahl reicht aus, um für Aufsehen zu sorgen – ein Open-Source-Modell übertrifft zwei proprietäre Flaggschiffe in der Programmierfähigkeit. Doch noch interessanter ist ein anderer Aspekt:

Das Training dieses Modells erfolgte ausschließlich auf Huawei Ascend 910B-Chips und dem MindSpore-Framework, ohne Beteiligung einer NVIDIA-GPU.

Technische Parameter des Modells

Zunächst die harten Fakten:

Parameter Wert
Gesamtparameter 754B
Aktivierte Parameter pro Schritt 40B
Architektur MoE + Dynamic Sparse Attention
Kontextfenster 200K Tokens
Maximale Ausgabe 131072 Tokens
Modell-Dateigröße 1,51 TB (HuggingFace)
Lizenz MIT

Ergebnisse einiger Benchmarks:

  • SWE-Bench Pro: 58,4 % (weltweit führend)
  • CyberGym: 68,7 %
  • BrowseComp: 68,0 %
  • AIME 2026: 95,3 %

SWE-Bench Pro misst die Fähigkeit, echte GitHub-Issues zu beheben, nicht synthetische Datensätze, die leicht manipuliert werden können. Die 58,4 % sind ein substanzieller Wert.

Agent mit 8-Stunden-Laufzeit

GLM-5.1 besitzt eine wenig beachtete, aber wichtige Fähigkeit: autonome Ausführung.

Die offizielle Beschreibung lautet: „Eigenständige Ausführung von Aufgaben über mehr als 8 Stunden, über Hunderte von Operationsrunden und Tausende von Tool-Aufrufen hinweg" – also ununterbrochene Arbeit über 8 Stunden, mit Hunderten von Aufgabenrunden und Tausenden von Tool-Aufrufen.

Die meisten Modelle verlieren bei komplexen Agent-Aufgaben nach einigen Dutzend Runden die Kontrolle: Das Kontextfenster ist voll, die Logik beginnt zu spinnen, Tool-Aufrufe geraten in Schleifen. GLM-5.1 wurde hier offensichtlich speziell optimiert, nicht nur durch ein großes Kontextfenster.

Dies ist ein substanzieller Fortschritt für den unternehmensweiten Agent-Einsatz, nicht nur ein Benchmark-Ergebnis.

Das Wichtigste: Kein NVIDIA

Trainingshardware: Huawei Ascend 910B
Trainingsframework: Huawei MindSpore

Dies ist kein kleines Detail.

Lange Zeit war der optimale Weg zum Training großer Modelle fast ausschließlich NVIDIA CUDA. H100, H800, A100 – was verfügbar war, wurde genutzt, und MindSpore hatte in der technischen Reife stets einen deutlichen Rückstand zu PyTorch.

GLM-5.1 hat gezeigt, dass dieser Weg gangbar ist: Nicht nur, dass es läuft, sondern es hat ein Modell trainiert, das GPT-5.4 und Claude Opus 4.6 schlägt.

„GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents

Die politische Bedeutung ist ebenso groß wie die technische. Die US-Exportkontrollen für KI-Chips gegenüber China sind inzwischen eine reale Produktionsbeschränkung, keine zukünftige Bedrohung. GLM-5.1 ist ein experimentelles Ergebnis: Was chinesische KI-Teams unter eingeschränkten Rechenressourcen erreichen können.

Die Antwort lautet derzeit: Weltweit führend im SWE-Bench Pro, Open Source unter MIT-Lizenz, API-Preis $1,26/M Token.

Preisvergleich

GLM-5.1 API-Preise:

  • Eingabe: $1,26/M Tokens
  • Ausgabe: $3,96/M Tokens

Zum Vergleich: Claude Opus 4.6 liegt bei etwa $15/$75, GPT-5.4 in einer ähnlichen Größenordnung.

Die weltweit führende Programmierfähigkeit im SWE-Bench Pro zu diesem Preis macht die Wahl für Entwickler von KI-Programmierinfrastruktur klar.

Natürlich repräsentiert SWE-Bench Pro nicht alle Szenarien. GLM-5.1 liegt bei mathematischem Denken und allgemeinen Benchmarks weiterhin hinter den führenden proprietären Modellen zurück, der Originalartikel verschweigt dies nicht. Es ist kein Allround-Champion, sondern ein spezialisiertes Modell, das sich in den Bereichen Programmierung und Agent differenziert.

Ein beachtenswerter Trend

Im letzten Jahr haben chinesische Open-Source-Modelle wie Z.ai (GLM-5.1), DeepSeek (V3.2) und Kimi K2 nacheinander in verschiedenen spezialisierten Benchmarks die Spitze erklommen, unter MIT- oder Apache-Lizenz, mit API-Preisen, die proprietäre Konkurrenten unterbieten.

Meta kündigt teilweise Schließung an, OpenAI hat seine Flaggschiffe nie wirklich geöffnet – während chinesische Unternehmen weiterhin die Gewichte veröffentlichen.

Diese Konstellation war Anfang 2025 kaum vorstellbar.

Quellenangabe: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)