Am 7. April veröffentlichte Z.ai (ehemals Zhipu AI) GLM-5.1, ein Modell mit 754B Parametern, MoE-Architektur und Open-Source-Lizenz MIT.
Benchmark-Ergebnis: SWE-Bench Pro 58,4 %, weltweit führend. GPT-5.4 erreicht 57,7 %, Claude Opus 4.6 liegt bei 57,3 %.
Allein diese Zahl reicht aus, um für Aufsehen zu sorgen – ein Open-Source-Modell übertrifft zwei proprietäre Flaggschiffe in der Programmierfähigkeit. Doch noch interessanter ist ein anderer Aspekt:
Das Training dieses Modells erfolgte ausschließlich auf Huawei Ascend 910B-Chips und dem MindSpore-Framework, ohne Beteiligung einer NVIDIA-GPU.
Technische Parameter des Modells
Zunächst die harten Fakten:
| Parameter | Wert |
|---|---|
| Gesamtparameter | 754B |
| Aktivierte Parameter pro Schritt | 40B |
| Architektur | MoE + Dynamic Sparse Attention |
| Kontextfenster | 200K Tokens |
| Maximale Ausgabe | 131072 Tokens |
| Modell-Dateigröße | 1,51 TB (HuggingFace) |
| Lizenz | MIT |
Ergebnisse einiger Benchmarks:
- SWE-Bench Pro: 58,4 % (weltweit führend)
- CyberGym: 68,7 %
- BrowseComp: 68,0 %
- AIME 2026: 95,3 %
SWE-Bench Pro misst die Fähigkeit, echte GitHub-Issues zu beheben, nicht synthetische Datensätze, die leicht manipuliert werden können. Die 58,4 % sind ein substanzieller Wert.
Agent mit 8-Stunden-Laufzeit
GLM-5.1 besitzt eine wenig beachtete, aber wichtige Fähigkeit: autonome Ausführung.
Die offizielle Beschreibung lautet: „Eigenständige Ausführung von Aufgaben über mehr als 8 Stunden, über Hunderte von Operationsrunden und Tausende von Tool-Aufrufen hinweg" – also ununterbrochene Arbeit über 8 Stunden, mit Hunderten von Aufgabenrunden und Tausenden von Tool-Aufrufen.
Die meisten Modelle verlieren bei komplexen Agent-Aufgaben nach einigen Dutzend Runden die Kontrolle: Das Kontextfenster ist voll, die Logik beginnt zu spinnen, Tool-Aufrufe geraten in Schleifen. GLM-5.1 wurde hier offensichtlich speziell optimiert, nicht nur durch ein großes Kontextfenster.
Dies ist ein substanzieller Fortschritt für den unternehmensweiten Agent-Einsatz, nicht nur ein Benchmark-Ergebnis.
Das Wichtigste: Kein NVIDIA
Trainingshardware: Huawei Ascend 910B
Trainingsframework: Huawei MindSpore
Dies ist kein kleines Detail.
Lange Zeit war der optimale Weg zum Training großer Modelle fast ausschließlich NVIDIA CUDA. H100, H800, A100 – was verfügbar war, wurde genutzt, und MindSpore hatte in der technischen Reife stets einen deutlichen Rückstand zu PyTorch.
GLM-5.1 hat gezeigt, dass dieser Weg gangbar ist: Nicht nur, dass es läuft, sondern es hat ein Modell trainiert, das GPT-5.4 und Claude Opus 4.6 schlägt.
„GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents
Die politische Bedeutung ist ebenso groß wie die technische. Die US-Exportkontrollen für KI-Chips gegenüber China sind inzwischen eine reale Produktionsbeschränkung, keine zukünftige Bedrohung. GLM-5.1 ist ein experimentelles Ergebnis: Was chinesische KI-Teams unter eingeschränkten Rechenressourcen erreichen können.
Die Antwort lautet derzeit: Weltweit führend im SWE-Bench Pro, Open Source unter MIT-Lizenz, API-Preis $1,26/M Token.
Preisvergleich
GLM-5.1 API-Preise:
- Eingabe: $1,26/M Tokens
- Ausgabe: $3,96/M Tokens
Zum Vergleich: Claude Opus 4.6 liegt bei etwa $15/$75, GPT-5.4 in einer ähnlichen Größenordnung.
Die weltweit führende Programmierfähigkeit im SWE-Bench Pro zu diesem Preis macht die Wahl für Entwickler von KI-Programmierinfrastruktur klar.
Natürlich repräsentiert SWE-Bench Pro nicht alle Szenarien. GLM-5.1 liegt bei mathematischem Denken und allgemeinen Benchmarks weiterhin hinter den führenden proprietären Modellen zurück, der Originalartikel verschweigt dies nicht. Es ist kein Allround-Champion, sondern ein spezialisiertes Modell, das sich in den Bereichen Programmierung und Agent differenziert.
Ein beachtenswerter Trend
Im letzten Jahr haben chinesische Open-Source-Modelle wie Z.ai (GLM-5.1), DeepSeek (V3.2) und Kimi K2 nacheinander in verschiedenen spezialisierten Benchmarks die Spitze erklommen, unter MIT- oder Apache-Lizenz, mit API-Preisen, die proprietäre Konkurrenten unterbieten.
Meta kündigt teilweise Schließung an, OpenAI hat seine Flaggschiffe nie wirklich geöffnet – während chinesische Unternehmen weiterhin die Gewichte veröffentlichen.
Diese Konstellation war Anfang 2025 kaum vorstellbar.
Quellenangabe: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)