Pada 7 April, Z.ai (sebelumnya Zhipu AI) merilis GLM-5.1, model dengan 754B parameter, arsitektur MoE, dan lisensi open-source MIT.
Hasil benchmark: SWE-Bench Pro 58,4%, peringkat pertama global. GPT-5.4 mendapat 57,7%, dan Claude Opus 4.6 mendapat 57,3%.
Angka itu sendiri sudah cukup untuk menarik perhatian — model open-source secara langsung melampaui dua flagship closed-source dalam kemampuan coding. Namun ada hal yang lebih menarik:
Model ini dilatih sepenuhnya menggunakan chip Huawei Ascend 910B dan framework MindSpore, tanpa satu pun GPU NVIDIA.
Spesifikasi Teknis Model
Pertama, spesifikasi keras:
| Parameter | Nilai |
| Total Parameter | 754B |
| Parameter Aktif per Inferensi | 40B |
| Arsitektur | MoE + Dynamic Sparse Attention |
| Jendela Konteks | 200K token |
| Output Maksimum | 131.072 token |
| Ukuran File Model | 1,51TB (HuggingFace) |
| Lisensi | MIT |
Skor benchmark utama:
- SWE-Bench Pro: 58,4% (peringkat pertama global)
- CyberGym: 68,7%
- BrowseComp: 68,0%
- AIME 2026: 95,3%
SWE-Bench Pro menguji perbaikan issue GitHub nyata, bukan dataset sintetis yang bisa dimanipulasi. Angka 58,4% memiliki bobot nyata.
Agent yang Bekerja 8 Jam
GLM-5.1 memiliki kemampuan yang jarang dibahas namun penting: eksekusi otonom.
Deskripsi resminya adalah "mengeksekusi tugas secara independen selama lebih dari 8 jam, mencakup ratusan putaran operasi dan ribuan panggilan alat" — dapat bekerja terus-menerus selama lebih dari 8 jam, menangani ratusan putaran tugas dan ribuan panggilan alat.
Sebagian besar model mulai kehilangan kendali setelah beberapa puluh putaran dalam tugas agent yang kompleks: jendela konteks penuh, penalaran mulai kacau, panggilan alat mulai berulang. GLM-5.1 jelas memiliki optimasi khusus di area ini, tidak hanya mengandalkan jendela konteks besar.
Ini adalah kemajuan substansial untuk deployment agent tingkat perusahaan, bukan sekadar mengejar skor benchmark.
Yang Paling Penting: Tanpa NVIDIA
Perangkat keras pelatihan: Huawei Ascend 910B
Framework pelatihan: Huawei MindSpore
Ini bukan detail kecil.
Selama ini, jalur optimal untuk melatih model skala besar hampir secara eksklusif melalui NVIDIA CUDA. H100, H800, A100 — gunakan yang tersedia. MindSpore secara konsisten tertinggal dari PyTorch dalam hal kematangan rekayasa.
GLM-5.1 membuktikan bahwa jalur ini dapat ditempuh: tidak hanya berjalan, tetapi menghasilkan model yang mengalahkan GPT-5.4 dan Claude Opus 4.6.
"GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents
Signifikansi politik dari hal ini sama besarnya dengan signifikansi teknis. Kontrol ekspor chip AI AS ke China kini menjadi kendala produksi nyata, bukan ancaman masa depan. GLM-5.1 adalah hasil eksperimen: apa yang dapat dicapai tim AI China dalam kondisi keterbatasan komputasi.
Jawabannya saat ini: peringkat pertama global di SWE-Bench Pro, open-source dengan lisensi MIT, harga API $1,26/M token.
Perbandingan Harga
Harga API GLM-5.1:
- Input: $1,26/M token
- Output: $3,96/M token
Sebagai perbandingan: Claude Opus 4.6 sekitar $15/$75, dan GPT-5.4 berada di kisaran yang sama.
Dengan kemampuan coding peringkat pertama SWE-Bench Pro pada harga ini, pilihan bagi pengembang infrastruktur coding AI menjadi jelas.
Tentu saja, SWE-Bench Pro tidak mewakili semua skenario. GLM-5.1 masih tertinggal dari model closed-source teratas dalam penalaran matematika dan benchmark umum, dan artikel asli tidak menghindari hal ini. Ini bukan juara serba bisa — ini adalah model khusus yang terdiferensiasi dalam arah coding dan agent.
Tren yang Patut Dicermati
Dalam setahun terakhir, model open-source China seperti Z.ai (GLM-5.1), DeepSeek (V3.2), dan Kimi K2 secara berturut-turut menduduki puncak berbagai benchmark khusus, dengan lisensi MIT atau Apache, dan harga API yang menghancurkan pesaing closed-source.
Meta mengumumkan penutupan sebagian, OpenAI tidak pernah benar-benar membuka flagship-nya — justru perusahaan China yang terus mempublikasikan bobot model secara terbuka.
Lanskap ini hampir tidak terbayangkan pada awal tahun 2025.
Sumber: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)