4 月 7 日,Z.ai(原智譜 AI)發佈了 GLM-5.1,754B 參數,MoE 架構,MIT 協議開源。
跑分結果:SWE-Bench Pro 58.4%,全球第一。GPT-5.4 是 57.7%,Claude Opus 4.6 是 57.3%。
光這個數字就夠刷一波熱度了——開源模型在程式設計能力這個維度上正面超越了兩大閉源旗艦。但更有意思的是另一件事:
這個模型的訓練全程用的是華為昇騰 910B 晶片和MindSpore 框架,沒有一塊 NVIDIA GPU 參與。
模型的技術參數
先過一下硬指標:
| 參數 | 數值 |
| 總參數量 | 754B |
| 每次激活 | 40B |
| 架構 | MoE + 動態稀疏注意力 |
| 上下文窗口 | 200K tokens |
| 最大輸出 | 131072 tokens |
| 模型檔案大小 | 1.51TB(HuggingFace) |
| License | MIT |
幾個 benchmark 的成績:
- SWE-Bench Pro:58.4%(全球第一)
- CyberGym:68.7%
- BrowseComp:68.0%
- AIME 2026:95.3%
SWE-Bench Pro 測的是真實 GitHub issue 修復,不是那種換個馬甲就能刷高分的合成數據集,58.4% 這個數字含金量是實的。
能跑 8 小時的 Agent
GLM-5.1 有個不太被提到但很重要的能力:自主執行能力。
官方描述是「獨立執行任務超過 8 小時,跨越數百輪操作、數千次工具呼叫」——可以不中斷地連續工作 8 小時以上,期間處理幾百輪任務、幾千次工具呼叫。
大多數模型在複雜 agent 任務裡撐不過幾十輪就開始失控:上下文窗口塞滿了,推理開始失常,工具呼叫開始循環。GLM-5.1 顯然在這塊做了專項優化,不是只靠大上下文窗口硬撐。
這對企業級 Agent 部署是個實質性進步,不是 benchmark 刷分。
最值得說的:沒有 NVIDIA
訓練硬體:華為昇騰 910B
訓練框架:華為 MindSpore
這不是一個小細節。
長期以來,訓練大規模模型的最優路徑幾乎只有 NVIDIA CUDA 這一條。H100、H800、A100——能用哪個用哪個,MindSpore 在工程成熟度上距離 PyTorch 差距一直不小。
GLM-5.1 證明了這條路是可以走通的:不只是跑起來了,而是訓出了打敗 GPT-5.4 和 Claude Opus 4.6 的模型。
「GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware」
—— Awesome Agents
這事的政治意義和技術意義一樣大。美國對華的 AI 晶片出口管制現在已經是實打實的生產約束,不是未來威脅。GLM-5.1 是一個實驗結果:在算力受限的條件下,中國 AI 團隊能做到什麼。
答案目前是:SWE-Bench Pro 全球第一,MIT 協議開源,API 定價 $1.26/M token。
價格放出來比一比
GLM-5.1 API 定價:
- 輸入:$1.26/M tokens
- 輸出:$3.96/M tokens
作為對比:Claude Opus 4.6 差不多是 $15/$75,GPT-5.4 也在同一數量級。
SWE-Bench Pro 全球第一的程式設計能力放在這個價格上,對於 AI 程式設計基礎設施的開發者來說,選項很清晰。
當然,SWE-Bench Pro 不能代表所有場景。GLM-5.1 在數學推理和通用 benchmark 上仍然落後於頭部閉源模型,原文沒有迴避這點。這不是一個全能冠軍,是一個在程式設計 + Agent 方向打出差異化的專項模型。
一個值得關注的趨勢
最近一年,Z.ai(GLM-5.1)、DeepSeek(V3.2)、Kimi K2 等中國開源模型接連在各個專項 benchmark 上登頂,MIT 或 Apache 協議,API 價格碾壓閉源對手。
Meta 宣佈部分閉源,OpenAI 從未真正開源旗艦——反而是中國公司在堅持把權重公開出來。
這個格局在 2025 年初幾乎不可想像。
參考來源:Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro(WinBuzzer);CocoLoop、GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware(Awesome Agents);GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up(APIdog)