GLM-5.1 登頂 SWE-Bench Pro,全程採用華為昇騰訓練

4 月 7 日,Z.ai(原智譜 AI)發佈了 GLM-5.1,754B 參數,MoE 架構,MIT 協議開源。

跑分結果:SWE-Bench Pro 58.4%,全球第一。GPT-5.4 是 57.7%,Claude Opus 4.6 是 57.3%。

光這個數字就夠刷一波熱度了——開源模型在程式設計能力這個維度上正面超越了兩大閉源旗艦。但更有意思的是另一件事:

這個模型的訓練全程用的是華為昇騰 910B 晶片MindSpore 框架,沒有一塊 NVIDIA GPU 參與。

模型的技術參數

先過一下硬指標:

參數數值
總參數量754B
每次激活40B
架構MoE + 動態稀疏注意力
上下文窗口200K tokens
最大輸出131072 tokens
模型檔案大小1.51TB(HuggingFace)
LicenseMIT

幾個 benchmark 的成績:

  • SWE-Bench Pro:58.4%(全球第一)
  • CyberGym:68.7%
  • BrowseComp:68.0%
  • AIME 2026:95.3%

SWE-Bench Pro 測的是真實 GitHub issue 修復,不是那種換個馬甲就能刷高分的合成數據集,58.4% 這個數字含金量是實的。

能跑 8 小時的 Agent

GLM-5.1 有個不太被提到但很重要的能力:自主執行能力

官方描述是「獨立執行任務超過 8 小時,跨越數百輪操作、數千次工具呼叫」——可以不中斷地連續工作 8 小時以上,期間處理幾百輪任務、幾千次工具呼叫。

大多數模型在複雜 agent 任務裡撐不過幾十輪就開始失控:上下文窗口塞滿了,推理開始失常,工具呼叫開始循環。GLM-5.1 顯然在這塊做了專項優化,不是只靠大上下文窗口硬撐。

這對企業級 Agent 部署是個實質性進步,不是 benchmark 刷分。

最值得說的:沒有 NVIDIA

訓練硬體:華為昇騰 910B
訓練框架:華為 MindSpore

這不是一個小細節。

長期以來,訓練大規模模型的最優路徑幾乎只有 NVIDIA CUDA 這一條。H100、H800、A100——能用哪個用哪個,MindSpore 在工程成熟度上距離 PyTorch 差距一直不小。

GLM-5.1 證明了這條路是可以走通的:不只是跑起來了,而是訓出了打敗 GPT-5.4 和 Claude Opus 4.6 的模型。

「GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware」
—— Awesome Agents

這事的政治意義和技術意義一樣大。美國對華的 AI 晶片出口管制現在已經是實打實的生產約束,不是未來威脅。GLM-5.1 是一個實驗結果:在算力受限的條件下,中國 AI 團隊能做到什麼

答案目前是:SWE-Bench Pro 全球第一,MIT 協議開源,API 定價 $1.26/M token。

價格放出來比一比

GLM-5.1 API 定價:

  • 輸入:$1.26/M tokens
  • 輸出:$3.96/M tokens

作為對比:Claude Opus 4.6 差不多是 $15/$75,GPT-5.4 也在同一數量級。

SWE-Bench Pro 全球第一的程式設計能力放在這個價格上,對於 AI 程式設計基礎設施的開發者來說,選項很清晰。

當然,SWE-Bench Pro 不能代表所有場景。GLM-5.1 在數學推理和通用 benchmark 上仍然落後於頭部閉源模型,原文沒有迴避這點。這不是一個全能冠軍,是一個在程式設計 + Agent 方向打出差異化的專項模型。

一個值得關注的趨勢

最近一年,Z.ai(GLM-5.1)、DeepSeek(V3.2)、Kimi K2 等中國開源模型接連在各個專項 benchmark 上登頂,MIT 或 Apache 協議,API 價格碾壓閉源對手。

Meta 宣佈部分閉源,OpenAI 從未真正開源旗艦——反而是中國公司在堅持把權重公開出來。

這個格局在 2025 年初幾乎不可想像。

參考來源:Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro(WinBuzzer);CocoLoop、GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware(Awesome Agents);GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up(APIdog)