智譜於 8 月 14 日發布 GLM-5.3,8 月 18 日前後 API 正式開放呼叫:每百萬輸入 token 1.40 美元、輸出 4.40 美元,上下文視窗達 100 萬 token。獨立評測機構 Artificial Analysis 同日公布的智慧指數(Intelligence Index)為 60 分,在其收錄的 182 個模型中排名第 8;同一價位帶推理模型的中位數僅 35 分。
這則新聞要分兩層看:先是分數,然後才是價格。把 Artificial Analysis 同一輪資料裡幾個開放權重或可公開呼叫的模型並列比較:GLM-5.3 最高檔 59.5 分(模型頁面四捨五入顯示為 60)、每項任務成本 0.68 美元、每項任務輸出 41107 個 token;Kimi K3 最高檔 59.7 分、0.84 美元、25474 個 token;Qwen 3.8 Max 58.1 分、1.13 美元、38287 個 token;xAI 的 Grok 4.6(high)60.9 分、0.84 美元、21735 個 token。分數上 GLM-5.3 與 Kimi K3 只差 0.2 分,基本上並列開放權重陣營的第一梯隊;但它完成同樣任務要多吐六成 token,單價優勢因此被「話多」抵掉一部分,換算下來每項任務 0.68 美元仍是這組裡最低的。
發布當天,智譜強調的是程式設計與資安
在 8 月 14 日的發布說明中,智譜把 GLM-5.3 定義為與 GLM-5.2 同一基礎模型之上的「極限後訓練」成果:訓練環境與時長大幅拉長,基礎模型本身沒有更換。公布的成績單集中在程式設計與智慧代理任務:Terminal Bench 3.0 從 GLM-5.2 的 4.6 分提升到 28.3 分,DeepSWE v1.1 從 46.2 分提升到 66.9 分,Agents' Last Exam 從 23.8 分提升到 28.5 分;在智譜自家的 Z.ai Code Bench(High)測試中準確率達 31.4%,高於其列出的 Claude Opus 的 29.5%。官方內部評估則表示,程式設計能力較 GLM-5.2 提升了 50%。
"GLM-5.3 is the open-source model with the strongest programming ability."
這是智譜自己的定位:開源陣營裡程式設計能力最強的模型。
另一項被特別點名的是資安能力。智譜表示,後訓練過程中出現了「超出預期」的湧現式資安能力,紅隊測試階段累計發現 2436 個漏洞;在 CyberGym 上得分 84.5%,與 Anthropic 的 Mythos 5(83.8%)相當,在 ExploitBench 上則為 54.4%,明顯低於 Mythos 5 的 78.0%。依官方說法,涵蓋範圍從軟體延伸到網際網路協定與機器人系統。
權重兩週內釋出,先開放給程式設計工具
開源時程規劃是:發布後兩週內(約 8 月 28 日前)在 Hugging Face 公開權重,前提是完成安全評估與強化作業;授權條款目前尚未公布。在此之前,模型先透過 API 與一批程式設計工具對外提供,智譜點名的整合對象包括自家的 ZCode、AutoClaw,以及 TraeWork、WorkBuddy、Qoder、CatPaw 等第三方程式設計平台。
Hacker News 上圍繞 Artificial Analysis 資料的討論,補上了使用者視角:有開發者認為 GLM-5.3 可見的推理 token 是優點,「能在模型跑偏的時候及時喊停」;也有人直接點出它的 token 用量高於 Kimi K3。對按 token 計費的團隊來說,1.4/4.4 美元的單價得乘上更長的輸出再做比較,只看價目表會失真。
對中國開發者來說的算盤
把這次的定價放進中國模型的價格脈絡裡看:GLM-5.2 上線時的說法是程式設計跑分逼近閉源模型、價格只有 GPT-5.5 的六分之一;GLM-5.3 把絕對分數又往上推了一檔,單價則維持在同一量級。對中國開發者來說,真正該比較的對象是 DeepSeek V4 Pro 和 Kimi K3 的 API 價格,以及各家的離峰折扣——GLM-5.3 在分數上已經擠進這組對話,價格戰會不會跟著開打,得看兩週後權重釋出、第三方推論平台接入之後怎麼報價。
參考來源:智譜 GLM-5.3 發布說明、Artificial Analysis 模型頁、CocoLoop、Hacker News 討論、VentureBeat;已核實 API 輸入/輸出定價、智慧指數分數與排名、每項任務成本與輸出 token 口徑(Artificial Analysis 統一評測環境)、官方 benchmark 數值與權重開源時程。