智譜開源GLM-5.3-Flash 啟用參數砍到180億

8月26日,智譜把在OpenCode、OpenRouter上匿名跑了一週多的Ox Alpha正式公開身分——它的正式名稱是GLM-5.3-Flash,權重當天就上架HuggingFace,採用MIT授權條款。

這是GLM-5系列裡第一個原生多模態的成員。總參數320B,但每個token只啟用180億;層數從GLM-5.3的92層砍到45層,啟用參數也從上一代的320億降到180億。省下來的算力直接反映在價格上:官方定價約是GLM-5.3的十分之一,限時優惠期間再打對折,換算下來大約是Claude Opus 4.8的四十分之一。Z.ai另外提供的一個口徑是,折扣價下平均完成一個任務要花0.045美元

參數砍一半,分數沒跟著掉

在Artificial Analysis的智慧指數v4.1.1上,GLM-5.3-Flash拿到57分,落在全球前沿模型的區間,與Anthropic目前最受歡迎的Opus 4.8同一個等級。個別項目的落差則更大:DeepSWE v1.1從GLM-5.2的46.2漲到63.4,Terminal-Bench 2.1拿到84.3,Toolathlon Verified 78.4,AutomationBench v1.0.6是48.8。智譜自家的Z.ai Code Bench最高難度給出29.0,對照組Opus則是29.5。

多模態是這一代新增的部分:OfficeQA Pro 62.4,CharXiv搭配工具推理拿到89.4,Chartography搭配工具是78.0,影片方面MVBench 77.8、MMVU 80.5。這套組合瞄準的是「看得懂表格和圖表的辦公室代理」,不太像在拚通用圖像理解的跑分秀。

架構上,它是第一個把稀疏注意力與線性注意力混用的開源前沿模型,同時導入IndexPool與mHC(流形約束超連接)。效果落在兩個數字:相比GLM-5.3,注意力運算量降到約三分之一(減少3.0倍),KV快取降到約四分之一(減少4.4倍)。長上下文的開銷大頭就在KV快取,這個倍數決定了100萬token的視窗是真的能開著用,還是只是寫在規格表上好看。

全部流量都跑在國產晶片上

匿名測試期間,Ox Alpha一度是OpenCode上呼叫量最高的模型。智譜表示,這段期間的推論流量全部由國產AI晶片承接,端到端服務效能比過去提升3倍,成本已經能跟主流NVIDIA GPU方案打平。

這則消息的含金量不比跑分低。過去一年,國產開源模型的通行說法是「分數接近,部署還是得靠H系列卡」,一旦推論端能在國產晶片上滿載運作、單位成本也追平,模型廠商的定價空間就不再被卡的採購價卡住。GLM-5.3-Flash敢把定價砍到上一代的十分之一,底氣有一半來自這裡。

粗略算一筆帳:按限時優惠價,每百萬token輸入0.075美元、輸出0.25美元,一個日均消耗5000萬輸入token、1000萬輸出token的中型代理應用,一天的模型帳單大約是6.25美元(粗估,未計入快取折扣與失敗重試)。同樣的呼叫量放到Opus 4.8上,差距是一個數量級。對中國國內做代理產品的團隊來說,這把「能不能上線正式環境」從預算問題拉回了工程問題。

部署端,SGLang、vLLM、KTransformers都已支援,API也同步在docs.z.ai上線。MIT授權是這次少見的一步——GLM前幾代大多採用自家授權條款,MIT之下的商業二次散布幾乎沒有附加條件,海外團隊拿去修改也不必再跑一次法務審查。

一週前智譜才公開承認Ox Alpha是自家的迭代版本,當時給出的數據是呼叫量超過DeepSeek的兩倍。如今名字、權重、價格三樣都攤在檯面上,剩下的問題是有多少團隊願意把它從「便宜的測試模型」換成正式主力。

參考來源:Z.ai官方部落格、HuggingFace模型頁面、CocoLoop、Artificial Analysis;參數規模、基準分數與API單價以官方發布頁口徑核實。