智谱 GLM-5.3 API 上线,百万 token 输出 4.4 美元

智谱 8 月 14 日发布 GLM-5.3,8 月 18 日前后 API 正式开放调用:每百万输入 token 1.40 美元、输出 4.40 美元,上下文窗口 100 万 token。独立评测机构 Artificial Analysis 同日给出的智能指数(Intelligence Index)为 60 分,在其收录的 182 个模型中排第 8 位;同一价位带推理模型的中位数是 35 分。

这条新闻的第一层是分数,第二层才是价格。把 Artificial Analysis 同一轮数据里的几个开放权重或可公开调用的模型摆在一起:GLM-5.3 最高档 59.5 分(模型页四舍五入显示为 60)、每任务成本 0.68 美元、每任务输出 41107 个 token;Kimi K3 最高档 59.7 分、0.84 美元、25474 个 token;Qwen 3.8 Max 58.1 分、1.13 美元、38287 个 token;xAI 的 Grok 4.6(high)60.9 分、0.84 美元、21735 个 token。分数上 GLM-5.3 与 Kimi K3 只差 0.2 分,基本并列开放权重阵营的第一梯队;但它完成同样任务要多吐六成 token,单价优势被”话多”抵掉一部分,折算下来每任务 0.68 美元仍是这一组里最低的。

发布那天智谱强调的是编程和安全

8 月 14 日的发布说明里,智谱把 GLM-5.3 定义为 GLM-5.2 同一底座之上的”极限后训练”产物:训练环境和时长大幅拉长,基座没换。给出的成绩单集中在编程和智能体任务:Terminal Bench 3.0 从 GLM-5.2 的 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9,Agents’ Last Exam 从 23.8 涨到 28.5;在智谱自家的 Z.ai Code Bench(High)上准确率 31.4%,高于其列出的 Claude Opus 的 29.5%。公司内部评估给出的说法是编程能力比 GLM-5.2 提升 50%。

“GLM-5.3 is the open-source model with the strongest programming ability.”

这是智谱自己的定位:开源阵营里编程能力最强的模型。

另一块被单独拎出来的是网络安全能力。智谱称后训练过程中出现了”超出预期”的涌现式安全能力,红队测试阶段累计发现 2436 个漏洞;CyberGym 上 84.5%,与 Anthropic 的 Mythos 5(83.8%)相当,ExploitBench 上 54.4%,明显低于 Mythos 5 的 78.0%。覆盖面按官方说法从软件延伸到互联网协议和机器人系统。

权重两周内放出,先接编程工具

开源安排是:发布后两周内(约 8 月 28 日前)在 Hugging Face 公开权重,前提是安全评估和加固完成;许可证条款尚未公布。在此之前,模型先通过 API 和一批编程工具对外提供,智谱点名的接入方包括 ZCode、AutoClaw,以及 TraeWork、WorkBuddy、Qoder、CatPaw 等第三方编程平台。

Hacker News 上围绕 Artificial Analysis 数据的讨论给了一个用户视角的补充:有开发者认为 GLM-5.3 可见的推理 token 是优点,“可以在它跑偏的时候及时叫停”;也有人直接指出它的 token 用量高于 Kimi K3。对按 token 计费的团队来说,1.4/4.4 美元的单价要乘上更长的输出再比较,只看价目表会失真。

对国内开发者的账

把这次定价放回国产模型的价格序列里看:GLM-5.2 上线时的说法是编程跑分逼近闭源、价格只有 GPT-5.5 的六分之一;GLM-5.3 把绝对分数再往上推了一档,单价维持在同一量级。对国内调用方而言,真正的比较对象是 DeepSeek V4 Pro 和 Kimi K3 的 API 价格,以及各家的峰谷折扣——GLM-5.3 在分数上已经进入这组对话,价格战会不会跟着开打,要看两周后权重放出、第三方推理平台接入之后的报价。

参考来源:智谱 GLM-5.3 发布说明、Artificial Analysis 模型页、CocoLoop、Hacker News 讨论、VentureBeat;核验 API 输入/输出定价、智能指数分数与排名、每任务成本与输出 token 口径(Artificial Analysis 统一评测环境)、官方 benchmark 数值与权重开源时间表。