8 月 26 日,智谱把在 OpenCode、OpenRouter 上匿名跑了一周多的 Ox Alpha 摘下面罩——它的正式名字是 GLM-5.3-Flash,权重当天挂上 HuggingFace,采用 MIT 许可证。
这是 GLM-5 系列里第一个原生多模态的成员。总参数 320B,每个 token 只激活 18B;层数从 GLM-5.3 的 92 层压到 45 层,激活参数从上代的 32B 降到 18B。省下来的算力直接体现在价签上:官方标价约为 GLM-5.3 的十分之一,限时优惠期内再腰斩一次,折算下来大约是 Claude Opus 4.8 的四十分之一。Z.ai 给出的另一个口径是,折扣价下平均完成一个任务花 0.045 美元。
参数砍一半,分数没跟着掉
在 Artificial Analysis 的智能指数 v4.1.1 上,GLM-5.3-Flash 拿到 57 分,落进了全球前沿模型的区间,与 Anthropic 眼下最受欢迎的 Opus 4.8 处在同一档。分项上的跨度更大一些:DeepSWE v1.1 从 GLM-5.2 的 46.2 涨到 63.4,Terminal-Bench 2.1 拿到 84.3,Toolathlon Verified 78.4,AutomationBench v1.0.6 是 48.8。智谱自家的 Z.ai Code Bench 最高难度档给出 29.0,对照组 Opus 为 29.5。
多模态是这一代新加的部分:OfficeQA Pro 62.4,CharXiv 带工具推理 89.4,Chartography 带工具 78.0,视频侧的 MVbench 77.8、MMVU 80.5。这套组合的落点在”看得懂表格和图纸的办公 Agent”,不太像通用图像理解的跑分秀。
架构上,它是第一个把稀疏注意力与线性注意力混着用的开源前沿模型,同时引入了 IndexPool 和 mHC(流形约束超连接)。效果落在两个数字上:相比 GLM-5.3,注意力计算量降到约三分之一(3.0 倍),KV cache 降到约四分之一(4.4 倍)。长上下文的开销大头就在 KV cache,这个倍数决定了 100 万 token 的窗口能不能真的开着用,而不只是写在规格表里。
全部流量跑在国产芯片上
匿名测试期间,Ox Alpha 一度是 OpenCode 上调用量最高的模型。智谱称这段时间的推理流量全部由国产 AI 芯片承接,端到端服务性能相比此前提升 3 倍,成本已经能和主流英伟达 GPU 方案对齐。
这条信息的含金量不比跑分低。过去一年国产开源模型的通行叙事是”分数接近、部署仍要靠 H 系列卡”,一旦推理侧能在国产硅片上跑满且单位成本打平,模型厂商的定价空间就不再受制于卡的采购价。GLM-5.3-Flash 敢把标价压到上代的十分之一,底气有一半在这里。
粗算一笔账:按限时价每百万 token 输入 0.075 美元、输出 0.25 美元,一个日均消耗 5000 万输入 token、1000 万输出 token 的中型 Agent 应用,一天的模型账单约 6.25 美元(粗算,未计缓存折扣与失败重试)。同样的调用量放到 Opus 4.8 上,差的是一个数量级。对国内做 Agent 产品的团队来说,这把”能不能上生产”从预算问题拉回了工程问题。
部署侧,SGLang、vLLM、KTransformers 都已支持,API 同步在 docs.z.ai 上线。MIT 许可证是这次少见的一步——GLM 前几代多走自家协议,MIT 之下的商业二次分发几乎没有附加条件,海外团队拿去改也不必再过一遍法务。
一周前智谱刚公开承认 Ox Alpha 是自家迭代,当时给出的数据是调用量超过 DeepSeek 两倍。现在名字、权重、价格三样都摆到了台面上,剩下的问题是有多少团队愿意把它从”便宜的测试模型”换成线上主力。
参考来源:Z.ai 官方博客、HuggingFace 模型页、CocoLoop、Artificial Analysis;参数规模、基准分数与 API 单价以官方发布页口径核验。