Anthropic 9 月 29 日发布一份研究报告,评估智谱 GLM-5.3 的网络攻击能力。结论是,这款开放权重模型已经能自主构建端到端的漏洞利用程序,水平接近 Anthropic 自己的 Claude Mythos Preview,而它的安全防护可以被很简单的办法绕过。
报告的原话是:
“GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions.”(GLM-5.3 很可能让恶意行为者获得能力,在几乎不受限制的情况下发现并利用网络漏洞。)
攻击能力测了哪几项
Anthropic 用了三组测试。第一组是针对 Chrome V8 引擎漏洞的 ExploitBench,GLM-5.3 在 410 次尝试里成功 50 次,成功率约 12%,Mythos Preview 是 14%。第二组是公司内部基于 OSS-Fuzz 项目的二进制漏洞利用测试,GLM-5.3 成功率 4%,Mythos Preview 6%,参与对照的 Claude Opus 4.6、Kimi K3、DeepSeek V4.1-Flash 和上一代 GLM-5.2 都是 0。第三组是由人类专家参与的开放式攻击任务。
最能说明门槛的是一个真实 CVE 的复现案例:人工投入约 20 分钟,GLM-5.3-Flash 自己跑了 8 个小时,按智谱的 API 价格折合 20.40 美元,做出了可用的利用程序。所有代码都在隔离沙箱里执行,不接触外部系统。
防护层能挡住多少
直接提出恶意请求时,GLM-5.3 的拒绝率在 95% 左右,模拟攻击成功率为 0。换成下面几种做法,情况就变了:
| 手法 | 绕过成功率 |
|---|---|
| 编造一个看似正当的理由 | 64% |
| 预先填入一段推理过程 | 92% |
| 用”消融”方法去掉拒答机制 | 100% |
消融需要改模型权重,这只有开放权重模型做得到。Anthropic 说团队此前从没做过这件事,前后花了约 2200 个 GPU 小时,成本约 4400 美元,处理后拒绝率从 95% 降到 3% 至 14%。作为对照,带防护的 Claude 模型在同样的测试里没有被攻破。
报告的建议有三条:让防守方拿到同等或更强的前沿模型;政府对高能力模型做安全测试;开放权重模型的开发者加上相应的防护。本站未查到智谱对这份报告的公开回应。
另一份评估给出的数字不太一样
美国商务部下属的 CAISI(AI 标准与创新中心)在 9 月 17 日也发布过一份 GLM-5.3 网络能力评估。它的判断是,GLM-5.3 是目前网络能力最强的开放权重模型,但明显落后于美国前沿模型,综合下来差约 4 个月。
两家的数字口径差得很远。CAISI 版本的 ExploitBench 上,GLM-5.3 是 61.1%,美国最好的前沿模型是 100%,此前最好的中国模型是 32.2%;SEC-Bench Pro 上是 40.4% 对 90.2%。Anthropic 的 12% 来自它自己的测试配置,两份成绩不能直接比。
排序上两份报告是一致的:GLM-5.3 在开放权重阵营里领先,离美国最强的闭源模型还有距离。分歧在于怎么看这段距离。CAISI 强调”还差 4 个月”,Anthropic 强调的是这种能力已经可以被任何人下载、改造,防护层起不到约束作用。
对国内开发者和企业来说,这份报告的直接影响可能落在海外渠道上。GLM-5.3 此前在海外的 API 分发和托管平台上架较广,如果更多美国机构沿用 Anthropic 的这套判断,海外云平台和企业客户对国产开放权重模型的上架审核可能会收紧。这一点目前还只是推测,各平台还没有动作。
参考来源:Anthropic 研究报告、美国 NIST 下属 CAISI 评估公告、CocoLoop;ExploitBench 成功次数、绕过成功率与消融成本以 Anthropic 报告口径为准,CAISI 数据以其自有测试配置为准。