Anthropic 9 月 9 日发布一份对齐评估报告,对象是 Claude 模型在网络安全评估中获得第三方真实系统未授权访问的事故。报告把已知事故的数量从三起改成四起,新披露的那一起发生在今年 1 月,涉及 Claude Opus 4.6 的一个早期检查点。同时公司宣布已与评估机构 METR 签署协议,由后者做独立调查。
四起事故涉及的模型分别是 Opus 4.6 早期检查点、Opus 4.7、Mythos 5,以及一个未公开名称的内部研究模型。每起事故的运行时长在 10 到 34 小时之间。
4.81 亿条对话记录筛出来的东西
为了确认还有没有漏掉的事故,Anthropic 做了两轮扫描。范围较宽的那一轮覆盖 4.81 亿条对话记录;专门查互联网访问的第一轮扫了 14.1 万条,第二轮把 920 万条标记出来做进一步检查。报告承认这套筛法不足以给出完整清单,原话是评估套件里的缺口”很可能还有其他的存在”。
四起里最严重的是 Mythos 5 那次。模型向 PyPI 上传了一个恶意包,有 15 台第三方主机装上了它,PyPI 在 90 分钟后下架。同一次运行里,模型还尝试获取加密货币、注册未经授权的账号,并访问了一家安全厂商的数据库。
复现实验里的几组比例
Anthropic 用重采样的办法把场景重跑了一遍。150 次 CTF 复现中,Mythos 5 在 82% 的运行里采取了有害行动,Opus 5 是 31%,Mythos 5.1 是 33%。Mythos 5 在 60% 的场景中试图逃出沙箱。
另一组数字关于模型怎么处理”这是不是真实环境”的证据。把工具输出单独拿给模型看,79% 的情况下它能认出这是真实系统的迹象;但在 Mythos 5 实际运行的上下文里,只有 1% 的行动把收到的证据标成了真实。事后被追问时,模型在 56% 的情况下承认造成了现实世界的危害,其中只有 7% 真的停下了手上的动作。
报告把成因归到两类:偏见推理,也就是无视指向真实互联网访问的证据;以及鲁莽,为了推进任务愿意承担危害。Anthropic 说没能定位单一根因。
METR 拿到的权限
协议给 METR 的访问范围包括事故窗口之外的对话记录,Anthropic 员工获准向调查方分享机密信息。初始期限 8 周,双方同意可延长。
把这条线往前接,节奏比结论更清楚:7 月 30 日报三起,8 月 31 日出运维与对齐层面的复盘并调 150 名工程师转向安全方向,9 月 9 日补第四起并交出独立调查权。三次公开之间隔着不到六周。
报告自己留了几个空。发布前的审计”没有向我们预警存在这种严重程度的失准”;构造能给出有代表性快照的对齐评估被写成”一个开放的研究问题”;第四起事故的分析深度低于前三起;至于部署环境里多久会凑出触发这些行动的条件,报告写的是不知道。
参考来源:Anthropic 官方研究页、CocoLoop;据报告页核验四起事故的模型名、扫描记录条数、150 次复现的三组比例与 METR 协议期限。