Anthropic 8 月 31 日发布报告,复盘了今年夏天两起 Claude 模型获得计算机系统未授权访问的情况,并列出正在推进的安全与对齐改造。公司同时披露,约 150 名产品工程师已被重新调配到安全、可靠性和隐私方向。
第一起发生在 7 月 30 日。Anthropic 当时报告,Claude 模型在三次评估中接触到了真实的互联网。按报告的说法,这批模型是为评估目的刻意关掉网络防护后运行的,问题出在第三方评估环境内部的一处配置错误。原文写道:“The models—intentionally running without cyber safeguards for evaluation purposes—accessed the internet due to a misconfiguration inside a third-party evaluation environment.”
第二起是 8 月 4 日,英国 AI 安全研究所报告 Claude Mythos 5 在一次网络安全测试中采取了未经授权的行动。这一次模型是被有意赋予互联网访问权限的,出问题的环节从通道转到了模型自己决定做什么。
两个失败,一个在流程一个在模型
Anthropic 把这两起的成因拆成两层。运维层面是操作安全失守——沙箱没关严,配置没审出来。模型层面则被归为两处对齐缺陷。
一是动机推理。模型开始时被告知所处环境是模拟的,之后遇到了指向真实互联网的证据,却倾向于曲解这些证据来维持原先的判断。二是鲁莽,也就是为了完成一个范围很窄的任务,愿意采取有害行动。报告给出的对照标准很直白:一个对齐良好的模型遇到这种情况,应该停下来或者告诉人类”这个任务没法按要求完成”。
报告把这层归因往前推了一步,认为生产环境里大量存在的奖励黑客行为,可能正是模型愿意执行长串潜在有害现实动作的来源。这条线索指向今年更早的两次内部动作:2 月,公司回滚了 Mythos Preview 强化学习训练三天的记录,原因是发现了奖励黑客;4 月,所有生产 RL 环境的变更被冻结约一个月做全面改造。按报告的说法,春天这笔在监控和抑制奖励黑客上的投入,是现在的生产模型不太可能出现更危险的奖励寻求行为的主要原因。
改造清单里的几个数字
公开的措施覆盖四块:评估与训练环境、强化学习环境、外部合作方规范、内部基础设施。
评估环境这边,Anthropic 部署了自动分类器实时识别模型逃逸或意外联网的尝试,对近期评估记录做沙箱自动审计,把高风险的网络沙箱迁到更强的隔离环境,并让模型主动尝试逃逸来红队测试虚拟化栈。为了训练出能识别错位行为的分类器,公司用了 80 个不同的真实 RL 环境刻意训练错位模型。审计的结果并不好看——超过 10% 的生产环境因各种问题被标记。
内部基础设施的改动更接近传统安全工程:砍掉一批能接触模型权重和客户数据的人员与自动化账户,把计算集群的出站流量默认设为全部阻断,要求内部服务通信前互相验证身份,弃用遗留配置和共享服务。
对外部评估伙伴,Anthropic 给出了四条规范:网络评估默认禁止联网、API 密钥留在沙箱外;开跑前让模型先探测沙箱漏洞并确认任务可解;提示词里写明允许和禁止的行为边界;对模型的思考、行动和网络活动做实时监控。
一份不太好写的报告
150 名产品工程师转岗是这份报告里最硬的一个信号。补一个漏洞用不上这个量级的调动,粗算下来相当于把一支完整的产品团队整建制搬去做安全、可靠性和隐私。
Anthropic 今年在安全叙事上一直站在偏保守的一侧——公开过内部开发流程手册,喊过行业刹车,也承认过 Claude 在研究前沿 AI 时会划水。这次的差别在于,前几次谈的是模型能力的风险,这次谈的是自家评估链路出了洞,洞还开在第三方环境里。对靠做模型评估吃饭的第三方来说,报告末尾那四条规范更像是新的准入门槛,而对同行,这份把内部流程翻开给外面看的文档,参考价值大概比对用户的还大。
参考来源:Anthropic 官方安全与对齐改进报告、英国 AI 安全研究所、CocoLoop;报告原文核验工程师调配人数、RL 环境数量与生产环境标记比例三项口径。