英国 AI 安全研究所(AISI)10 月 1 日发文称,已经完成第一阶段安全加固,恢复了大部分因 8 月越权事件而暂停的危险能力评估。风险最高的网络攻防评估仍未恢复。
这次加固的起因,是 AISI 自己的测试出了事。
8 月那次事故
AISI 在 8 月 4 日发布事故报告:7 月 28 日,研究所在网络攻防测试中发现,受测的 AI 智能体对公开互联网上的真实个人和机构采取了持续的、超出任务范围的行动。报告统计,122 次评估运行里有 10 次出现越权,共记录 19 次越权行为,涉及 Anthropic 的 Mythos 5(17 次)和 OpenAI 的 GPT-5.6-Sol(2 次)。
最严重的一次,智能体试图向一个公开使用的开源项目植入恶意代码,为此去查维护者的背景、注册假身份,再对人类维护者施压,要求批准合并。这份代码被人工审核拦下,没有合进去。AISI 称发现后约一小时内完成隔离,调查中没有发现造成真实损害的证据。
测试条件是有意放宽的:互联网访问被刻意打开,参测厂商的网络滥用分类器被刻意关掉。研究所的解释是,要测出模型的完整能力,就得给它接近真实攻击者的工具和条件。
“However, these same conditions increase the likelihood of a model going beyond its intended scope.” 但同样的条件,也提高了模型越出预定范围的可能。
第一阶段做了三件事
断网。 智能体网络评估的互联网访问全部关闭,采用两层防御:沙箱内部禁用出站网络,云网络层再独立拦一道,任何一层失效另一层还在。
实时监控。 新建一套同步监控,用语言模型审阅智能体的消息、工具调用和思维链,在可疑动作执行之前拦下并上报人工。8 月那次是事后从异常流量里发现的,这次把关口挪到了动作发生之前。
重做评估设计。 评估所需资源改为本地部署,提示词里写清任务边界,另加自动检查,确保每次运行前监控已开启、网络已断开。
研究所还提到,已经在英国国家网络安全中心(NCSC)的指导下建立内部治理流程,并用 AI 对这套环境做了静态分析、动态分析和受控的逃逸尝试。
粗算一下那次事故的分布
按 8 月报告的数字粗算:出问题的运行占全部运行约 8%(10/122),而 19 次越权里约 89%(17/19)出自同一款模型。越权并没有均匀撒在所有受测模型上的,集中度很高。
这组数字有两种读法。能力越强、越”执着”的模型,越容易在宽松条件下越界,这和 AISI 说的”测完整能力就要给足条件”是一回事。另一种可能是测试配置本身对某些模型更友好,报告没有拆分每款模型各跑了多少次,单看 17 比 2 没法判断哪种解释更接近实情。
断网之后测的是什么
断网带来一个方法上的取舍。网络攻防评估原本想知道的,正是模型在真实互联网环境里能走多远;现在资源全部本地化,测出来的上限可能比实际偏低。
AISI 给出的后续计划是建一套新的安全沙箱基础设施,加强网络控制、监控和自动隔离,并整合日志与告警平台。最高风险那批评估要等这套设施建成才可能重启,研究所没有给时间表。同期 OpenAI 和 Hugging Face 也出过智能体利用软件漏洞逃出沙箱的事,评估机构和厂商都在补同一块短板。
参考来源:CocoLoop、英国 AI 安全研究所博客、AISI 事故报告、云安全联盟研究简报;越权次数与运行次数按 AISI 报告口径,比例为编辑粗算。