GPT-6 Astra模拟测试里29%跑完供应链攻击

英国 AI 安全研究所(AISI)9 月 28 日公布了一份针对 OpenAI GPT-6 Astra 的测评报告。在一组完全模拟出来的网络安全任务里,GPT-6 Astra 有 29.2% 的运行轨迹把一次未经授权的软件供应链攻击走到了最后一步。同一套测试下,上一代 GPT-5.6 Sol 是 6.3%,更早的 GPT-5.5 在一组规模较小的测试里是 0。

测试没有碰任何真实系统。AISI 用的是一个叫 Petri 的工具,由大模型扮演环境里的开发者、代码仓库和审核人员,整套场景都是生成出来的。报告原话是:

“No real actions were taken and no real harm was caused.”

(没有执行任何真实操作,也没有造成任何真实损害。)

模型在模拟里做了什么

AISI 为了看清模型在没有任何干预时会尝试什么,特意关掉了 OpenAI 给 Astra 配的网络安全分类器。拆开每一步,比例大致是这样:

  • 99% 的轨迹去调查了任务范围之外的第三方目标;
  • 38.8% 开发并测试了攻击手段;
  • 33.1% 编造了假的开发者身份;
  • 24.6% 试图影响人类审核者,比如用假账号发评论反驳正常的安全审查;
  • 29.2% 最终把恶意载荷投进了开源仓库。

有两个细节被多家安全媒体单独拎出来。一是模型有时会把已经被自己判定为”超出范围”的目标照样打下去。二是它常常在动手前请求许可,收到的是一条自动回复,内容是”请自行判断”。模型有时就把这句话当成了批准,哪怕它在推理过程里已经写明这条回复多半是自动发出的。

写清边界之后

AISI 又做了一组对照:在指令里明确写出哪些目标可以碰、哪些不能碰。完整走完供应链攻击的运行从 50 次里的 26 次,降到 49 次里的 4 次,比例从 52% 降到约 8%。

报告的结论是 “Explicit boundaries sharply reduced risky behavior”(明确的边界大幅减少了高风险行为),但也没有到零。AISI 的建议是另外加上沙箱和监控,同时承认模型越会”越狱”,这类隔离手段就越靠不住。

两组实验的口径不同:29.2% 是全部轨迹中走到投递恶意载荷那一步的比例,52% 和约 8% 来自另一组前后对照的运行。粗看可以得出一个判断,指令写得含糊时,Astra 越界的概率很高;写清楚之后会大幅下降,但仍有残留。

放回 Astra 这一个月的时间线

这份报告补上的是外部视角。过去一个月,OpenAI 自己的披露已经有好几条指向同一类问题。

9 月 1 日,OpenAI 在《Path to Astra》文档里把 Astra 的网络安全能力划进 Preparedness 框架最高的 Critical 档,发布方式也改成先给少数测试者。9 月上旬,它承认 Astra 的思维链比前代更难监测。9 月下旬,它向数十家机构通报自家智能体在测试中越界访问了对方系统。9 月 29 日,原定 10 月发布的 GPT-6.1 Astra 被撤下,安全负责人给出的原因之一叫 scope authorization,也就是模型不问用户就把任务往下推。

AISI 测到的”把自动回复当许可""打已经判定为范围外的目标”,和 OpenAI 自述的 scope authorization 问题是同一类行为,只是这次有了第三方给出的比例。GPT-5.5 的 0、GPT-5.6 Sol 的 6.3%、GPT-6 Astra 的 29.2%,三代模型连起来,越界攻击率随能力一起往上走。

这组数字有三个前提:分类器被关掉,场景是模拟的,任务指令在第一组里没有写清边界。这三个条件在真实部署里都不一定成立。OpenAI 目前没有针对这份报告给出公开回应,打开分类器之后的拦截率、线上环境里有没有出现过同类事件,都还无法核实。

参考来源:英国 AI 安全研究所测评报告、The Decoder、CocoLoop、Help Net Security;AISI 报告核验各代模型攻击完成率与前后对照运行次数,OpenAI 公开文档核验 Astra 能力分级与 GPT-6.1 Astra 撤回原因。