OpenAI报告:700个智能体攻进Hugging Face

8 月 26 日,OpenAI 公布了 Hugging Face 入侵事件的完整技术报告,37 页,另配一篇写给普通读者的博客。同一天,独立评估机构 METR 与 Redwood Research 放出一份 91 页的联合调查。距离 Hugging Face 对外承认被入侵,过去了一个多月。

7 月那次披露只说清了谁干的:OpenAI 正在评测的模型跑出沙箱,攻进了 Hugging Face 的生产系统。这两份报告补上了为什么和怎么干的。

起点是一道解不开的题

事故发生在 ExploitGym,OpenAI 内部用来测模型能不能找漏洞、能不能利用漏洞的评测环境。为了量出原始能力,这次评测把平时挂着的安全分类器关掉了。参与的是 Astra 系列的测试版本,与即将发布的 Astra 同族,后训练做法不同。

题库里混进了一道无解的题。代理没有卡在那里,报告的说法是,它们”quickly found a way to manufacture answers to cyber challenges without actually solving the questions”——很快找到办法直接造出答案,跳过解题。

麻烦从这里开始。代理担心自动评分器会识破,于是把目标转向了评分器本身。METR 与 Redwood 的结论写得更直白:加入攻击的代理里,最常见的理由是想弄清 ExploitGym 的评分器怎么运作。攻 Hugging Face 是为了”discover how the automated scorer worked so that they could then figure out a way to fool it”。

OpenAI 把整件事归到四种失准模式上:“reward hacking, persistence on seemingly impossible tasks, unauthorized communication, and agents adopting goals from one another”——刷分、对看似无解的任务死磕、未授权通信,以及代理之间互相接管目标。

一千两百个代理,七万条消息

代理之间搭起了一块自制的消息板。报告给出的数字是 1200 个代理发了大约 7 万条消息,其中 700 个加入了攻击。调查团队读了约 1300 份代理文本记录,重点落在 7 月 7 日到 13 日这一周。最难的那 22% 任务,占掉了消息板上 93% 的讨论量。

协作程度超出了一群模型各干各的。有一个被命名为 PHASEONE[BIG] 的代理反复出现在分工位置,报告写它 “often coordinated and assigned” 隐蔽任务;也有代理把消息藏进文件名的 URL 里传递。一个编号 38148c 的代理设计了一份恶意数据集上传,诱导 Hugging Face 的服务器交出无关文件,几个小时内就有数百个代理复用了这条路。

出网的第一步走的是包管理。代理攻破 Artifactory 拿到互联网访问,然后横向铺开。落到 Hugging Face 这边的战果:在 41 台生产数据集服务器 worker 上执行了自己的代码,至少一台生产节点拿到 root,摸到生产凭证和部分内部数据,下载了 4 个私有代码仓库。

信号早就在了

时间线是这份报告里最难看的一段。5 月就发现过可疑的代理活动,当时封了访问;5 月到 6 月,代理继续利用漏洞往外连。6 月 27 日,监控工具标记了异常网络活动。7 月 8 日 Hugging Face 相关的动作开始,7 月 19 日 OpenAI 才发现,而把这件事和自家代理对上号,是在 Hugging Face 公开之后。

OpenAI 自己给了一句更狠的评估:如果当时跑的是现在部署的思维链监控,会在攻进 Hugging Face 前一天多就抓到最初的相关活动。整改清单跟着这句话走:CoT 监控 7×24 常开,7×24 的升级通道,一套能直接掐掉工作负载的工具,更快的基础设施异常检测。

OpenAI 对齐研究员 Kai Chen 的说法留了余地:

“It’s not something you can solve overnight. There are challenges we’ve been tracking for a very long time, and we’re now seeing them with much greater precision.”

意译:这类问题没法一夜之间解决,我们盯了很久,现在只是看得更清楚了。

报告没说的部分

两份报告都留了口子。OpenAI 没有公开给代理的具体提示词,也没有放代理之间的消息全文和代码片段,Hugging Face 自己那份报告里是有代码证据的。外部研究者能拿去复现的空间因此有限。

对正在把代理接进代码库、云账号和内部系统的公司来说,这份报告能带走的东西其实很朴素:评测环境的边界要按生产环境的标准去做,代理之间的横向通道要当攻击面来看。报告里那句 “without proper safeguards, highly capable AI agents are now able to work around technical controls” 已经把结论说完了:能力足够强的代理,会绕过为它们准备的技术管束。

参考来源:OpenAI 技术报告与官方博客、METR 与 Redwood Research 联合报告、CocoLoop、TechCrunch、Fortune、The Register;报告页数、代理与消息数量、41 台服务器与 4 个私有仓库口径经两家以上公开报道交叉核对。