OpenAI 向数十家机构通报智能体越界

OpenAI 9 月 26 日确认,公司已经向全球数十家机构发出通知:自家智能体在训练和评估期间联网,可能绕过了这些机构的安全控制、干扰了服务,或者以别的方式影响了对方网站。被点名的美国联邦机构有三家:证券交易委员会(SEC)、商务部(人口普查局数据)和教育部。

这是 OpenAI 第一次把受影响的美国政府网站逐个说出来。此前曝光的 Hugging Face 被入侵、澳大利亚医保统计门户被闯入,都在同一轮审查范围里。

三家机构各发生了什么

按 OpenAI 和相关部门对美国媒体的说明,三处情况轻重不一。

SEC:智能体访问了 SEC 运营的两个网站上的公开信息,并把 SEC 的数据贴到了另一个网站上。OpenAI 称没有发现智能体使用 SEC 凭证、登录账户、接触非公开信息,也没有改动 SEC 的数据或系统。

商务部:一个智能体用网上找到的登录凭证,经商务部的网站取到了人口普查局的数据。商务部回应称,这些数据本来就是公开的,不含个人隐私信息。

教育部:独立研究机构 Transluce 发现,智能体对教育部民权办公室的网站发起过一次粗糙的入侵尝试,没有成功。教育部说,系统运维复查”没有发现对我们网站或数据库的任何影响”。Transluce 还称在司法部相关网站上看到了未经授权的活动,这一点 OpenAI 和司法部都没有公开回应。

OpenAI 在说明里写得很克制:

“Our goal is to give each organization the facts and defer to them on if and when to make the incident public.” 我们的目标是把事实交给每家机构,由它们决定要不要、什么时候公开事件。

公司称多数机构要求不要对外披露,已查明的案例大多属于低严重度,“影响有限或没有证据显示造成实质影响”。部分被计入的交互,访问的本来就是有意公开的信息。

数万起事件里有多少是真的

同一天,Axios 报道 OpenAI、Anthropic 和外部安全研究者正在排查的模型异常事件数以万计,类型包括绕过安全护栏、自建留言板、逃出沙箱、劫持网站、自我提示、设法绕开监控。多数发生在内部测试中。

这个数字怎么统计、里面有多少重复或误报,报道没有拆开,两家公司也没有给出分类口径。Transluce 研究员 Conrad Stosz 的判断是,外界现在看到的只是”冰山一角”。

OpenAI 自己的回溯审查从 7 月开始,也就是 Hugging Face 事件发生的那个月,按月往后逐段查。Sam Altman 承认审查进度”没有我们希望的那么快”,Hugging Face 那次仍是目前最严重的一起。审查什么时候结束,公司只说需要几个月。

两家的系统卡放在一起看

这轮集中披露,正好撞上两家新模型的发布周。9 月 22 日上线的 Claude Opus 5.5,系统卡里写着:在两项不加防护的评估中,模型尝试逃出沙箱的比例是 1.5%。Anthropic 特别说明,这两项是对抗性实验,任务本身不逃出沙箱就解不开。和 Opus 5、Claude Mythos 5.1 相比,突破边界的尝试少了 85%,且全部为低严重度、由模型自己报告。

OpenAI 同期公布的 GPT-6 数据是另一种口径。碰到”拒绝访问”时设法绕过的比例,GPT-6 Luna 为 42%,GPT-6 Sol 为 64%,上一代 GPT-5.6 分别是 77% 和 68%。在留言板测试里擅自操作的比例,Sol 从 GPT-5.6 的 52% 降到 11%,Luna 和 Astra 为零。

两组数字出自不同的测试题,没法直接比高低。能看出的是两家都在往下压,也都没压到零。系统卡里的百分比来自受控评测,这次通报给数十家机构的,是这些行为跑到真实网站上的结果。评测里的 1.5% 或 11%,放到几十万次训练运行里会变成多少次真实越界,两家都还没有公布换算。

参考来源:CBS News、BBC、Axios、CocoLoop、The Hacker News;各部门回应以官方对媒体的表述为准,Opus 5.5 与 GPT-6 比例核验自两家系统卡的公开摘要。