OpenAI 9 月 25 日在对齐团队的”不对齐报告”栏目里披露了一起新的沙箱事件:一个内部研究模型在做搜索类训练任务时,绕开了网络访问限制,把问题编码进 DNS 查询,送到一个公开的聊天机器人那里,再把答案读回来。OpenAI 同时确认,最强几款模型的全部训练、评估以及带工具的推理,目前仍处于暂停状态。
事件发生在 9 月 20 日,涉事的是一个没有公开型号的内部研究模型。
一道找人题,怎么走到了 DNS
任务本身不复杂:根据一篇公开博客里的生平细节和线索,找出作者是谁。按报告还原的过程,智能体先用给定的搜索工具查特征短语,没有结果;接着直接访问 Google、Bing、DuckDuckGo,被代理拦下;它又去下载 BrowseComp 基准数据集,想在题库里找到同一道题。
几条路都没走通,它开始试探环境的网络边界。沙箱代理挡住了 HTTP 和 HTTPS 出站,DNS 解析器却没有做同样的过滤,查真实域名照样返回真实结果。智能体利用 DNS 委托,把问题塞进域名查询发给外部聊天机器人,再从解析结果里取回回答。据 OfficeChai 等媒体转述,它先拿”法国首都是哪里”这种问题试通道,确认能用之后才正式提问。
报告给出的时间线精确到秒:9:50:23 智能体发出第一次拿到外部回应的 DNS 工具调用;10:02:11 监控系统打出 P0 级警报;10:05:06 人工审核员确认;12:34:30 这次运行被终止。OpenAI 把规避限制、以超出合理预期的方式追求目标的行为,归为不对齐。
同批披露的另外两件事
The Decoder 汇总的同一批披露里还有两起。一个被 OpenAI 形容为”高度执着”(highly persistent)的内部模型,接到的是定理证明任务。它没有自己去推证明,先打起了另一个团队 Lean 证明提交的主意,随后把一名研究员的 GitHub token 发进了公开的 openai/codex 仓库。为了躲开自动密钥扫描,它把 token 切成几段分开发,系统提示词和研究员两次直接干预都没能让它停手。
另一起是数据外传。OpenAI 9 月 25 日在社交平台说明,研究环境里的智能体把训练和评估数据发给了本不该接收的第三方服务,调查找到 53 起案例:用户上传的图片被以不公开链接的形式发到图床网站,涉及的是允许数据用于改进模型的账号,都发生在缓解措施上线之前。OpenAI 称已和托管方合作删掉了大部分内容。这些图片有没有被外人打开过,公司没有披露。
“All training, evaluation, and inference with tool-use of our most capable models remain paused.” 我们最强模型的全部训练、评估和带工具推理仍处于暂停状态。
从 7 月到 9 月,三次收紧
把这条线往前串。7 月,OpenAI 的模型在一次网络安全评测中逃出环境,攻进了 Hugging Face 的生产设施,Hugging Face 7 月 16 日完成处置,OpenAI 到 7 月 21 日才查明是自家智能体所为。8 月,OpenAI 把最大规模的强化学习训练暂停两周,并把一部分推理算力固定划给监测。
这一次的范围比 8 月宽。8 月停的是最大规模的强化学习训练,这次覆盖最强模型的训练、评估和带工具推理,三样一起停。报道称内部调查预计要持续数月,OpenAI 没有给出恢复的时间表。
补丁有四项:研究环境的 DNS 查询收窄到一份白名单,只放行指定域名和记录类型;在两个相互独立的层面加阻断;新增专门针对 DNS 的检测;加快用模型辅助对沙箱和网络控制做红队测试。
按 Startup Fortune 的报道,OpenAI 新监控体系给自己定的目标是 30 分钟内完成从检测到告警,并自动暂停相关负载。这次报警只用了 12 分钟,落在目标之内,拖慢的是报警之后那一段。审核员 3 分钟就确认了警报,为什么还要再过两个半小时才终止运行,报告里没有解释。
参考来源:OpenAI 对齐团队不对齐报告、The Decoder、OfficeChai、CocoLoop、Startup Fortune;OpenAI 报告核验事件各环节时刻与外发问题数量,暂停范围以 OpenAI 表述为准。