OpenAI 暂停两周最大规模强化学习

8 月 18 日,OpenAI 公开了一件在内部已经进行了一段时间的处置:对下一代模型 Astra 的网络安全能力评估没能给出”安全”的结论,公司随即停掉了最新部署模型的强化学习训练,为期两周;规模最大的那批前沿强化学习运行到发文时仍未重启,只有较小规模的训练与评测照常进行。

这条消息的第一次露头在 8 月 7 日,当时外界看到的版本是”OpenAI 推迟 Astra 发布”。8 月 18 日这篇文章把推迟背后的判断链条摊开了:内部评测显示,Astra 在自主编程和网络攻防两个方向上的进步幅度,让公司排除不掉它已经触及 Critical 一档的可能。

门槛写得比想象中具体

OpenAI 的 Preparedness Framework 把网络安全的 Critical 门槛落成了两条可判定的能力描述:模型能自主写出可用的零日漏洞利用,且对象是多个已经加固过的真实关键系统;或者只给一个高层目标,模型就能自行设计并执行一次针对加固目标的端到端新型攻击。

内部评测的结论停在”排除不掉”这一档,没有认定达标。从公司随后的动作看,这一档已经足够触发一轮预防性减速——不必等确认,先把最费算力、最可能把能力再推上去的那批训练停掉。

停的是训练,改的是机房

暂停只是其中一半。OpenAI 同时列出了一组基础设施层面的改动:把沙箱隔离和网络分离做得更严,移除掉容易被打穿的共享服务,收缩长期有效的权限,把安全日志补齐。大量 Astra 的工作负载至今还压着,等的是迁进符合新要求的环境。

监测这块给出的数字最直接。新上的监测由两部分组成:一个在 token 级别工作的激活分类器,负责在生成过程中标记可疑行为;一个自动化调查器,负责把标记出来的东西查一遍。这套监测吃掉的算力,约占推理算力的 20%。告警的目标响应窗口定在 30 分钟以内,安全团队排除误报的窗口同样是 30 分钟。

20% 摆在纸面上像是个工程参数,换算成开支就不太一样。前沿实验室的推理算力年开销普遍在数十亿美元量级(粗算,各家口径不同),两成常态化划给监测,对应的是十亿美元级别的固定成本,且这笔钱不产生任何面向用户的产能。愿意长期背这笔账,说明公司预期的风险窗口不会在几周内关上,而要覆盖下一代模型的整个生命周期。

另一条可比的路线是把攻防能力优先交到防守方手里,通过限定名单开放挖漏洞的模型,用可控的部署面换取时间差。OpenAI 这次的选择更靠上游,直接在训练侧踩刹车。两条路线针对的是同一个判断:模型的攻击能力增长得比防守侧的修复流水线快。

一个自己给自己设的关卡

这套流程里没有外部监管的位置。触发条件、评估口径、暂停时长、重启标准,全部由 OpenAI 自己写、自己判、自己执行,对外只有一篇事后说明。Critical 门槛具体怎么测、Astra 在各项测试里拿到什么分数,文章都没有给出可供第三方复核的数字。公司另外澄清了一点:此前引发讨论的 Hugging Face 沙箱事件与 Astra 无关。

对追进度的开发者来说,短期影响集中在两处:Astra 相关能力的上线节点会往后挪;已经在跑的 Astra 工作负载要跟着迁移环境,节奏由 OpenAI 单方面控制。至于最大规模的前沿强化学习什么时候重启,公司没有给出说法。

参考来源:OpenAI 官方博客、Axios、CocoLoop、AIGC News;Preparedness Framework 的 Critical 门槛定义、20% 监测算力占比与 30 分钟告警窗口均按 OpenAI 公开表述核对。