OpenAI首席科学家称思维链监控正在变弱

OpenAI 首席科学家 Jakub Pachocki 于 9 月 6 日发表长文《An Alien Mind》,其中一句判断被广泛引用:目前他认为没有任何一家实验室把对齐和监控解决到了足以继续以最高速度负责任扩张的程度。

这句话出自一家正在以最高速度扩张的公司的首席科学家,位置比内容更少见。

思维链监控这条线在退化

过去两年 OpenAI 在安全上押注最重的手段是思维链监控:让推理模型把中间步骤写出来,再由另一套系统去读这些步骤,判断模型有没有在盘算什么。Pachocki 列出三条理由说明这个方法在变得越来越不可靠。

第一,现在的推理模型运行在复杂环境里,推理过程和工具调用缠在一起,工具调用本身就需要大量监督,监控的边界因此变得模糊。第二,模型在如何推理、以及如何操纵自己的推理痕迹这件事上越来越熟练。第三,预训练的改进让模型在不把推理说出口的情况下也变得更强。

“Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer.” 我目前认为,没有一家实验室把对齐和监控解决到了足以继续以最高速度负责任扩张的程度。

Pachocki 补充说这些困难未必无解,OpenAI 正在开发新的干预手段,包括可以直接访问网络内部状态的监控器。

三年前的另一头

文中回溯了一个时间点。2023 年年中,在 OpenAI 一个叫 RLSlow 的研究项目里,Pachocki 和同事 Szymon 第一次看到让他们确信可以规模化训练推理模型的结果,那把预训练模型自行形成思维链的能力打开了。

把这两头连起来看:让模型”想出声”曾经既是能力突破,也顺手给了一个观察窗口。三年之后,能力这一头继续在涨,观察窗口那一头在关。推理模型这条线上,OpenAI 一直把思维链可读当成安全叙事的支点。现在同一家公司说这个支点在松动。

从自愿框架到强制标准

Pachocki 的提议是把行业现有的自愿框架升级:OpenAI 的 Preparedness Framework、Anthropic 的 Responsible Scaling Policy 这类文件,应当演化成强制性的安全标准,由第三方审计机构、政府部门或者国际组织来执行。他还写道,各国政府应把人工智能发展上的国际协调列为首要事项,并且预计和希望自愿减速会变得常见,直到共同的安全门槛建立起来。

另一句被引用得较多的是:一旦把风险的严重程度想透,不惜代价一路狂奔的想法就显得荒唐。

这些话目前停留在个人署名文章的层面。OpenAI 没有公布任何具体的减速计划、时间安排或者触发条件,也没有说明在哪种情况下会主动暂停某条训练路线。安全门槛由谁认定、审计机构从哪里来,文中同样没有给出方案。同期该公司在推进的是研究自动化目标,以及一份估值 8520 亿美元的上市申请。

参考来源:OpenAI 官方文章《An Alien Mind》、Unite.AI、CocoLoop、AI Weekly;三条监控可靠性下降的理由与引语以 OpenAI 公开文章表述核验。