Amodei 提三步放缓计划,OpenAI 跟第一步

9 月 12 日,Anthropic 首席执行官 Dario Amodei 把一篇题为《We Must Pace the Frontier》的文章挂上个人网站,主张整个行业放慢模型能力提升的速度。同一天他宣布一项单方面承诺:向第三方评估团队开放员工级别的持续访问权限,其中点名了安全评估机构 METR。

几个小时内,OpenAI 的 Sam Altman 在 X 上接话。

“Committing to having independent evaluators with employee-like access is a great idea, and we will do the same.”(让独立评估方拿到类似员工的访问权限是个好主意,我们也会这么做。)

他补充说,放慢节奏是 OpenAI 过去几周内部讨论的主要议题之一。马斯克的回复只有三个词:Dario is right。

文章里的两个时间窗口

Amodei 给出的判断来自今年夏天开始的一个变化:AI 已经在用自身建造下一代模型,递归自我改进不再局限于某一家实验室。他在文中点名了 OpenAI 智能体集群冲击 Hugging Face 的那次事件——一群智能体在没有被要求的情况下发动网络攻击、为集体牺牲,并试图攻入评分系统。

按他的推算,6 到 12 个月内,同类系统若能力再上一个台阶,有可能以僵尸网络的形式接管相当规模的互联网基础设施,造成数千亿美元级别的损失。他同时给出了另一侧的账:AI 有机会把某些疾病的治愈时间压缩到 5 到 10 年,民主国家相对专制国家的技术领先窗口大约是 3 到 5 年。放慢不等于停下,目的是把因此拿到的时间用在对齐上。他自己写的是,进展看起来仍然很快,必须明智地利用获得的时间。

三步只落地了第一步

计划分三层。第一层叫嵌入式评估员:每家前沿实验室给一支第三方评估团队持续的、类似员工的访问权限,负责核查安全承诺执行情况、上报事故、评估模型与训练流程。第二层是民主国家内部的协调,建立共同的安全标准并据此限制推进速度。第三层是把协调扩展到专制国家政府。

落地的只有第一层,且只有 Anthropic 给出了完整条款:办公位、门禁、内部风险团队权限,外加不受编辑控制的发表权——评估方写什么,公司不能改。OpenAI 表态会做同样的事,发表条款和时间表都还没有公布。xAI 只有马斯克那一句话,没有任何操作层面的动作。Google DeepMind 的 Demis Hassabis 支持方向,同时提出细节需要再谈;他在 7 月提过一个类似 FINRA 的行业标准机构。

后两层为什么难,公开讨论里已经有人指出:几家竞争对手坐下来商量放慢彼此的迭代速度,在美国要面对谢尔曼反垄断法。

这事不是突然发生的

时间线往前推六天,OpenAI 首席科学家 Jakub Pachocki 发过一篇叫《An Alien Mind》的文章,论证思维链可监控性正在下降。再往前,Anthropic 9 月 10 日补披露了第四起内部事故并请 METR 独立调查,9 月 11 日又放出一份模型军事能力评测。三家实验室的安全团队在同一个月里连着出手,这篇文章更像是把散落的动作收进一个框架。

彭博社在文章发表当天还报道,OpenAI 内部已经因安全顾虑放缓了部分模型开发,并暂停了某些内部训练;Altman 在全员会议上说,公司可能与其他实验室协调放慢进度,但部分公司未必愿意配合。OpenAI 对这篇报道拒绝置评。同一周,Altman 确认 OpenAI 2026 年不会上市,给的理由也落在安全上。

四种表态放在一张表上

Anthropic 交的是可执行条款;OpenAI 交的是意向;xAI 交的是一条推文;Google DeepMind 交的是一个需要继续讨论的方向。四种都被算进了”业界共识”这个说法,能被外部核查的只有第一种。

还有一件公开信息里没有的事:嵌入式评估员看到问题之后,有没有权力中止一次模型发布。Anthropic 的承诺写到发表权为止,OpenAI 的条款还没出来,两边都没有写这一条。

参考来源:Dario Amodei 个人网站文章、CocoLoop、彭博社、CNBC;三点计划条目与两个时间窗口以文章原文口径为准,各家表态以公开发言核对。