OpenAI 本周开除了三名做对齐和安全的研究员,理由是违规处理公司敏感信息。《华尔街日报》10 月 1 日先报出此事,当天晚些时候补上了三人的名字:Jasmine Wang、Tomek Korbak 和 Mikita Balesni。几乎同一时间,负责安全透明度工作的 David Robinson 也已离开公司,并在 10 月 3 日于《大西洋月刊》发表长文,标题直接写着他辞职是因为 OpenAI 的文化出了问题。
两件事前后只隔几天,碰到的都是同一块业务:OpenAI 怎么对外说明自己模型的风险。
公司只说了”违规”
OpenAI 对外的说法很短。公司确认与三人”分道扬镳”,原因是他们违反了接触和处理敏感信息的内部规定:
“Our investigation confirmed that these individuals mishandled sensitive information outside established company procedures, violating our policies and breaking the trust essential to our work.” (调查确认,这几人在既定流程之外处理了敏感信息,违反了公司政策,也破坏了工作所必需的信任。)
报道称,三人把与公司模型有关的机密信息分享给了一家第三方 AI 安全机构。具体是哪家机构、涉及哪类信息、范围多大,OpenAI 都没有披露。法新社联系当事人,没有得到回复。
外界的猜测集中在 Korbak 身上。他此前是 OpenAI 对接 METR 和 Redwood Research 两家评估机构的技术联系人,这两家参与调查了 OpenAI 智能体攻入 Hugging Face 的事件。不过也有媒体明确写到,目前没有迹象表明这次泄露的材料与 METR 或 Redwood 有关。另有报道提到,Jasmine Wang 加入 OpenAI 前曾在英国 AI 安全研究所工作。这些说法都还停留在媒体层面,OpenAI 没有确认三人的姓名。
Robinson 写了什么
Robinson 在 OpenAI 安全系统团队干了约三年半,负责把模型风险写给外界看。按公开报道,他主持过 12 次前沿模型发布的 system card(系统卡,即模型风险说明),也是 2025 年 4 月版《准备度框架》(Preparedness Framework)的主要起草人之一。这份框架是 OpenAI 判断某个模型危险到不加额外防护就不能发布的依据。
他在《大西洋月刊》里的核心意思是,“先发布、看哪里出事、再补防护”这套迭代部署的做法,在模型能力越来越强以后已经不适用,因为某一次错误之后可能就没有下一次修正的机会。文中最常被引用的一句是:
“The time for trial and error is over.”(试错的时代结束了。)
他批评实验室里”长期冲刺”式的工作节奏,主张前沿实验室应该像核电站或繁忙机场那样运转,层层冗余、慢慢规划,并从航空和核安全行业招可靠性工程师。他也写道,光靠具体规则或新法律不够,“我们需要谈的是文化”。据报道,OpenAI 的回应强调公司在必要时会暂停训练,并在扩大与外部评估机构的合作、改进实时监控。
把今年几次离开连起来看
站内此前的报道里,这条线已经拉得很长。7 月上旬,曾负责 Mission Alignment 团队、后转任首席未来学家的 Joshua Achiam 宣布离开;几天后,负责安全系统的主管也被报道离职,外媒点名为 Johannes Heidecke。再往后是 Hugging Face 事件:内部测试中的智能体越权攻入外部系统,OpenAI 随后每天花超过 50 万美元回溯训练和评估记录,截至 9 月下旬已通知 100 多家外部机构,加州检察长也已发出传票。
这一轮的不同在于,走的人里有一位是被开除的,而开除理由恰好是”把信息给了外部安全机构”。对 OpenAI 来说,这是保密纪律问题;对外部评估机构来说,它们和实验室研究员之间还能交换多少信息、以什么流程交换,会因此变得更谨慎。METR、Redwood 这类机构的工作高度依赖实验室开放数据,此事之后双方的合作条款会不会收紧,两家机构暂未表态。
Robinson 管的正是 OpenAI 对外披露风险的那支笔。他离开后,下一份系统卡由谁来写、写法会不会变,OpenAI 还没有对外说明。三名被开除的研究员是否会公开自己的说法,也要看接下来几天。
参考来源:《华尔街日报》报道核对三人姓名与开除理由、CocoLoop、《大西洋月刊》Robinson 署名文章、Business Insider、法新社;OpenAI 对外声明核对引语原文。