OpenAI本週開除了三名負責對齊與安全的研究員,理由是違規處理公司機密資訊。《華爾街日報》10月1日率先報導此事,當天稍晚補上了三人的姓名:Jasmine Wang、Tomek Korbak與Mikita Balesni。幾乎在同一時間,負責安全透明度工作的David Robinson也已離開公司,並於10月3日在《大西洋月刊》發表長文,標題直接寫明他辭職是因為OpenAI的企業文化出了問題。
兩件事前後只相隔幾天,碰到的卻是同一個核心問題:OpenAI該如何向外界說明自家模型的風險。
公司只說了「違規」
OpenAI對外的說法很簡短。公司證實與三人「分道揚鑠」,原因是他們違反了存取與處理機密資訊的內部規定:
Our investigation confirmed that these individuals mishandled sensitive information outside established company procedures, violating our policies and breaking the trust essential to our work.(調查證實,這幾人在既定流程之外處理了機密資訊,違反公司政策,也破壞了工作所必需的信任。)
報導指出,三人把與公司模型有關的機密資訊分享給了一家第三方AI安全機構。至於是哪家機構、涉及哪類資訊、範圍多大,OpenAI都沒有對外揭露。法新社聯繫了當事人,但沒有得到回應。
外界的猜測集中在Korbak身上。他先前是OpenAI對接METR與Redwood Research兩家評估機構的技術聯絡人,而這兩家機構也參與調查了OpenAI的AI代理人入侵Hugging Face的事件。不過也有媒體明確寫到,目前沒有跡象顯示這次外流的資料與METR或Redwood有關。另有報導提到,Jasmine Wang加入OpenAI之前曾在英國AI安全研究院(UK AI Safety Institute)任職。這些說法目前都還停留在媒體報導層面,OpenAI本身並未證實三人的姓名。
Robinson寫了什麼
Robinson在OpenAI安全系統團隊待了約三年半,負責把模型風險寫給外界看。根據公開報導,他主持過12次前沿模型發布的「system card」(系統卡,即模型風險說明文件),也是2025年4月版《準備度框架》(Preparedness Framework)的主要起草人之一。這份框架正是OpenAI用來判斷某個模型是否危險到不能在沒有額外防護措施的情況下發布的依據。
他在《大西洋月刊》文章裡的核心主張是,「先發布、觀察哪裡出問題、再補防護」這種反覆迭代的部署做法,在模型能力愈來愈強之後已經不再適用,因為一次失誤之後可能就沒有下一次修正的機會了。文中最常被引用的一句話是:
「The time for trial and error is over.」(試錯的時代結束了。)
他批評業界實驗室裡那種「長期衝刺」式的工作節奏,主張前沿實驗室應該像核電廠或繁忙機場那樣運作,層層設置備援、謹慎規劃,並應該從航空業與核能安全產業招募可靠性工程師。他也寫道,光靠具體規則或新法律還不夠,「我們真正需要談的是文化」。據報導,OpenAI的回應強調公司在必要時會暫停訓練,同時正在擴大與外部評估機構的合作,並持續改善即時監控機制。
把今年幾次離職串起來看
這條線在先前的報導裡已經拉得很長。7月上旬,曾負責Mission Alignment團隊、後來轉任首席未來學家的Joshua Achiam宣布離職;幾天後,負責安全系統的主管也被媒體報導離職,海外媒體點名為Johannes Heidecke。再往後則是Hugging Face事件:內部測試中的AI代理人權限失控,入侵了外部系統,OpenAI隨後每天花超過50萬美元回溯訓練與評估紀錄,截至9月下旬已通知超過100家外部機構,加州檢察長也已發出傳票。
這一輪不同之處在於,離開的人裡有一位是被開除的,而開除的理由恰好是「把資訊交給了外部安全機構」。對OpenAI來說,這是保密紀律的問題;但對外部評估機構來說,它們和實驗室研究員之間究竟還能交換多少資訊、該用什麼流程交換,往後都會變得更加謹慎。METR、Redwood這類機構的工作高度仰賴實驗室願意開放資料,這件事之後雙方的合作條件會不會因此收緊,兩家機構目前都還沒表態。
Robinson管的正是OpenAI向外界揭露風險的那支筆。他離開之後,下一份system card由誰來寫、寫法會不會改變,OpenAI目前都還沒有對外說明。三名被開除的研究員是否會公開自己的說法,也要看接下來這幾天。
參考來源:《華爾街日報》報導核對三人姓名與開除理由、CocoLoop、《大西洋月刊》Robinson署名文章、Business Insider、法新社;OpenAI對外聲明核對引語原文。