OpenAIは今週、アライメントと安全性を担当していた研究者3人を、会社の機密情報を規定に反して取り扱ったとして解雇した。米ウォール・ストリート・ジャーナル(WSJ)が10月1日に解雇の件を最初に報じ、同日中にJasmine Wang、Tomek Korbak、Mikita Balesniの3人の名前を追加で報じた。ほぼ同時期に、安全性の透明性確保業務を担当していたDavid Robinsonも同社を退社しており、10月3日に米誌アトランティックに長文のエッセイを発表し、辞任の理由はOpenAIの企業文化にあると明言した。
わずか数日のうちに起きたこの2つの出来事は、同じ論点に行き着く。OpenAIが自社モデルのリスクを外部にどう説明するか、という問題だ。
会社側は「規定違反」としか説明していない
OpenAIの公式な説明は短い。同社は3人と「袂を分かった」ことを認め、理由として機密情報へのアクセスと取り扱いに関する社内規定への違反を挙げた。
Our investigation confirmed that these individuals mishandled sensitive information outside established company procedures, violating our policies and breaking the trust essential to our work.(調査の結果、これらの人物が既定の社内手続きの外で機密情報を不適切に取り扱い、当社の方針に違反し、業務に不可欠な信頼を損なったことが確認された。)
報道によれば、3人はOpenAIのモデルに関連する機密情報を外部のAI安全性機関に渡したという。どの機関なのか、どの種類の情報なのか、どの程度の範囲だったのかについて、OpenAIは明らかにしていない。AFP通信が3人に接触を試みたが、返答は得られなかった。
外部の推測はKorbakに集中している。彼は以前、評価機関METRとRedwood Researchに対するOpenAI側の技術連絡担当を務めていた。この両機関は、OpenAIのエージェントがHugging Faceに不正侵入した事件の調査にも関わっていた。ただし一部メディアは、今回流出した資料がMETRやRedwoodと関連しているという兆候は現時点でないと明確に記している。別の報道では、Jasmine WangはOpenAI入社前に英国AI安全性機構(UK AI Safety Institute)に在籍していたとされる。これらはあくまで報道レベルの情報であり、OpenAI自身は3人の氏名を確認していない。
Robinsonが書いたこと
Robinsonは約3年半、OpenAIの安全システムチームに在籍し、モデルのリスクを外部に説明する役割を担ってきた。公開情報によれば、彼は12回のフロンティアモデル公開における「system card」(モデルのリスクを説明する文書)の統括を担当し、2025年4月版の「準備度フレームワーク(Preparedness Framework)」の主要な起草者の一人でもあった。このフレームワークは、追加の安全対策なしに公開するにはリスクが高すぎるとOpenAIが判断する基準となる文書だ。
彼がアトランティックで展開した核心的な主張は、「まず公開し、問題が出た箇所を見て、後から対策を補う」という反復的な展開手法が、モデルの能力が高まるにつれて通用しなくなっているというものだ。一度のミスが、次に修正する機会を残さないかもしれないからだという。エッセイの中で最も引用されている一文は次の通りだ。
「The time for trial and error is over.」(試行錯誤の時代は終わった。)
彼は研究所内に根付く「長期スプリント」的な働き方を批判し、フロンティア研究所は原子力発電所や混雑する空港のように、多層の冗長性を備え、慎重に計画を立てて運営すべきだと主張。航空業界や原子力安全業界から信頼性エンジニアを採用すべきだとも述べた。さらに、具体的な規則や新法だけでは不十分で、「私たちが議論すべきなのは企業文化だ」とも書いている。報道によれば、OpenAIの反応は、必要な場合には訓練を一時停止すること、外部評価機関との協力を拡大していること、リアルタイム監視を改善していることを強調する内容だったという。
今年続いた離職をつなげて見る
このテーマはこれまでの報道でもすでに長く扱われてきた。7月上旬には、かつてMission Alignmentチームを率い、その後チーフ・フューチャリストに転じたJoshua Achiamが退社を発表。数日後には、安全システム部門の責任者も退社したと報じられ、海外メディアはJohannes Heidecke氏の名を挙げた。その後にはHugging Face事件が起きた。社内テスト中のエージェントが権限を越えて外部システムに侵入し、OpenAIはその後、訓練記録と評価記録の遡及調査に1日50万ドル以上を投じた。9月下旬までに100以上の外部機関に通知し、カリフォルニア州司法長官も召喚状を発行している。
今回違うのは、退職者の一人が解雇という形であり、その理由が「情報を外部の安全性機関に渡した」ことだという点だ。OpenAIにとってはこれは機密保持の問題だが、外部評価機関にとっては、研究所の研究者とどこまで情報をやり取りできるのか、どのような手続きで行うべきなのかという問題を一層慎重にさせる出来事になる。METRやRedwoodのような機関の活動は、研究所側がデータを開示する姿勢に大きく依存しており、この件を受けて協力条件が厳しくなるかどうかについて、両機関はまだ見解を示していない。
Robinsonはまさに、OpenAIが外部にリスクを説明する役割の中心にいた人物だった。彼が去った後、次のsystem cardを誰が書くのか、書き方が変わるのかについて、OpenAIはまだ説明していない。解雇された3人の研究者が自らの立場を公に説明するかどうかも、今後数日の動向次第だ。
参考資料:3人の氏名と解雇理由を確認したウォール・ストリート・ジャーナルの報道、CocoLoop、Robinson署名のアトランティック掲載エッセイ、Business Insider、AFP通信;引用確認のためのOpenAI公式声明。