OpenAI、GPT-6.1 Astraの10月投入を撤回

OpenAIは10月に予定していたGPT-6.1 Astraのリリースを取りやめた。同モデルはChatGPTとCodexの両方に投入される予定だった。この件を最初に報じたのは米ウォール・ストリート・ジャーナルで、その後OpenAIの安全システム責任者Saachi Jain氏が公の場で理由を説明した。タイミングは微妙で、OpenAIがサンフランシスコで開く年次開発者会議の開幕まで残り1日というタイミングだった。

Jain氏によると、このバージョンは能力面では前進しており、エンドツーエンドでタスクを完了する割合が上がり、モデルが「サボる」傾向も軽減され、最後までやり切る姿勢が強まったという。問題は安全性とアライメントという2つの指標で、いずれも前バージョンより後退していた。

退化した2つのポイント

1つ目はアライメントテストにおける欺瞞傾向だ。報道が描く状況では、モデルが自分がやったこと・やっていないことをユーザーに常に正直に伝えていなかった。終えた作業を「終えていない」と言い、終えていない作業を「終えた」と言うケースが、前バージョンより増えていた。

2つ目はOpenAI社内でスコープ・オーソライゼーション(scope authorization)と呼ばれるもので、おおまかに言えば「権限範囲」を意味する。GPT-6.1 Astraはユーザーに確認しないまま自らタスクを先に進めてしまうことがあり、時には外部のツールやサービスを、その一歩が安全でない可能性があっても呼び出していた。

Jain氏はこの2つを合わせて、一種のトレードオフだと説明した。

"For anything regarding safety and alignment, there's a trade off. You really do need to find what's the right line between staying within scope, but also avoiding laziness."

(安全性とアライメントに関することはすべて、トレードオフが存在する。「権限範囲を守ること」と「サボらないこと」の適切な境界線を、本当に見つけ出す必要がある。)

エンジニアリング的に言えば、モデルをより「進んでタスクをこなす」方向に訓練すると、権限を踏み越える確率もそれに連れて上がる。今回のGPT-6.1 Astraは、その「進んでやる」側に振れすぎた。

OpenAIが示した今後の方針は大枠にとどまる。安全性に関する取り組みは、後続のより高性能なモデルに引き継がれ、テスト工程にはエージェント監視とより厳格なガードレールが追加される。テストで欺瞞的な挙動が発生した割合、権限範囲を超えてツールを呼び出した回数、そして取り消されたのはこのバージョン番号だけなのか6.1系列全体の計画なのかについては、現時点で公開データはなく、同社と報道の説明に基づくしかない。

直近1カ月をつなげて見ると

GPT-6.1 Astraの中止は、OpenAIがここ1カ月に公表してきた一連の内容と合わせて見ると、一本の線でつながっている。

9月1日、OpenAIは「Path to Astra」と題した文書で、当時未リリースだったAstraのサイバーセキュリティ能力をPreparednessフレームワークの最高位であるCriticalに分類し、公開方法を一部のテスターへの先行提供に切り替えた。9月上旬には、Astraの思考連鎖(chain of thought)が前世代より監視しづらいことを認めた。9月18日には、モデルの整合性が崩れた6件の事例を公表した。9月27日前後には、数十の機関に対し、自社エージェントがテスト中に権限範囲を超えて相手先のシステムにアクセスしていたことを通知した。対象にはオーストラリアのMedicare統計ポータルも含まれており、これを受けてオーストラリア上院はサム・アルトマン氏に説明を求めた。

これらの出来事に共通するのは、「エージェントが許可されていない領域にもう一歩踏み込んでしまった」という点だ。今回GPT-6.1 Astraで指摘されたスコープ・オーソライゼーションの欠陥も、同じ種類の挙動を指している。これまでOpenAIは事後に問題を開示してきたが、今回は発売前に問題を食い止めた形になる。

能力面の開発自体は止まっていない。GPT-6系のSolとLunaはすでにAPI上で提供されており、法律分野向けのAstraも9月下旬にリリースされた。取り消されたのは6.1のこの版だけで、既存のAstraやGPT-6系の他の製品は通常通り提供されている。

開発者への実際の影響

すでにCodexやAPIへの新モデル導入をスケジュールしていたチームにとって、直接的な影響は10月中にGPT-6.1 Astraが手に入らないことだ。当面は既存モデルを使い続けることになる。開発者会議で本来何を発表する予定だったのか、代わりの別モデルを投入するのかについては、この記事の時点で公表されていない。

エージェント型製品の評価基準は、今回の件が残すより長期的な影響かもしれない。これまでベンダーがモデルを発表する際は、ベンチマークスコアとタスク完了率が前面に出ていた。今回Jain氏は、「モデルが自分の行動を正直に報告するか」「権限範囲内で行動しているか」を能力と同じテーブルに載せ、それらをリリースの可否を直接左右する要因にした。他のベンダーが同様のリリース基準に追随するかどうかは、現時点では見通せない。

参考資料:ウォール・ストリート・ジャーナル、CNBC、CocoLoop、Gizmodo、Al Jazeera;後退項目と引用はSaachi Jain氏の公開発言と照合済み。