Gemini 4 Argon、先にセキュリティ部門へ公開

Googleは9月30日、新世代のフロンティアモデルGemini 4 Argonを発表した。最初の提供先はFairwindプログラムに参加するサイバーセキュリティ防御チームに限定される。Googleが想定する用途は、ソフトウェアエンジニアリング、法務・金融などの企業知識労働、そしてサイバーセキュリティ防御の3分野。有料API顧客とGoogle AI Ultraサブスクリプション利用者は次の提供対象となるが、より広い一般公開の時期は示されていない。

セキュリティチームへの先行提供は、このモデルの学習方針と関係している。Googleによれば、Argonはサイバー防御に特化した訓練を受けており、重大なソフトウェア脆弱性を自律的に発見・検証・修正できるという。Fairwind内の信頼された防御側ユーザーとGoogle社内チームには、サイバーセキュリティ上のガードレールを外した形でArgonが提供される。それ以外のユーザーには、悪用防止、プロンプトインジェクション対策、アライメント監視といった安全対策付きのバージョンが提供される。

公式ベンチマーク結果

Googleが公表したベンチマークスコアは次の通り。

ベンチマーク分野Argonのスコア
DeepSWE v1.1実務的なソフトウェアエンジニアリング77.9%
CWE-bench v1脆弱性修正68%(首位タイ)
AutomationBench自動化タスク51.3%(首位)
LVBench長時間動画理解91.7%

このほか2項目は順位のみが公表されている。金融・プログラミング・法務・税務を対象とするVals IndexではArgonが首位だとGoogleは説明する。Gray Swanの間接的プロンプトインジェクションテストでも、最も耐性が高かったとしている。いずれもベンダー自己申告の数値であり、発表当日時点で確認できた第三者による再検証は1件のみだった。

出力長の変更も目立つ点だ。前世代のGeminiは1回の出力上限が6.4万トークンだったが、Argonでは100万トークンまで拡大された。コンテキストウィンドウも同じく100万トークンとなっている。

価格と第三者テスト

提供開始当初、APIは割引価格で課金される。入力は100万トークンあたり2ドル、出力は10ドルで、キャッシュがヒットした入力分はさらに95%割り引かれる。割引終了後は入力4ドル、出力20ドルに戻るが、割引期間がいつまで続くかはGoogleから説明がない。

独立評価機関のArtificial Analysisは、発表当日に独自のテスト結果を公表した。Argonは同社のインテリジェンス指数で53点を獲得し、GPT-6 Astraの最上位推論モードと並び、GPT-6.1 Solの最上位モードを1点上回った。前世代のGemini 3.1 Pro Previewの30点からは23点の上昇となる。

同じ指数を使ってタスクあたりのコストを比較すると次のようになる。

  • Argonは割引価格で1タスクあたり約1.99ドル、GPT-6 Astraは3.26ドル。
  • 割引終了後、Argonは約3.98ドルに上昇し、Astraよりおよそ2割高くなる。
  • GPT-6.1 Solは1タスクあたり約0.72ドルで、スコアの差はわずか1点。Argonの割引価格はSolの約2.8倍にあたる。

この差の主な原因はトークン使用量にある。Artificial Analysisの集計によれば、Argonは1タスクあたり平均約6.2万トークンを出力する一方、GPT-6 Astraは約2.7万トークンと、前者は2倍以上に達する。単価を半分に下げても出力量が倍になれば、割引価格の優位性は通常価格でほぼ相殺される計算だ。Argonは「ロングデコード継続」と呼ばれる仕組みに対応しており、推論過程で最大100万出力トークンまで書き続けられる。これが指数テストでの出力量の多さにつながっているとみられる。

ガードレールは誰に外されるのか

同じ週、OpenAIは安全基準を満たしていないとしてGPT-6.1 Astraの提供計画を撤回し、代わりに安価なSolを投入した。一方Googleは、最も高性能なバージョンをまず管理されたリストの中に限定する道を選んだ。両社の対応は異なるが、直面している課題は同じ種類のものだ。脆弱性を見つけ修正プログラムを書く能力が高くなるほど、それが攻撃側に転用されるリスクも大きくなる。

Fairwindのリストにどの組織が含まれるのか、どのような基準で審査されるのか、ガードレールを外したバージョンの流出をどう防ぐのか——Googleの発表ブログにはこうした点の説明がない。中国本土の開発者にとって、Argonは当面手が届きにくい状態が続く。Fairwindは招待制であり、Ultraサブスクリプションと有料APIの開放時期も未定で、Gemini API自体が中国本土向けには提供されていない。

参考資料:Google公式ブログ、Artificial Analysisの評価レポート、CocoLoop、VentureBeat。ベンチマークスコアはGoogleの自己申告に基づき、タスクあたりのコストとトークン使用量はArtificial Analysisのインテリジェンス指数の算出方法に基づく。