Gemini 3.1 Pro、18ベンチマーク中12で首位獲得

2月下旬、Google DeepMindはGemini 3.1 Proをリリースした。公開後、開発者コミュニティで広く共有された数字がある。現在追跡中の18の主要ベンチマークのうち、3.1 Proは12で首位を獲得した

さらに注目すべきはARC-AGI-2だ。このテストは、モデルが「これまで見たことのない新しい論理問題」を解決する能力を評価するために特別に設計されており、訓練データの暗記による合格を防ぐ。3.1 Proはこのベンチマークで77.1%を記録した。

推論能力の2倍向上が意味すること

Googleは公式に、3.1 Proの推論能力はGemini 3 Proの2倍以上だと述べている。

この発言は漠然と聞こえるが、ARC-AGI-2の結果と合わせると説得力がある。ARC-AGIは毎回全く新しい問題を出題し、モデルが少数の例からパターンを推論して適用することを求める。答えを暗記することはできず、真の推論のみが求められる。

2倍の向上は、おおよそ次のことを意味する。複雑な多段階問題が与えられた場合、モデルがプロンプトで手順を逐一指示されることなく、自ら問題を分解、推論、検証できる。新たにMEDIUMレベルのThinking Levelが追加され(従来はオン/オフの2段階のみ)、推論の深さを制御できるようになった。すべてのタスクに最も深い推論が必要なわけではなく、必要に応じて調整できる。

技術仕様

コンテキストと出力:

  • コンテキストウィンドウ:100万トークン
  • 最大出力:65Kトークン

対応入力形式:

  • テキストとコード
  • 画像(1リクエストあたり最大3,000枚、各7MBまで)
  • 音声(最大8.4時間)
  • 動画(音声ありで約45分、音声なしで約1時間)
  • PDF(1リクエストあたり最大3,000ページ、1ファイル最大50MB)

100万トークンで何が収容できるか?大規模なコードリポジトリ全体、または900ページのPDF、または8.4時間のポッドキャスト音声に相当する。プロジェクト全体を投入して直接質問するということが、今や現実的に実行可能になった。

実用的な機能

推論能力に加えて、3.1 Proにはいくつかの実用的な機能が追加されている。

  • Grounding with Google Search:応答時にリアルタイム検索を実行し、知識のカットオフ日付による問題を軽減
  • コード実行:モデルがコードを実行して結果を検証可能。コード生成だけでなく実行も行う
  • FinanceおよびSpreadsheet向け最適化:これら2つのエージェントシナリオ向けに特別に調整
  • RAG Engine統合:エンタープライズ知識ベースとの連携が容易に

バッチ予測もサポートしており、キャッシュを利用すれば長コンテキストタスクのコストを大幅に抑えられる。

料金

項目価格
入力$2.00/Mトークン
出力$12.00/Mトークン
推論モード入力$12.00/Mトークン
キャッシュ読み取り$0.20/Mトークン
キャッシュ書き込み$0.38/Mトークン

Claude Opus 4.6($15/$75)と比較すると大幅に安く、GPT-5.4 Proに近い。キャッシュを多用すれば、長コンテキストタスクのコストはかなり低く抑えられる。

現在はパブリックプレビュー版で、知識のカットオフ日は2025年1月である。

しかし総合首位ではない

正直に言うと、総合ベンチマークランキングでは、GPT-5.4 Proが92点(BenchLM.ai)、Gemini 3.1 Proが87点、Claude Opus 4.6が85点である。

12/18の個別テストで勝利したが、いくつかの重要な能力次元では依然として差がある。特にコーディングタスクでは、Claude Opus 4.6のSWE-benchパフォーマンスが依然として強い。

Googleは推論とマルチモーダル処理においてこの答案を提出したが、総合首位にはまだ至っていない。

乗り換える価値はあるか

ビジネスが主に以下の場合:

  • 長文書処理(契約書、レポート、コードベースレビュー)
  • マルチモーダル入力(画像+テキスト+音声の同時処理)
  • 予算は限られているがOpusに近い推論能力が必要

3.1 Proは真剣な選択肢であり、コストパフォーマンスに優れている。

しかし、中核的なニーズがコード作成やエージェント構築である場合、Claudeの方が依然として成熟している。今回のリリースでGoogleがARC-AGI-2で77.1%を記録したことは、推論能力が実際に向上しており、単なるスコア稼ぎではないことを示している。しかし、ClaudeやGPT-5.4を完全に置き換えるには、まだもう少し距離がある。

出典:Google's new Gemini Pro model has record benchmark scores — again(TechCrunch);CocoLoop、Gemini 3.1 Pro: A smarter model for your most complex tasks(Google DeepMind Blog);Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks(Galaxy.ai);Gemini 3.1 Pro | Google Cloud Vertex AI Documentation