Googleが今回リリースしたGemini 3.1 Flash-Liteの最大のセールスポイントは、ただひとつ、「安さ」だ。
入力100万トークンあたり0.25ドル、出力は1.50ドル。比較すると、Gemini 3.1 Proは入力100万トークンあたり2ドル、出力18ドルであり、価格は約8分の1に抑えられている。
これはGoogle史上、最も低コストなGeminiモデルとなる。
速度と価格の変化
Flash-Liteは3月3日にプレビュー版として公開され、現在Google AI StudioとVertex AIで利用可能。高スループット、低コストのシナリオ、つまり1日に数十万回のリクエストを処理するような用途を想定している。
注目すべきパフォーマンス指標は以下の通り。
- 生成速度:Gemini 2.5 Flash比で45%高速化
- 初回トークンまでのレイテンシ:2.5倍改善
- スループット:約207トークン/秒
- GPQA Diamond(科学的推論ベンチマーク):86.9%。2.5 Flash Liteから約14ポイント向上
このGPQAスコアは非常に堅実だ。86.9%という数値は、多くの「フラッグシップ」モデルを上回っており、この価格帯でこのスコアを実現している点は、確かな自信の表れと言える。
ただし、より高度な推論ベンチマークであるHLAでは、Flash-Liteは16%にとどまり、3.1 Proの44.4%には及ばない。高度な推論タスクでは、依然として明確な差がある。
技術基盤とアーキテクチャ
Flash-Liteは、Gemini 3 Proアーキテクチャをベースにした混合専門家(MoE)設計を採用。以下の機能をサポートする。
- コンテキストウィンドウ:100万トークン
- 入力モダリティ:テキスト、画像、音声、動画すべて対応
- 出力長:最大64Kトークン
MoEアーキテクチャは、この価格でこのパフォーマンスを実現する鍵であり、活性化されるパラメータが少なく、1回の推論コストが低い。これはDeepSeek V3やQwen3と同様のアプローチだ。
適した用途
Googleはこのモデルに対して、非常に実用的なシナリオを想定している。
- コンテンツモデレーション:ルール違反検出のバッチ処理
- データ抽出:非構造化テキストからのフィールド抽出
- インテントルーティング:マルチエージェントシステムにおける一次振り分け
- カスタマーサービス自動化:標準的な質問への応答
- 翻訳と文字起こし:大量テキストの言語処理
簡単に言えば、深い推論は必要ないが、量が多く、レイテンシに敏感で、予算が限られているシナリオ向けだ。
この組み合わせは企業では非常に一般的であり、多くの企業のAI支出の半分以上は、こうした「技術的に高度ではないが、必ず実行しなければならない」タスクに費やされている。
競合との価格比較
| モデル | 入力($/100万トークン) | 出力($/100万トークン) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 |
| Gemini 3.1 Pro | $2.00 | $18.00 |
| GPT-4o Mini | 約$0.15 | 約$0.60 |
| Claude 4.5 Haiku | 約$0.25 | 約$1.25 |
この価格帯では競争が激しい。GPT-4o Miniはより安く、Claude 4.5 Haikuも同程度の価格帯にある。Flash-Liteの優位性は、速度(初回トークンまでのレイテンシが2.5倍高速)と、同価格帯のモデルでは珍しい100万トークンの長いコンテキストウィンドウにある。
このリリースの意味
GoogleがFlash-Liteを投入したのは、本質的に高スループット市場のシェアを獲得するためだ。
多くの中小規模の開発者やスタートアップがプロトタイプを開発する際の第一の基準は、「十分で安いこと」だ。Gemini 3.1 Proの価格は彼らにとって明確な障壁だが、Flash-Liteの価格設定は基本的に障壁とはならない。
同時にGoogleは、この低価格モデルを活用して開発者をVertex AIエコシステムに引き留めようとしている。まずFlash-Liteでトラフィックを呼び込み、本番環境の負荷の高いタスクをProやUltraに移行させる——このコンバージョンパスは、Googleがすでに多くの顧客で実証済みだ。
コスト重視のAPIシナリオにおいて、新たな選択肢が加わったと言える。
参考元:CocoLoop、Google launches speedy Gemini 3.1 Flash-Lite model in preview(SiliconANGLE);Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases(AI/ML API Blog);Gemini 3.1 Flash Lite: Our most cost-effective AI model yet(Google Blog)