Nano Banana 2.1公開、旧版は10月末終了

Google DeepMindは10月6日、新しい画像生成モデル「Nano Banana 2.1」を発表し、同日中にGemini APIで正式提供(GA)を開始した。モデルIDは「gemini-nano-banana-2.1」。これはNano Banana 2(API名はgemini-3.1-flash-image)の後継版で、旧エンドポイントは10月29日に終了する。

公式モデルカードによると、Nano Banana 2.1はGemini 3系列に属し、基盤はGemini 3.6 Flash。ネイティブなマルチモーダル推論モデルで、テキストと画像の入力に対応し、コンテキストウィンドウは最大100万トークン。出力は画像のほか、最大6万4000トークンのテキストも可能だ。

何が変わったのか

API変更履歴に挙げられた改善点は4つ。画質、プロンプトへの忠実性、複数ターンの対話におけるキャラクターの一貫性、そしてテキストレンダリングだ。新機能として超ワイドのアスペクト比(1:4、4:1、1:8、8:1)に対応し、解像度は1K・2K・4Kから選べる。速度とコストはFlash級を維持するという。

モデルカードには2つの比較データが示されている。

  • テキストから画像生成の全体的な人間評価スコアは、Nano Banana 2.1のThinking版が1050(±14)、Nano Banana 2は990(±7)。
  • インフォグラフィックの事実正確性は0.179から0.521に上昇。

後者は約3倍の伸びだ。インフォグラフィックは絵が正しいだけでなく、数字やラベルも正確である必要があり、従来の画像生成モデルが最も間違えやすい領域だった。とはいえ0.521という数値は、生成したインフォグラフィックのおよそ半数にまだ事実上の問題が残ることを意味し、正式な資料に使う場合は人の目によるチェックが必要になる。

公式が認める弱点

モデルカードはいくつかの既知の限界も挙げている。小さい文字サイズや長い段落でのテキストレンダリングが弱いこと、入力画像と出力画像間のキャラクターの一貫性が保証されないこと、空間的な位置関係の推論に限界があり左右を混同することがある点だ。知識のカットオフ時期は分野によって異なり、一部の分野は2026年3月まで、それ以外は2025年1月までとなっている。

安全性について、モデルカードは子どもの安全に関する公開基準をクリアし、専門のレッドチームによる検証でも重大な問題は見つからず、フロンティア安全評価では追跡や重大とされる能力レベルには達していないとしている。

どこに搭載されるのか

Gemini App、Google AI Studio、Gemini APIに加え、Nano Banana 2.1は検索のAIモード、Google広告、動画ツールのFlow、デザインツールのStitchにも組み込まれた。広告と検索への搭載は、Googleが商用素材の大量生成に直接活用する狙いをうかがわせる。

中国国内の開発者への影響

Gemini APIは中国本土から直接アクセスできないため、現地のチームは海外クラウドやサードパーティのアグリゲーターサービスを経由して利用することが多い。旧エンドポイントは23日後に終了するため、アグリゲーター側のモデルマッピングが間に合うかどうかが最大の懸念点だ。gemini-3.1-flash-imageで本番運用しているチームは、今週中にテスト環境で新しいモデルIDへの切り替えを済ませておいたほうがよい。

中国語での利用にはもう一点注意が必要だ。モデルカードは「小さい文字のレンダリングが弱い」ことを限界として挙げているが、中国語の文字は画数が多く、同じ文字サイズでも英語より崩れやすい傾向がある。ポスターやECサイトのメイン画像では大きな見出しは問題にならないが、小さな説明文は後工程での修正が必要になる可能性がある。Googleは中国語レンダリングに関する個別の評価データはまだ公開していない。

変更履歴には新モデルの価格についての記載もなく、Nano Banana 2の課金基準を引き続き適用するのかどうかは公式にアナウンスされていない。

参考資料:CocoLoop、Google DeepMindモデルカード、Gemini API変更履歴。評価スコアとインフォグラフィック正確性の数値はモデルカードの公表値に基づき、終了スケジュールはGemini API変更履歴に基づく。