Google DeepMind veröffentlichte am 6. Oktober das Bildmodell Nano Banana 2.1 und stellte es am selben Tag in der Gemini API offiziell bereit, mit der Modell-ID gemini-nano-banana-2.1. Es ist die aktualisierte Version von Nano Banana 2 (Schnittstellenname gemini-3.1-flash-image), deren alte Schnittstelle am 29. Oktober abgeschaltet wird.
Laut offizieller Modellkarte gehört Nano Banana 2.1 zur Gemini-3-Reihe, basiert auf Gemini 3.6 Flash und ist selbst ein nativ multimodales Reasoning-Modell. Die Eingabe unterstützt Text und Bilder, das Kontextfenster beträgt bis zu 1 Million Token; die Ausgabe kann ein Bild oder Text mit bis zu 64.000 Token sein.
Was sich geändert hat
Im API-Änderungsprotokoll werden vier Verbesserungen genannt: Bildqualität, Befolgung von Prompts, Charakterkonsistenz über mehrere Dialogrunden hinweg und Textdarstellung. Neu sind extrem breite Seitenverhältnisse mit den vier Formaten 1:4, 4:1, 1:8 und 8:1, wählbare Auflösungen sind 1K, 2K und 4K. Google gibt an, dass Geschwindigkeit und Kosten weiterhin auf Flash-Niveau bleiben.
Die Modellkarte nennt zwei Vergleichszahlen:
- Bei der gesamten menschlichen Präferenzbewertung für Text-zu-Bild erreicht die Thinking-Version von Nano Banana 2.1 1050 (±14), Nano Banana 2 liegt bei 990 (±7);
- Die Faktengenauigkeit bei Infografiken stieg von 0,179 auf 0,521.
Der zweite Wert hat sich fast verdreifacht. Bei Infografiken muss das Modell nicht nur korrekt zeichnen, sondern auch Zahlen und Beschriftungen richtig wiedergeben – bisher die größte Fehlerquelle bei Bildmodellen. 0,521 bedeutet aber immer noch, dass fast die Hälfte der Infografiken sachliche Probleme aufweist; für offizielle Materialien ist weiterhin eine manuelle Prüfung nötig.
Schwächen, die Google selbst einräumt
Die Modellkarte listet mehrere bekannte Einschränkungen auf: schlechte Textdarstellung bei kleiner Schriftgröße und langen Absätzen; keine garantierte Charakterkonsistenz zwischen Eingabe und Ausgabe; begrenzte räumliche Orientierung, wobei Richtungen wie links und rechts gelegentlich verwechselt werden. Beim Wissensstichtag reicht es in manchen Bereichen bis März 2026, in anderen nur bis Januar 2025.
Im Sicherheitsbereich gibt die Modellkarte an, dass das Modell die Kinderschutz-Freigabeschwelle bestanden hat, das spezielle Red-Team keine schwerwiegenden Probleme fand und bei der Frontier-Sicherheitsbewertung keine Fähigkeitsstufe erreicht wurde, die eine Beobachtung oder als kritisch eingestuft werden müsste.
Wo das Modell integriert ist
Neben Gemini App, Google AI Studio und der Gemini API wurde Nano Banana 2.1 auch in den AI Mode der Suche, Google Ads, das Videotool Flow und das Designtool Stitch integriert. Die Einbindung in Werbung und Suche zeigt, dass Google das Modell direkt für die massenhafte Erstellung kommerzieller Materialien einsetzen will.
Für Entwickler in Festland-China
Die Gemini API ist in Festland-China nicht direkt zugänglich, dortige Teams greifen meist über ausländische Clouds oder Drittanbieter-Aggregationsplattformen darauf zu. Da die alte Schnittstelle in 23 Tagen abgeschaltet wird, ist die rechtzeitige Umstellung der Modellzuordnung auf Seiten dieser Plattformen der kritischste Punkt; Teams, die gemini-3.1-flash-image produktiv nutzen, sollten die neue ID am besten noch diese Woche in der Testumgebung einsetzen.
Für den chinesischen Kontext gibt es noch einen Punkt zu beachten. Die Modellkarte nennt die schwache Textdarstellung bei kleiner Schriftgröße als Einschränkung, und chinesische Schriftzeichen haben dichte Strichstrukturen, die bei gleicher Schriftgröße leichter verschwimmen als lateinische Buchstaben. Bei Postern und E-Commerce-Hauptbildern ist das bei großen Überschriften kein Problem, kleine Beschriftungen müssen aber möglicherweise weiterhin nachträglich bearbeitet werden. Google hat bislang keine separaten Bewertungsdaten zur chinesischen Textdarstellung veröffentlicht.
Auch zum Preis des neuen Modells äußert sich das Änderungsprotokoll nicht; ob die Abrechnung von Nano Banana 2 übernommen wird, hat Google noch nicht erklärt.
Quellen: CocoLoop, Google-DeepMind-Modellkarte, Gemini-API-Änderungsprotokoll; Präferenzbewertung und Infografik-Genauigkeit gemäß den in der Modellkarte veröffentlichten Ergebnissen, Abschalttermin gemäß Gemini-API-Änderungsprotokoll.