Google bringt günstigstes Gemini Flash-Lite auf den Markt

Google hat Gemini 3.1 Flash-Lite auf den Markt gebracht. Das Hauptverkaufsargument lässt sich in einem Wort zusammenfassen: günstig.

Jede Million Input-Token kostet nur 0,25 US-Dollar, der Output 1,50 US-Dollar. Zum Vergleich: Gemini 3.1 Pro kostet 2 US-Dollar pro Million Input-Token und 18 US-Dollar für den Output – der Preis liegt damit bei etwa einem Achtel.

Es ist das günstigste Gemini-Modell, das Google je veröffentlicht hat.

Geschwindigkeit und Preis haben sich geändert

Flash-Lite wurde am 3. März als Preview-Version eingeführt und ist derzeit in Google AI Studio und Vertex AI verfügbar. Es ist für Szenarien mit hohem Durchsatz und niedrigen Kosten konzipiert – also für Anwendungen, die täglich Hunderttausende von Anfragen verarbeiten müssen.

Einige bemerkenswerte Leistungszahlen:

  • Generierungsgeschwindigkeit: 45 % schneller als Gemini 2.5 Flash
  • Latenz des ersten Tokens: um das 2,5-fache reduziert
  • Durchsatz: etwa 207 Token pro Sekunde
  • GPQA Diamond (wissenschaftlicher Reasoning-Benchmark): 86,9 %, ein Anstieg um etwa 14 Prozentpunkte gegenüber 2.5 Flash Lite

Dieser GPQA-Wert ist durchaus beachtlich. 86,9 % liegen bereits über vielen "Flaggschiff"-Modellen, und zu diesem Preis ist das ein starkes Argument.

Allerdings muss man klar sagen: Im anspruchsvolleren Reasoning-Benchmark HLA erreicht Flash-Lite nur 16 %, während 3.1 Pro auf 44,4 % kommt. Bei hochwertigen Reasoning-Aufgaben besteht weiterhin ein deutlicher Unterschied.

Technische Grundlage und Architektur

Flash-Lite basiert auf der MoE-Architektur (Mixture of Experts) von Gemini 3 Pro und unterstützt:

  • Kontextfenster: 1 Million Token
  • Eingabemodalitäten: Text, Bilder, Audio und Video werden alle unterstützt
  • Ausgabelänge: maximal 64K Token

Die MoE-Architektur ist der Schlüssel dafür, dass dieses Modell zu diesem Preis diese Leistung erbringen kann – weniger aktivierte Parameter, niedrigere Kosten pro Inferenz. Dieser Ansatz ähnelt dem von DeepSeek V3 und Qwen3.

Wofür es geeignet ist

Google hat für dieses Modell sehr praxisnahe Anwendungsszenarien definiert:

  • Inhaltsmoderation: massenhaftes Prüfen auf Regelverstöße
  • Datenextraktion: Extrahieren von Feldern aus unstrukturiertem Text
  • Intent-Routing: erste Verteilerebene in Multi-Agent-Systemen
  • Kundenservice-Automatisierung: Beantwortung standardisierter Fragen
  • Übersetzung und Transkription: Sprachverarbeitung großer Textmengen

Einfach gesagt: Es geht um Aufgaben, die keine tiefgehende Reasoning-Fähigkeit erfordern, aber ein hohes Volumen haben, latenzempfindlich sind und ein begrenztes Budget.

Diese Kombination ist in Unternehmen sehr verbreitet. Viele Firmen geben mehr als die Hälfte ihrer KI-Ausgaben für solche "technisch anspruchslosen, aber notwendigen" Aufgaben aus.

Preisvergleich mit der Konkurrenz

ModellInput ($/1M Token)Output ($/1M Token)
Gemini 3.1 Flash-Lite$0,25$1,50
Gemini 3.1 Pro$2,00$18,00
GPT-4o Mini~$0,15~$0,60
Claude 4.5 Haiku~$0,25~$1,25

In dieser Preisklasse ist der Wettbewerb recht intensiv. GPT-4o Mini ist günstiger, Claude 4.5 Haiku liegt in derselben Preiszone. Die Vorteile von Flash-Lite sind die Geschwindigkeit (2,5-mal schnellerer erster Token) und das extrem lange 1M-Kontextfenster, das bei anderen Modellen in dieser Preisklasse selten ist.

Einordnung der Veröffentlichung

Mit der Einführung von Flash-Lite zielt Google im Kern darauf ab, Marktanteile im Segment mit hohem Durchsatz zu gewinnen.

Viele kleine Entwickler und Start-ups wählen bei der Erstellung von Produktprototypen als erstes Kriterium "gut genug und günstig". Der Preis von Gemini 3.1 Pro ist für sie eine echte Hürde, aber die Preisgestaltung von Flash-Lite stellt praktisch kein Hindernis mehr dar.

Gleichzeitig nutzt Google dieses günstige Modell, um Entwickler im Vertex-AI-Ökosystem zu halten. Zuerst wird mit Flash-Lite Traffic angezogen, dann werden die produktiven Schwerlastaufgaben auf Pro und Ultra migriert – diesen Konvertierungspfad hat Google bereits bei vielen Kunden validiert.

Für kostensensible API-Szenarien gibt es jetzt eine weitere Option.

Quellenangabe: CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE); Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog); Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)