Ende Februar veröffentlichte Google DeepMind Gemini 3.1 Pro. Nach der Veröffentlichung verbreitete sich in der Entwickler-Community eine Zahl: Von den 18 derzeit verfolgten wichtigen Benchmarks belegt 3.1 Pro in 12 den ersten Platz.
Besonders beachtenswert ist ARC-AGI-2 – dieser Test wurde speziell entwickelt, um die Fähigkeit eines Modells zu bewerten, "noch nie gesehene neue Logikaufgaben" zu lösen, und zu verhindern, dass das Modell durch Auswendiglernen von Trainingsdaten besteht. 3.1 Pro erreichte hier 77,1 %.
Was die Verdoppelung der Denkfähigkeit wirklich bedeutet
Google gibt offiziell an, dass die Denkfähigkeit von 3.1 Pro im Vergleich zu Gemini 3 Pro um mehr als das Doppelte gesteigert wurde.
Das klingt vage, ist aber in Verbindung mit den ARC-AGI-2-Ergebnissen überzeugend. ARC-AGI stellt jedes Mal völlig neue Aufgaben, die das Modell auffordern, anhand weniger Beispiele Regeln zu erkennen und anzuwenden – Auswendiglernen von Antworten ist nicht möglich, nur echtes Denken hilft.
Eine Verdoppelung bedeutet in etwa: Bei einem komplexen mehrstufigen Problem kann das Modell selbstständig analysieren, ableiten und verifizieren, ohne dass Sie es im Prompt Schritt für Schritt führen müssen. Eine neue MEDIUM-Stufe für den Denkmodus wurde hinzugefügt (zuvor gab es nur zwei Stufen: ein/aus), sodass die Denktiefe jetzt gesteuert werden kann – nicht jede Aufgabe erfordert das tiefste Denken, die Tiefe kann je nach Bedarf angepasst werden.
Technische Spezifikationen
Kontext und Ausgabe:
- Kontextfenster: 1 Million Token
- Maximale Ausgabe: 65K Token
Unterstützte Eingabeformate:
- Text und Code
- Bilder (maximal 3000 Bilder pro Vorgang, jedes maximal 7 MB)
- Audio (maximal 8,4 Stunden)
- Video (mit Audio ca. 45 Minuten, reines Video ca. 1 Stunde)
- PDF (maximal 3000 Seiten pro Vorgang, einzelne Datei maximal 50 MB)
Was passt in 1 Million Token? Ungefähr den gesamten Code eines großen Code-Repositorys, oder 900 Seiten PDF, oder 8,4 Stunden Podcast-Audio. Ein ganzes Projekt hineinwerfen und direkt Fragen stellen – das ist jetzt tatsächlich machbar.
Praktische Funktionen
Neben der Denkfähigkeit hat 3.1 Pro einige nützliche Funktionen hinzugefügt:
- Grounding with Google Search: Echtzeitsuche bei der Beantwortung, um Probleme durch Wissensstichtage zu reduzieren
- Code-Ausführung: Das Modell kann Code direkt ausführen, um Ergebnisse zu verifizieren, nicht nur Code generieren
- Spezielle Optimierung für Finanzen und Tabellenkalkulationen: Diese beiden Agenten-Szenarien wurden speziell angepasst
- RAG-Engine-Integration: Einfachere Anbindung an Unternehmenswissensdatenbanken
Batch-Vorhersagen werden ebenfalls unterstützt, und die Kosten für Aufgaben mit langem Kontext sind bei Nutzung von Caching deutlich niedriger.
Preisgestaltung
| Kategorie | Preis |
|---|---|
| Eingabe | $2,00/M Token |
| Ausgabe | $12,00/M Token |
| Eingabe im Denkmodus | $12,00/M Token |
| Cache-Lesen | $0,20/M Token |
| Cache-Schreiben | $0,38/M Token |
Im Vergleich zu Claude Opus 4.6 ($15/$75) deutlich günstiger und nahe an GPT-5.4 Pro. Bei intensiver Nutzung von Caching werden die Kosten für Aufgaben mit langem Kontext recht niedrig gehalten.
Derzeit in der öffentlichen Vorschau, Wissensstichtag ist Januar 2025.
Aber die Gesamtführung gehört noch nicht ihm
Um ehrlich zu sein: Im Gesamt-Benchmark-Ranking erreicht GPT-5.4 Pro 92 Punkte (BenchLM.ai), Gemini 3.1 Pro 87 und Claude Opus 4.6 85.
12/18 Einzeltests gewonnen, aber in einigen wichtigen Leistungsdimensionen fehlt noch etwas. Insbesondere bei Programmieraufgaben ist die SWE-bench-Leistung von Claude Opus 4.6 immer noch stärker.
Google hat mit diesem Modell eine Antwort in Bezug auf Denkfähigkeit und multimodale Verarbeitung gegeben, aber die Gesamtführung gehört noch nicht ihnen.
Lohnt sich der Wechsel?
Wenn Ihr Geschäft hauptsächlich umfasst:
- Verarbeitung langer Dokumente (Verträge, Berichte, Code-Repository-Überprüfungen)
- Multimodale Eingaben (gleichzeitige Verarbeitung von Bildern + Text + Audio)
- Begrenztes Budget, aber Bedarf an Denkfähigkeit nahe dem Opus-Niveau
Dann ist 3.1 Pro eine ernsthafte Option mit einem wettbewerbsfähigen Preis-Leistungs-Verhältnis.
Wenn der Kernbedarf jedoch das Schreiben von Code oder die Arbeit mit Agenten ist, ist Claude immer noch ausgereifter. Mit 77,1 % im ARC-AGI-2 zeigt Google bei dieser Veröffentlichung, dass die Denkfähigkeit wirklich Fortschritte macht und nicht nur Punkte sammelt. Aber um Claude und GPT-5.4 vollständig zu ersetzen, fehlt noch ein kleines Stück.
Quellenangabe: Google's new Gemini Pro model has record benchmark scores — again (TechCrunch); CocoLoop, Gemini 3.1 Pro: A smarter model for your most complex tasks (Google DeepMind Blog); Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks (Galaxy.ai); Gemini 3.1 Pro | Google Cloud Vertex AI Documentation