Google hat am 30. September sein neues Spitzenmodell Gemini 4 Argon veröffentlicht – zunächst jedoch nur für Cybersicherheits-Abwehrteams im Rahmen des Fairwind-Programms. Google grenzt den Einsatzbereich des Modells auf drei Kategorien ein: Softwareentwicklung, unternehmerische Wissensarbeit wie Recht und Finanzen sowie die Abwehr von Cyberangriffen. Zahlende API-Kunden und Abonnenten von Google AI Ultra folgen in der nächsten Runde, für eine breitere öffentliche Freigabe gibt es bislang keinen Zeitplan.
Dass Sicherheitsteams zuerst Zugang erhalten, hängt mit der Trainingsausrichtung des Modells zusammen. Laut Google wurde Argon gezielt für die Cyberabwehr trainiert und kann eigenständig kritische Softwarelücken aufspüren, verifizieren und schließen. Vertrauenswürdige Verteidigungsteams innerhalb von Fairwind sowie interne Google-Teams erhalten Argon ohne die üblichen Sicherheitsleitplanken für Cyberanwendungen; andere Nutzer bekommen eine Version mit Schutz vor Missbrauch, Prompt-Injection und Alignment-Überwachung.
Die offiziellen Benchmark-Werte
Google hat mehrere Benchmark-Ergebnisse veröffentlicht:
| Benchmark | Bereich | Argon-Ergebnis |
|---|---|---|
| DeepSWE v1.1 | Reale Softwareentwicklung | 77,9 % |
| CWE-bench v1 | Schließen von Sicherheitslücken | 68 % (geteilter erster Platz) |
| AutomationBench | Automatisierte Aufgaben | 51,3 % (erster Platz) |
| LVBench | Verständnis langer Videos | 91,7 % |
Für zwei weitere Tests wurde nur ein Rang genannt: Beim Vals Index, der Finanzen, Programmierung, Recht und Steuern abdeckt, soll Argon laut Google führen; beim Test zu indirekter Prompt-Injection von Gray Swan sei die Widerstandsfähigkeit von Argon die beste. All das sind Angaben des Herstellers selbst, und am Tag der Veröffentlichung gab es nur eine unabhängige Nachprüfung durch Dritte.
Eine weitere deutliche Änderung betrifft die Ausgabelänge. Beim vorherigen Gemini lag das Limit pro Ausgabe bei 64.000 Token, bei Argon sind es nun 1 Million Token – ebenso groß ist das Kontextfenster.
Preise und unabhängige Tests
Zum Start wird die API zu Einführungspreisen abgerechnet: 2 US-Dollar pro Million Input-Token, 10 US-Dollar pro Million Output-Token, bei Cache-Treffern zusätzlich 95 Prozent Rabatt auf den Input. Nach Ablauf der Rabattphase steigen die Preise auf 4 US-Dollar für Input und 20 US-Dollar für Output; wie lange die Rabattphase dauert, hat Google nicht mitgeteilt.
Der unabhängige Testdienst Artificial Analysis veröffentlichte noch am selben Tag Ergebnisse. Argon erreicht auf dessen Intelligenz-Index 53 Punkte, gleichauf mit der höchsten Reasoning-Stufe von GPT-6 Astra, einen Punkt mehr als die höchste Stufe von GPT-6.1 Sol und 23 Punkte mehr als die Vorgängerversion Gemini 3.1 Pro Preview mit 30 Punkten.
Ein Vergleich der Kosten pro Aufgabe anhand desselben Index:
- Argon kostet zum Einführungspreis rund 1,99 US-Dollar pro Aufgabe, GPT-6 Astra 3,26 US-Dollar;
- nach Ablauf des Rabatts steigt Argon auf etwa 3,98 US-Dollar, rund 20 Prozent teurer als Astra;
- GPT-6.1 Sol kostet nur etwa 0,72 US-Dollar pro Aufgabe bei lediglich einem Punkt weniger – Argon ist zum Einführungspreis etwa 2,8-mal so teuer.
Der Unterschied liegt vor allem am Token-Verbrauch. Laut Artificial Analysis erzeugt Argon im Schnitt rund 62.000 Output-Token pro Aufgabe, GPT-6 Astra etwa 27.000 – mehr als doppelt so viel. Der Stückpreis wurde zwar halbiert, die Ausgabemenge aber verdoppelt, sodass der Preisvorteil zum regulären Preis weitgehend aufgehoben wird. Argon unterstützt einen Mechanismus namens „verlängerte Dekodierfortsetzung“, bei dem der Denkprozess bis zu 1 Million Output-Token umfassen kann – das erklärt den überdurchschnittlichen Verbrauch im Index-Test.
Für wen gelten die Leitplanken
In derselben Woche hat OpenAI die Veröffentlichung von GPT-6.1 Astra gestoppt, weil die Sicherheitsstandards nicht erreicht wurden, und stattdessen das günstigere Modell Sol vorgestellt. Google geht den Weg, die stärkste Version zunächst in eine kontrollierte Nutzerliste aufzunehmen. Beide Unternehmen gehen unterschiedlich vor, stehen aber vor demselben Problem: Je besser ein Modell Sicherheitslücken findet und Patches schreibt, desto größer ist auch das Risiko, dass es für Angriffe missbraucht wird.
Welche Organisationen auf der Fairwind-Liste stehen, nach welchen Kriterien geprüft wird und wie verhindert werden soll, dass die Version ohne Leitplanken nach außen gelangt, lässt Googles Ankündigungs-Blog offen. Für Entwickler in China ist Argon derzeit ohnehin kaum erreichbar: Fairwind funktioniert nach Einladung, ein Starttermin für Ultra-Abos und die zahlungspflichtige API steht nicht fest, und die Gemini-API selbst ist in Festlandchina nicht verfügbar.
Quellen: offizieller Google-Blog, Testbericht von Artificial Analysis, CocoLoop, VentureBeat; Benchmark-Werte laut Angaben von Google, Kosten pro Aufgabe und Token-Verbrauch gemäß dem Intelligenz-Index von Artificial Analysis.