Grok 4.7 kostet gleich viel, doch Token pro Aufgabe verdoppeln sich

Am 21. September stellte SpaceXAI Grok 4.7 vor, laut eigener Aussage das "leistungsfähigste Modell für Coding und Wissensarbeit" des Unternehmens. API-Preis und Geschwindigkeit bleiben gegenüber Grok 4.6 unverändert: 2 US-Dollar pro Million Eingabe-Token, 6 US-Dollar pro Million Ausgabe-Token, dazu eine schnellere Variante zum doppelten Preis mit doppelter Ausgabegeschwindigkeit. Das Modell ist bereits in Cursor, Grok Build, der API-Konsole und bei Drittanbieter-Plattformen verfügbar.

"our most capable model for coding and knowledge work."

So positioniert SpaceXAI Grok 4.7 offiziell: als Modell für Coding und Wissensarbeit.

Laut Hersteller basiert das neue Modell auf einer größeren Grundarchitektur als 4.6, das Reinforcement-Learning-Training wurde verlängert, mit Schwerpunkt auf stundenlangen Langzeitaufgaben. Es soll sich selbst besser überprüfen und mit langen Kontexten umgehen können und ist zudem nativ mit Grok Bot verbunden.

Offizielle Benchmarks und Bewertungen von Dritten

Von SpaceXAI selbst veröffentlichte Werte: DeepSWE v1.1 71,0 %, CursorBench 4.0 46,3 %, Terminal-Bench 4.0 37,6 %, EEBench (Elektrotechnik) 64,0 %. Bei der Sicherheit gibt das Unternehmen an, bei Ablehnungsraten und Jailbreak-Resistenz branchenführend zu sein; die Durchlassrate für Risikohinweise liegt bei HackerBench v0.3 bei 3,3 %, Red-Team-Zugriff wird nur ausgewählten Cybersicherheitspartnern auf Einladung gewährt.

Ergebnisse des unabhängigen Prüfers Artificial Analysis: Der Gesamt-Intelligenzindex liegt bei 46 Punkten, 2 Punkte höher als bei 4.6; der Coding-Agent-Index in Kombination mit Grok Build liegt bei 56 Punkten, 9 Punkte höher als bei 4.6. Im Detail: DeepSWE v1.1 stieg von 65 % auf 73 %, Terminal-Bench 4.0 von 18 % auf 33 %, SWE-Atlas-QnA von 58 % auf 63 %. Nach dieser Bewertung liegt Grok 4.7 mit Grok Build beim Coding-Agent-Index auf Platz vier, hinter Claude Fable 5.1, GPT-6 Astra und Claude Opus 5. Beim Langzeit-Wissensarbeits-Benchmark AA-Briefcase erreicht es 1657 Elo-Punkte, 111 mehr als 4.6.

Die offizielle Ankündigungsseite enthält keinen direkten Vergleich mit Konkurrenzmodellen, und SpaceXAI hat sich zu den Platzierungen in den Drittanbieter-Bewertungen bislang nicht geäußert.

Eine Kostenrechnung

Die Preisliste hat sich nicht verändert, doch der von Artificial Analysis erfasste Token-Verbrauch schon: Grok 4.7 (Stufe xhigh) erzeugt im Schnitt rund 81.000 Ausgabe-Token pro Aufgabe, 4.6 in derselben Stufe nur etwa 38.000 – ein Anstieg von 125 %. Die Ausgabegeschwindigkeit liegt bei etwa 188 Token pro Sekunde, eine Aufgabe dauert im Schnitt 7,1 Minuten.

Grob gerechnet, nur für die Ausgabe: Eine Aufgabe kostet bei 4.6 rund 0,23 US-Dollar, bei 4.7 rund 0,49 US-Dollar. Der Listenpreis bleibt gleich, die tatsächlichen Kosten pro Aufgabe haben sich aber mehr als verdoppelt – ein erheblicher Teil des Punktezuwachses wird durch "längeres Nachdenken" erkauft.

Im Preisgefüge dieser Woche fällt das noch stärker auf. Einen Tag nach dem Grok-4.7-Start gingen Anthropics Claude Opus 5.5 und OpenAIs GPT-6 Sol an den Start: Opus 5.5 kostet 4 US-Dollar pro Million Eingabe-Token und 20 US-Dollar für die Ausgabe, GPT-6 Sol sank auf 2 und 10 US-Dollar. Gemessen am Listenpreis pro Million Token bleibt der Ausgabepreis von Grok 4.7 weiterhin der niedrigste; wie stark sich der Abstand bei den tatsächlichen Kosten pro Aufgabe verringert, hängt vom Token-Verbrauch der beiden anderen Modelle ab – dazu liegen noch nicht alle Daten von Drittanbietern vor.

Keine zwei Tage nach den 46 Punkten von Grok 4.7 sind mit Opus 5.5 und GPT-6 bereits zwei neue Modellgenerationen in die Bewertungswarteschlange von Artificial Analysis eingereiht – die obere Hälfte der Rangliste dürfte sich noch einmal ändern.

Quellen: offizielle Ankündigungsseite von SpaceXAI, CocoLoop, Bewertungsbericht von Artificial Analysis; API-Preise und offizielle Benchmarks wurden anhand der SpaceXAI-Ankündigungsseite geprüft, Intelligenzindex, Coding-Agent-Index und Token-Verbrauch anhand der Angaben von Artificial Analysis, die Ausgabekosten pro Aufgabe sind eine grobe Schätzung auf Basis der Listenpreise.