GPT-6 Sol und Luna starten, API-Preise halbiert

OpenAI hat am 22. September GPT-6 Sol und GPT-6 Luna veröffentlicht, mit den API-Modell-IDs gpt-6-sol und gpt-6-luna, die noch am selben Tag nutzbar waren. Beide Modelle kosten nur halb so viel wie die entsprechenden Vorgänger der GPT-5.6-Generation, das Kontextfenster liegt bei 1,1 Millionen Token. In ChatGPT stehen die beiden Modelle den Tarifen Work, Pro, Business, Enterprise und Edu zur Verfügung, Luna wird zudem in die kostenlose Version und die Go-Version der Desktop-App aufgenommen, Codex erhält das Update zeitgleich mit ChatGPT Work. OpenAI hat keine Gewichte veröffentlicht, beide Modelle sind ausschließlich über die API verfügbar.

Die von OpenAI genannten Ergebnisse

Im Veröffentlichungsmaterial listet OpenAI mehrere Werte auf:

  • AutomationBench 1.0.6 (berufliche Arbeitsaufgaben): Sol erreicht in der Denkstufe xhigh eine Genauigkeit von 33,2 Prozent bei Kosten von 0,27 US-Dollar pro Aufgabe; Luna liegt in der Stufe high 5,4 Punkte über dem Vorgänger, bei 58 Prozent niedrigeren Kosten.
  • DeepSWE v1.1 (Programmieren): Sol erreicht in der Stufe max 68,8 Prozent, Luna 66,6 Prozent.
  • OSWorld 2.0 Offline-Version (Computerbedienung): Sol erreicht in der Stufe xhigh 60,5 Prozent, laut OpenAI vergleichbar mit Opus 5 in der mittleren Stufe, aber bei 80 Prozent niedrigeren Kosten; Luna übertrifft in der Stufe max den Sol der Vorgängergeneration, bei etwa einem Zehntel der Kosten.
  • Agents' Last Exam: Sol erreicht in der Stufe max 56,4 Prozent.

Dazu kommt ein überarbeitetes Prompt-Caching-System. OpenAI zufolge müssen Agenten bei jeder Runde dieselben Anweisungen, Tool-Definitionen und den Verlauf erneut senden; das neue System erhöht standardmäßig die Trefferquote im Cache, beim Cache-Lesen gibt es bis zu 90 Prozent Rabatt.

Die Einschätzung Dritter: Preise runter, Werte unverändert

Die Nachtests von Artificial Analysis weichen an einer Stelle vom offiziellen Material ab, nämlich bei der Leistungsfähigkeit. Das Unternehmen erklärt, der Intelligenzindex und der Coding-Agent-Index beider Modelle lägen gegenüber GPT-5.6 weitgehend unverändert: Beim Coding-Agent-Index erreicht Sol in der Stufe max 57 Punkte, 2 Punkte mehr als der Vorgänger; Luna kommt auf 41 Punkte, 2 Punkte weniger als der Vorgänger.

Die eigentliche Veränderung liegt bei den Kosten. Bei gleichem Intelligenzindex-Test kostet Sol in der Stufe max 1,06 US-Dollar pro Aufgabe, der Vorgänger lag bei 1,99 US-Dollar; Luna kostet 0,07 US-Dollar, der Vorgänger 0,18 US-Dollar.

Eine Beispielrechnung

Grob nach der Methode von Artificial Analysis gerechnet: Ein Team, das täglich 10.000 vergleichbare Aufgaben ausführt, spart mit Sol rund 9.300 US-Dollar pro Tag, fast 280.000 US-Dollar im Monat; wechselt man auf die leichte Stufe Luna, sinken die täglichen Kosten bei gleichem Aufgabenvolumen von 1.800 auf 700 US-Dollar. Das ist nur eine direkte Hochrechnung der Benchmark-Werte, die tatsächliche Rechnung hängt von Aufgabenlänge, Denkstufe und Cache-Trefferquote ab — besonders beim Cache: Bei Agenten-Anwendungen, die wiederholt denselben System-Prompt senden, spart jeder zehn Prozentpunkte höhere Trefferquote mehr als die Preissenkung selbst.

Zum Vergleich: Am selben Tag hat Anthropic Claude Opus 5.5 veröffentlicht, mit insgesamt 40 Prozent niedrigeren Betriebskosten gegenüber Opus 5, zum Preis von 4 US-Dollar für Eingabe und 20 US-Dollar für Ausgabe. Beide Unternehmen haben am selben Tag die Preise ihrer Flaggschiffmodelle gesenkt, der Preis von Sol liegt bei der Hälfte von Opus 5.5, während Luna die leichte Stufe auf 0,10 US-Dollar drückt.

Für Entwickler in China hängt die tatsächliche Wirkung dieser Preissenkung vom Zugangsweg ab. Teams, die direkt über die offizielle API arbeiten, profitieren voll von der Senkung; wer über Relay-Dienste oder Cloud-Anbieter zugreift, muss abwarten, ob die Aufschläge entsprechend angepasst werden — das hängt von den jeweiligen Anbietern ab. Bei Agenten-Produkten, die nach Aufgabenkosten abrechnen, wird sich die Margenstruktur als Erstes ändern: Bei gleicher Funktion lassen sich nach der Halbierung der Inferenzkosten frühere Design-Entscheidungen, die Aufrufe zur Kostenkontrolle begrenzten, lockern — mit dem Nachteil, dass Wettbewerber dasselbe tun können.

Quellen: Veröffentlichungsmaterial von OpenAI, Testbericht von Artificial Analysis, CocoLoop, MarkTechPost; Drittanbieter-Tests gleichen Kosten pro Aufgabe und Coding-Agent-Index-Werte ab.