Der Ultrafast-Inferenz-Tarif hat seine Preview-Phase mit Einladung beendet. OpenAI hat diesen Service-Tarif am 8. Oktober in der Responses API für GPT-6.1 Sol offiziell freigegeben und zum ersten Mal einen Preis auf der Preisseite ausgewiesen. Beim Aufruf bleibt der Modellname gpt-6.1-sol, man muss nur service_tier auf "ultrafast" setzen. Das Modell selbst hat sich nicht geändert, verkürzt wird der Abstand zwischen den Output-Token.
Der Tarif steht allen API-Nutzern offen, unterliegt Rate Limits, unterstützt globale Verarbeitung sowie Datenresidenz in den USA und der EU. Codex und ChatGPT Work sind gleichzeitig gestartet, allerdings nur für Pro 500, bestimmte nutzungsbasierte Unternehmenstarife und punktebasierte Bildungstarife; in der Enterprise-Version muss ein Administrator es manuell aktivieren.
Wie die fünf Tarife abgerechnet werden
Laut OpenAIs Preisseite gilt ein Input von bis zu 272.000 Token als kurzer Kontext; die Preise pro Tarif (in US-Dollar pro Million Token):
| Tarif | Input | Cached Input | Cache-Schreiben | Output |
|---|---|---|---|---|
| Batch / Flex | 1 | 0.05 | 1.25 | 5 |
| Standard | 2 | 0.10 | 2.50 | 10 |
| Fast | 4 | 0.20 | 5 | 20 |
| Ultrafast | 12 | 0.60 | 15 | 60 |
Bei langem Kontext über 272.000 Token hinaus steigt Ultrafast auf 24 US-Dollar Input und 90 US-Dollar Output. Alle Preise liegen beim Sechsfachen des Standard-Tarifs, ebenso die beiden Cache-bezogenen Posten.
Wie viel schneller ist es wirklich
OpenAIs Dokumentation nennt nur relative Faktoren, keine absoluten Geschwindigkeiten. Der offizielle OpenAI-Entwickleraccount spricht von "bis zu etwa 8-fach"; mehrere Medien zitieren eine feinere Aufteilung: in Codex bis zu etwa 8-fach, in der API bis zu etwa 6-fach. VentureBeat berichtete von rund 300 Token pro Sekunde, diese Zahl taucht in der offiziellen Dokumentation nicht auf, maßgeblich ist der Faktor.
Ultrafast hat eigene Rate Limits: im Build-Tarif eine Million Token pro Minute, im Launch-Tarif vier Millionen, im Grow-Tarif 40 Millionen – unabhängig vom Kontingent der Standard- und Fast-Tarife.
Den von OpenAI genannten Anwendungsfall formuliert das Unternehmen so:
"Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts."
(Gemacht für Arbeit, bei der Geschwindigkeit und Intelligenz den Unterschied machen: das Debuggen eines Ausfalls, Agenten, die sich durch Apps bewegen, und Live-Erlebnisse, bei denen jede Sekunde zählt.)
Eine Beispielrechnung
Angenommen, eine Agenten-Aufgabe liest 200.000 Token ein und gibt 20.000 Token aus, Caching nicht berücksichtigt. Grob gerechnet: Standard-Tarif etwa 0,6 US-Dollar, Fast-Tarif etwa 1,2 US-Dollar, Ultrafast etwa 3,6 US-Dollar.
Bei einer angenommenen Höchstgeschwindigkeit von 6-fach im API-Szenario lässt sich eine ursprünglich sechsminütige Aufgabe auf etwa eine Minute verkürzen, man spart 5 Minuten und zahlt rund 3 US-Dollar mehr – das entspricht 0,6 US-Dollar mehr pro gesparter Minute Wartezeit. Das ist der Idealfall; wird die tatsächliche Beschleunigung nicht erreicht, steigt der Preis pro Minute weiter.
Für einen Entwickler, der einen Ausfall untersucht, spielt dieser Betrag kaum eine Rolle; Teams, die Offline-Aufgaben im Batch fahren, bleiben bei Batch und Flex, die nur halb so teuer sind wie der Standard-Tarif.
Dieser Tarif hatte bereits zuvor eine Preview-Phase. Am 13. August debütierte Ultrafast als eingeschränkte Preview, zunächst nur für GPT-5.6 Sol; OpenAI sprach damals von bis zu 750 Token pro Sekunde und bis zu 14-fach schnellerer Verarbeitung als im Standard, die Rechenleistung kam von Cerebras' Wafer-Scale-Chips. Mit dem offiziellen Start von GPT-6.1 Sol änderte sich der offizielle Faktor auf bis zu 6- bis 8-fach, zur zugrunde liegenden Hardware äußert sich die aktuelle Ankündigung nicht.
Zu Nutzungsvolumen und Anteil zahlender Nutzer von Ultrafast hat OpenAI noch keine Zahlen veröffentlicht. Ob der Tarif auf andere Modelle wie Astra ausgeweitet wird, erwähnt die Dokumentation ebenfalls nicht.
Quellen: OpenAI-Entwickler-Changelog, CocoLoop, OpenAI-API-Preisseite (Preise je Tarif für kurzen und langen Kontext), VentureBeat, Runtime Wire; Runtime Wire prüfte Rate Limits und Verfügbarkeit.