OpenAI resmikan tier Ultrafast untuk GPT-6.1 Sol, harga 6x standar

Tier inferensi Ultrafast resmi keluar dari masa pratinjau berbasis undangan. Pada 8 Oktober, OpenAI membuka tier layanan ini secara resmi untuk GPT-6.1 Sol di dalam Responses API, dan untuk pertama kalinya mencantumkan harganya di halaman harga. Saat memanggil model, namanya tetap gpt-6.1-sol, dan pengguna hanya perlu mengatur service_tier menjadi "ultrafast". Model itu sendiri tidak berubah; yang dipersingkat adalah jarak antar-token output.

Tier ini terbuka untuk semua pengguna API, dengan batasan rate limit, mendukung pemrosesan global, serta mendukung residensi data di Amerika Serikat dan Uni Eropa. Codex dan ChatGPT Work juga meluncurkannya secara bersamaan, tetapi hanya untuk pengguna Pro 500, paket perusahaan berbasis penggunaan yang memenuhi syarat, dan paket pendidikan berbasis poin; untuk versi enterprise, admin harus mengaktifkannya secara manual.

Begini skema harga lima tier

Menurut halaman harga OpenAI, input hingga 272 ribu token dihitung sebagai konteks pendek, dengan harga tiap tier sebagai berikut (dolar AS per juta token):

TierInputInput cachePenulisan cacheOutput
Batch / Flex10.051.255
Standard20.102.5010
Fast40.20520
Ultrafast120.601560

Untuk konteks panjang di atas 272 ribu token, harga Ultrafast naik menjadi 24 dolar untuk input dan 90 dolar untuk output. Semua harga satuan itu enam kali lipat tier Standard, termasuk dua angka yang terkait cache.

Seberapa cepat sebenarnya

Dokumentasi OpenAI hanya memberikan kelipatan relatif, tanpa mencantumkan kecepatan absolut. Akun developer resmi OpenAI menyebut "hingga sekitar 8 kali lebih cepat"; sejumlah media yang mengutip rincian lebih detail menyebutkan hingga sekitar 8 kali di Codex dan hingga sekitar 6 kali di API. VentureBeat melaporkan kecepatan sekitar 300 token per detik, angka yang tidak muncul di dokumentasi resmi, sehingga kelipatan resmi tetap menjadi acuan.

Ultrafast memiliki rate limit tersendiri: tier Build sebesar 1 juta token per menit, tier Launch 4 juta, dan tier Grow 40 juta, yang semuanya tidak memotong kuota tier Standard maupun Fast.

OpenAI menjelaskan kasus penggunaan yang ditargetkan seperti ini:

"Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts."

(Dibuat untuk pekerjaan yang mengandalkan kecepatan dan kecerdasan sekaligus: men-debug gangguan layanan, agen yang menjalankan aplikasi, serta pengalaman langsung yang setiap detiknya berarti.)

Menghitung biayanya

Misalkan sebuah tugas agen membaca 200 ribu token input dan menghasilkan 20 ribu token output, tanpa menghitung cache. Perkiraan kasarnya, tier Standard sekitar 0,6 dolar, Fast sekitar 1,2 dolar, dan Ultrafast sekitar 3,6 dolar.

Dengan asumsi kecepatan maksimum 6 kali lipat di skenario API, tugas yang tadinya butuh 6 menit bisa dipangkas menjadi sekitar 1 menit, menghemat 5 menit dengan biaya tambahan sekitar 3 dolar — atau sekitar 0,6 dolar untuk setiap menit waktu tunggu yang dihemat. Itu skenario paling ideal; jika peningkatan kecepatan di dunia nyata tidak mencapai batas atas, biaya per menit yang dihemat akan lebih tinggi lagi.

Bagi seorang engineer yang sedang menangani insiden produksi, biaya segitu hampir tidak perlu dipikirkan. Tim yang menjalankan tugas batch secara offline akan tetap memakai Batch dan Flex, yang harganya hanya separuh dari tier Standard.

Tier ini sebelumnya sempat melalui masa pratinjau. Pada 13 Agustus, Ultrafast pertama kali muncul sebagai pratinjau terbatas yang hanya tersedia untuk GPT-5.6 Sol, dan saat itu OpenAI menyebutkan kecepatan hingga 750 token per detik, hingga 14 kali lebih cepat dibanding pemrosesan standar, dengan dukungan chip wafer-scale dari Cerebras. Setelah resmi dibuka untuk GPT-6.1 Sol, kelipatan resminya berubah menjadi 6 hingga 8 kali, dan pengumuman kali ini tidak menyebutkan perangkat keras yang mendasarinya.

OpenAI belum mengungkapkan volume pemanggilan Ultrafast maupun proporsi pengguna berbayar yang memakainya. Apakah tier ini akan diperluas ke model lain seperti Astra juga tidak disebutkan dalam dokumentasi.

Sumber: log pembaruan developer OpenAI, CocoLoop, halaman harga API OpenAI (harga per tier untuk konteks pendek dan panjang), VentureBeat, Runtime Wire; Runtime Wire memverifikasi rate limit dan jangkauan rilis.