Tingkat API OpenAI yang 14x Lebih Cepat Akan Diperluas

OpenAI sedang bersiap membuka mode inferensi Ultrafast untuk lebih banyak developer. Pada 26 September, media asing menemukan opsi kecepatan yang belum diaktifkan tersembunyi di tampilan Playground API Responses, terbagi menjadi tiga tingkat: Standard, Fast, dan Ultrafast. Peluncurannya kemungkinan bertepatan dengan DevDay pada 29 September, meski OpenAI belum mengumumkannya secara resmi, dan cakupan pastinya masih menunggu keterangan resmi.

Saat ini Ultrafast hanya tersedia untuk sebagian kecil pelanggan yang diundang. Jika opsi tiga tingkat ini resmi diluncurkan, kecepatan akan berubah dari hak istimewa uji internal menjadi opsi penagihan biasa yang bisa dipilih developer sesuai kebutuhan tugas.

Angka-angka dari pratinjau Agustus

Ultrafast pertama kali tampil pada 13 Agustus sebagai pratinjau terbatas, hanya untuk model GPT-5.6 Sol. Menurut OpenAI, tingkat ini bisa menghasilkan hingga 750 token per detik, hingga 14 kali lebih cepat dibanding Standard, dengan daya komputasi dari chip wafer-scale Cerebras.

Cerebras menegaskan bahwa tingkat ini bukan menjalankan versi distilasi atau kuantisasi yang dipangkas: arsitektur model, bobot, presisi, konfigurasi konteks, dan pengaturan inferensi semuanya sama dengan GPT-5.6 Sol di endpoint standar. Selisih kecepatan berasal dari perangkat keras — setiap chip wafer-scale membawa 44GB SRAM on-chip, sehingga bobot model menetap di chip dan menghemat waktu yang biasanya terpakai untuk memindahkan data antara memori dan unit komputasi.

Batasan masa pratinjau juga dijelaskan dengan jelas: hanya tersedia lewat API, tidak bisa dipakai di ChatGPT maupun Codex, dan kecepatan perluasannya mengikuti ketersediaan daya komputasi.

Cerebras sendiri merilis dua perbandingan. Pada uji GDP-Val yang mengukur pekerjaan berbasis pengetahuan, Ultrafast disebut mempercepat proses end-to-end hingga 5,6 kali tanpa penurunan kualitas; saat menyelesaikan seluruh 2.500 soal Humanity's Last Exam, versi Ultrafast membutuhkan 11 jam 11 menit, sementara Claude Fable 5 membutuhkan 78 jam 27 menit. Kedua angka ini berasal dari blog resmi Cerebras, dengan kondisi pengujian yang ditentukan sendiri oleh mereka, dan belum ada reproduksi independen hingga saat ini.

"It now finishes for me before I even have the opportunity to context-switch."

Ucapan peneliti OpenAI, Jeffrey Wang, yang maksudnya hasil sudah keluar sebelum ia sempat beralih mengerjakan hal lain.

Langkah ketiga bersama Cerebras

Jika dirangkai, kerja sama OpenAI dengan Cerebras kini sampai pada titik ketiga lewat Ultrafast.

Januari tahun ini, OpenAI menandatangani kesepakatan daya komputasi dengan Cerebras, sepakat untuk menggelar kapasitas hingga 750 megawatt secara bertahap sampai 2028. GPT-5.3-Codex-Spark pada Februari menjadi implementasi pertamanya — model coding yang dirampingkan khusus, berjalan di atas WSE-3 milik Cerebras, menghasilkan lebih dari 1.000 token per detik, dan hanya disediakan untuk Codex di ChatGPT Pro. Pada April, muncul kabar OpenAI menambah komitmen pembelian sekitar 20 miliar dolar AS.

Pendekatan Codex-Spark adalah membuat model kecil khusus demi kecepatan. Ultrafast justru menjalankan model unggulan apa adanya di atas perangkat keras yang lebih cepat. Cara pertama mengorbankan sebagian kemampuan, cara kedua tidak mengorbankan kemampuan tapi memindahkan biayanya ke sisi komputasi. Kemampuan kapasitas Cerebras untuk menopang perluasan yang lebih besar akan menentukan seberapa luas pembukaan akses kali ini.

Cara pembagian tiga tingkat

Dengan tiga tingkat berjajar, developer bisa memilih latensi sesuai tugas. Untuk asisten coding atau layanan pelanggan real-time — skenario di mana seseorang menunggu hasil di depan layar — kecepatan langsung memengaruhi pengalaman; sementara untuk pemrosesan batch dan evaluasi yang berjalan malam hari, sedikit lebih lambat demi harga lebih murah justru lebih masuk akal. Membagi model yang sama berdasarkan kecepatan respons ini mirip dengan cara penyedia cloud mengenakan biaya berdasarkan spesifikasi instance.

Masih ada dua hal yang belum terjawab. Pertama soal harga — sejak pratinjau dimulai, Ultrafast belum pernah mengumumkan tarifnya, dan selisih harga dengan tingkat Fast pun belum jelas. Kedua soal cakupan — GPT-6 Sol dan GPT-6 Astra sudah dirilis berturut-turut, tapi belum bisa dipastikan apakah setiap model GPT-6 akan mendukung Ultrafast sejak peluncurannya.

Jika benar-benar diluncurkan pada hari DevDay, halaman harga akan jadi hal pertama yang dicek para developer.

Sumber: pengumuman pratinjau Ultrafast dari OpenAI Developer Community, blog resmi Cerebras, CocoLoop, TestingCatalog; angka 750 token per detik, percepatan 14 kali, dan percepatan 5,6 kali pada GDP-Val semuanya berdasarkan klaim OpenAI dan Cerebras sendiri.