OpenAI merilis dua model baru, GPT-6 Sol dan GPT-6 Luna, pada 22 September. ID model di API masing-masing adalah gpt-6-sol dan gpt-6-luna, dan keduanya langsung bisa dipanggil developer pada hari yang sama. Harga kedua model ini tepat setengah dari harga model GPT-5.6 yang setara, dan keduanya sama-sama punya jendela konteks 1,1 juta token.
Di sisi ChatGPT, paket Work, Pro, Business, Enterprise, dan Edu semuanya bisa mengakses kedua model baru ini. Luna juga masuk ke versi gratis dan paket Go di desktop, sehingga lebih luas ketersediaannya dibanding Sol, sementara Codex mendapat pembaruan bersamaan dengan ChatGPT Work. OpenAI tidak merilis bobot model untuk keduanya — Sol dan Luna hanya tersedia lewat API, tanpa opsi open-weight.
Hasil resmi dari OpenAI
Materi rilis resmi OpenAI mencantumkan beberapa hasil benchmark sebagai bukti peningkatan:
- AutomationBench 1.0.6, yang mengukur tugas kerja profesional: Sol mencatat akurasi 33,2% pada tingkat penalaran xhigh, dengan biaya $0,27 per tugas. Luna, pada tingkat high, unggul 5,4 poin persentase dari generasi sebelumnya dengan biaya 58% lebih rendah.
- DeepSWE v1.1, benchmark coding: Sol mencapai 68,8% pada tingkat max, dan Luna mencapai 66,6%.
- OSWorld 2.0 versi offline, yang menguji tugas pengoperasian komputer: Sol mencetak 60,5% pada tingkat xhigh, yang menurut OpenAI setara dengan Opus 5 pada tingkat menengah, namun dengan biaya 80% lebih rendah. Luna, pada tingkat max, secara langsung mengungguli Sol generasi sebelumnya, dengan biaya sekitar sepersepuluhnya.
- Agents' Last Exam: Sol mencetak 56,4% pada tingkat max.
Peluncuran ini juga disertai sistem prompt caching yang dirombak. Menurut OpenAI, agent cenderung mengirim ulang instruksi sistem, definisi tool, dan riwayat percakapan yang sama di setiap giliran, sehingga sistem baru ini dirancang untuk menaikkan tingkat cache hit secara default di semua lini, yang pada gilirannya memangkas biaya cache read hingga 90%.
Versi pihak ketiga: harga turun, skor stagnan
Pengujian independen dari Artificial Analysis memberi gambaran yang sedikit berbeda dari sisi kemampuan, berbeda dari penekanan materi resmi OpenAI. Pengujian lembaga ini menempatkan indeks intelijen dan indeks coding agent kedua model kurang lebih setara dengan GPT-5.6. Khusus pada indeks coding agent, Sol meraih 57 poin pada tingkat max, dua poin lebih tinggi dari generasi sebelumnya, sementara Luna meraih 41 poin, dua poin lebih rendah dari model yang digantikannya.
Menurut Artificial Analysis, yang benar-benar berubah signifikan dari peluncuran ini adalah biaya. Dengan menjalankan rangkaian benchmark indeks intelijen yang sama, biaya Sol per tugas pada tingkat max adalah $1,06, dibanding $1,99 pada generasi sebelumnya — hampir setengahnya. Luna berada di angka $0,07 per tugas, turun dari $0,18.
Menghitung penghematannya
Ekstrapolasi kasar dari angka biaya Artificial Analysis memberi gambaran skalanya: sebuah tim yang menjalankan sekitar 10 ribu tugas sejenis per hari bisa menghemat sekitar $9.300 per hari dengan beralih ke Sol, yang jika dijumlahkan mencapai hampir $280 ribu dalam sebulan. Beralih ke tingkat yang lebih ringan seperti Luna memangkas biaya lebih jauh lagi — beban kerja harian yang sama turun dari sekitar $1.800 menjadi $700.
Perhitungan itu adalah ekstrapolasi langsung dari data biaya benchmark, bukan jaminan — tagihan sebenarnya sangat bergantung pada panjang tugas, tingkat penalaran yang dipilih tim, dan seberapa sering konten cache dipakai ulang. Tingkat cache hit ternyata lebih penting dari yang terlihat: untuk aplikasi agent yang terus-menerus mengirim ulang system prompt yang sama di setiap giliran, setiap kenaikan 10 poin persentase pada cache hit bisa menghemat lebih banyak uang dibanding penurunan harga itu sendiri.
Waktunya bertepatan dengan langkah serupa dari pesaing: Anthropic merilis Claude Opus 5.5 pada hari yang sama, memangkas biaya operasional keseluruhan sebesar 40% dibanding Opus 5, dengan harga $4 per juta token input dan $20 per juta token output. Kedua perusahaan sama-sama menurunkan harga model andalan mereka pada hari yang sama — harga per token Sol setara setengah dari Opus 5.5, sementara Luna menekan titik harga tingkat ringan hingga ke angka $0,10.
Bagi developer di China, seberapa besar penurunan harga ini benar-benar sampai ke mereka bergantung pada jalur mana yang mereka pakai untuk memanggil API. Tim yang memanggil API resmi OpenAI secara langsung menikmati penurunan harga secara penuh dan seketika. Yang memakai layanan relay atau kanal reseller penyedia cloud harus menunggu dan melihat apakah penyedia tersebut meneruskan penurunan yang sama pada markup mereka sendiri — itu keputusan masing-masing penyedia, bukan OpenAI. Produk agent yang dihargai per biaya tugas kemungkinan akan lebih dulu merasakan dampaknya pada struktur margin mereka: dengan biaya inferensi yang dipangkas separuh untuk fungsi yang sama, desain yang sebelumnya membatasi jumlah pemanggilan hanya untuk menekan biaya kini punya ruang untuk melonggarkan batasan itu — meski produk pesaing yang dibangun di atas model yang sama juga bisa melakukan hal serupa.
Sumber: materi rilis OpenAI, laporan benchmark Artificial Analysis, CocoLoop, MarkTechPost; pengujian pihak ketiga memverifikasi biaya per tugas dan skor indeks coding agent.