Pada 2 Oktober, platform benchmark Arena menambahkan Claude Sonnet 5.5 (tingkat Max) dan GPT-6.1 Sol (tingkat Max) ke papan peringkat Agent Arena. Kedua model ini mendarat di posisi ketiga dan kelima, dengan tingkat perbaikan bersih 12,52% dan 11,23%. Dua posisi teratas masih dipegang model milik Anthropic sendiri: Claude Fable 5.1 (14,31%) dan Opus 5.5 (13,82%). Posisi keempat ditempati GPT-6 Astra (12,27%).
Cara Agent Arena menilai model berbeda dari arena berbasis teks yang biasa dikenal orang. Platform ini melacak sesi pengguna sungguhan yang memakai model sebagai agen — memanggil tool, menjalankan tugas multi-langkah, lalu dinilai berdasarkan apakah penggunanya puas pada akhirnya. Halaman papan peringkat menunjukkan total sesi kumulatif sekitar 2,158 juta di 51 model. Tingkat perbaikan bersih menggabungkan keandalan pemanggilan tool, penyelesaian tugas, dan steerability (kemampuan diarahkan); pada 30 September, Arena merevisi cara penilaian steerability, dari sekadar mengecek apakah model memperbaiki sesuatu setelah dikoreksi, menjadi menilai setiap giliran dalam percakapan yang bisa dinilai — jadi model yang langsung benar sejak awal kini mendapat nilai lebih besar.
Ketiga dan Kelima, Selisihnya Ada di Dalam Margin Error
Dilihat dari peringkat saja, Sonnet 5.5 mengungguli GPT-6 Astra maupun GPT-6.1 Sol. Tapi kalau margin error dimasukkan, gambarannya berubah: skor Sonnet 5.5 adalah 12,52% ± 3,09%, sementara GPT-6.1 Sol 11,23% ± 2,76%. Kedua rentang ini tumpang tindih cukup besar, dan selisih dengan Astra di posisi keempat hanya 0,25 poin persentase. Kedua model baru saja masuk papan peringkat, jadi sampel sesinya masih sedikit, membuat rentang errornya lebih lebar dibanding Opus 5.5 yang hanya ± 2,17%. Berdasarkan data saat ini, sulit memastikan model mana di antara posisi ketiga hingga kelima yang benar-benar lebih unggul.
Di metrik rinci, kedua model punya keunggulan masing-masing. Sonnet 5.5 menempati posisi pertama dalam pemulihan setelah perintah Bash gagal, dengan skor 15,05%. GPT-6.1 Sol menempati posisi pertama dalam halusinasi tool — mengarang tool yang tidak ada hanya 0,49% dari waktu — dan menempati posisi kedua dalam penyelesaian tugas yang dikonfirmasi pengguna dengan skor 15,47%.
Tagihan Menunjukkan Cerita yang Berbeda
Harga API kedua model ini sama persis: $2 per juta token input, $10 per juta token output. Tapi dalam tugas agentic, biaya per tugas bisa berbeda beberapa kali lipat. Halaman biaya Arena menunjukkan:
| Model | Tingkat perbaikan bersih | Biaya per tugas |
|---|---|---|
| Claude Fable 5.1 | 14,31% | sekitar $4,91 |
| Claude Opus 5.5 | 13,82% | sekitar $1,56 |
| Claude Sonnet 5.5 | 12,52% | sekitar $2,99 |
| GPT-6 Astra | 12,27% | sekitar $3,10 |
| GPT-6.1 Sol | 11,23% | sekitar $0,58 |
| DeepSeek V4.1 Flash | 4,02% | sekitar $0,11 |
Harga per token sama, tapi biaya per tugas berbeda sekitar lima kali lipat — selisihnya ada di penggunaan token. Di tingkat Max, Sonnet 5.5 menulis lebih panjang dan "berpikir" lebih lama; pengujian pihak ketiga sebelumnya juga menemukan model ini menghabiskan token yang jauh lebih banyak per tugas dibanding generasi sebelumnya. Hasilnya, skornya lebih rendah dibanding Opus 5.5 — model Anthropic sendiri yang lebih besar — sambil menghabiskan biaya lebih banyak, dan gagal masuk ke garis depan efisiensi biaya (Pareto frontier) versi Arena. Garis depan ini saat ini digambar oleh empat titik: Fable 5.1, Opus 5.5, GPT-6.1 Sol, dan DeepSeek V4.1 Flash.
GPT-6.1 Sol adalah model yang menggambar ulang garis depan itu kali ini. Perbandingan yang dirilis Arena menyebutkan biaya median per tugasnya 39% lebih rendah dibanding GPT-6 Sol sebelumnya, sementara skornya malah 1,52 poin persentase lebih tinggi; dibanding GPT-6 Astra, harganya 81% lebih murah dengan selisih skor di bawah 1,04 poin. GPT-6.1 Sol menggantikan GPT-6 Sol hanya sekitar seminggu setelah rilis, dan papan peringkat ini memberi OpenAI semacam catatan pihak ketiga bahwa model ini "lebih murah tanpa kehilangan skor."
Angka biaya ini juga punya batasan metodologi. Data Arena mencerminkan sesi yang dimulai pengguna di platformnya sendiri — jenis tugasnya cenderung ke penulisan kode, riset, dan menjalankan perintah, distribusi yang belum tentu cocok dengan alur kerja nyata di perusahaan. Biaya dikonversi dari pengeluaran sebenarnya Arena saat memanggil API; tagihan perusahaan yang memakai diskon cache atau diskon volume bisa lebih rendah. Siapa pun yang memakai tabel ini untuk keputusan pembelian sebaiknya menguji ulang dengan sampel tugas mereka sendiri dulu.
Dibandingkan dengan Generasi Sebelumnya
Melihat gambaran lebih luas, lini Sonnet terus naik secara konsisten di peringkat Agent Arena. Generasi sebelumnya, Sonnet 5, debut di posisi keenam; kali ini 5.5 berhasil masuk tiga besar. Di sisi OpenAI, ritmenya berbeda: GPT-6 Sol debut pada 25 September dengan tingkat perbaikan bersih 9,71%; seminggu kemudian, 6.1 Sol mengambil alih, dengan skor naik sekitar satu setengah poin sambil memotong biaya sekitar 40%.
Bagi developer, pilihan model untuk menjalankan tugas agentic tergantung volume pekerjaan. Untuk tugas kompleks yang sesekali dijalankan, model dengan skor tinggi dan harga yang masih wajar seperti Opus 5.5 lebih praktis. Untuk menjalankan tugas dalam skala besar dengan pembayaran sesuai pemakaian, opsi berbiaya rendah seperti GPT-6.1 Sol dan DeepSeek V4.1 Flash lebih masuk akal. Soal Sonnet 5.5, di tingkat reasoning yang lebih rendah biaya dan skornya akan berada di mana masih belum diketahui — Arena sejauh ini hanya menguji tingkat Max.
Sumber: papan peringkat Agent Arena dari Arena, halaman garis depan biaya Arena, CocoLoop, akun resmi Arena, Artificial Analysis; tingkat perbaikan bersih, margin error, dan biaya per tugas tiap model mengikuti angka yang ditampilkan di halaman Arena.