Platform evaluasi model Arena mengumumkan dini hari 27 September (waktu Beijing) bahwa Claude Opus 5.5 (High) langsung menduduki peringkat pertama Text Arena begitu tampil, dengan skor 1509. Angka ini 18 poin lebih tinggi dibanding generasi sebelumnya, Opus 5 (High), yang kini berada di peringkat ke-11.
Text Arena adalah papan peringkat tertua di Arena: pengguna melihat jawaban dari dua model anonim secara berdampingan lalu memilih yang lebih baik, dan platform mengonversi suara tersebut menjadi skor dengan metode mirip Elo. Papan peringkat ini telah mengumpulkan lebih dari 8,5 juta suara, mencakup penulisan, pemrograman, matematika, hingga tanya jawab sehari-hari.
Enam Besar Seluruhnya Milik Anthropic
Setelah pembaruan ini, keenam posisi teratas Text Arena seluruhnya diisi model Anthropic. Berdasarkan halaman peringkat resmi Arena:
| Peringkat | Model | Skor | Jumlah Suara |
|---|---|---|---|
| 1 | Claude Opus 5.5 (High) | 1509 ±12 | 2.307 |
| 2 | Claude Opus 4.6 (High) | 1505 ±3 | 76.518 |
| 3 | Claude Fable 5 (High) | 1504 ±4 | 36.462 |
| 4 | Claude Opus 4.7 (High) | 1502 ±4 | 64.007 |
| 5 | Claude Fable 5.1 (Max) | 1501 ±7 | 9.942 |
| 6 | Claude Opus 4.6 | 1498 ±3 | 80.836 |
Peringkat ketujuh ditempati Muse Spark 1.2 (xHigh) dari Meta dengan 1496 poin, sementara model Google dengan peringkat tertinggi adalah Gemini 3.8 Flash (High) di posisi ke-10 dengan 1492 poin. Hanya Anthropic, Meta, dan Google yang muncul di 15 besar; seri GPT-6 dari OpenAI yang baru dirilis 22 September tidak terlihat di rentang ini.
Arena juga menempatkan Opus 5.5 pada garis depan rasio harga-kinerja di Text Arena. Berdasarkan konversi harga input dan output, tarif gabungannya setara 16 dolar AS per juta token. Anthropic mematok harga API Opus 5.5 sebesar 4 dolar AS untuk input dan 20 dolar AS untuk output, masing-masing sekitar seperlima lebih murah dibanding Opus 5.
Jumlah Suara Masih Terlalu Sedikit
Selisih antara peringkat pertama dan keenam hanya 11 poin, sementara margin kepercayaan Opus 5.5 sendiri adalah ±12 poin. Dengan kata lain, secara statistik model-model dari peringkat pertama hingga keenam ini belum bisa dibedakan tingkat unggulnya.
Penyebabnya adalah jumlah suara. Opus 5.5 baru tayang kurang dari seminggu dan baru mengumpulkan 2.307 suara; Opus 4.6 (High) yang berada tepat di bawahnya sudah memiliki lebih dari 76.000 suara, sehingga margin kepercayaannya menyempit menjadi ±3. Margin yang lebar dan skor yang berfluktuasi pada model yang baru masuk papan adalah hal biasa di Arena, dan dalam beberapa minggu ke depan skor ini bisa naik atau turun.
Dalam pengumumannya, Arena hanya menyebut model ini “langsung memuncak sejak debut”, tanpa merinci peringkat per kategori. Posisi Opus 5.5 di papan peringkat khusus pemrograman, matematika, atau penulisan kreatif belum diungkapkan.
Mengapa Opus 5 Kalah dari Model Lama
Yang lebih menarik dari papan peringkat ini adalah Opus 5. Berdasarkan urutan rilis, model ini lebih baru dibanding Opus 4.6 maupun 4.7, tetapi di Text Arena hanya menempati peringkat ke-11, tertinggal 14 poin dari Opus 4.6 (High) dan 13 poin dari saudaranya, Fable 5 (High).
Text Arena mengukur jawaban mana yang lebih disukai pengguna dalam perbandingan anonim berdampingan, dan ini tidak sama dengan tingkat akurasi penyelesaian soal. Panjang jawaban, nada bahasa, dan format ikut memengaruhi suara, sehingga model yang sebenarnya lebih kuat dalam penalaran tetap bisa kalah dalam voting preferensi karena jawabannya bertele-tele atau terkesan seperti buku manual.
Anthropic memang serius menggarap kualitas penulisan pada generasi ini. Insinyur perusahaan sebelumnya pernah menjelaskan secara terbuka mengapa kualitas tulisan Claude sempat memburuk, yaitu karena bobot reward dalam reinforcement learning membuat model semakin menulis seolah-olah untuk pembaca AI. Opus 5.5 disebut sebagai versi pertama yang secara khusus disesuaikan untuk kejelasan tingkat kalimat. Berapa banyak dari 18 poin kenaikan Opus 5.5 dibanding Opus 5 yang berasal dari penyesuaian gaya penulisan ini, dan berapa banyak dari peningkatan kemampuan itu sendiri, tidak bisa dipisahkan dari data Arena, dan Anthropic pun belum merilis evaluasi terkait hal ini.
Jika dirangkai antar-generasi: Opus 4.6 dan 4.7 masih bertahan di empat besar, Opus 5 gagal mengambil alih posisi puncak setelah dirilis, dan baru Opus 5.5 yang berhasil menghadirkan wajah baru di peringkat pertama. Saat ini, saingan utama Anthropic di papan peringkat preferensi ini adalah versi lamanya sendiri.
Sumber: akun resmi Arena, papan peringkat Arena Text, CocoLoop, halaman harga model Anthropic; skor, margin kepercayaan, dan jumlah suara mengikuti data halaman Arena saat artikel ini ditulis.