Claude Sonnet 5.5 Rilis: 30% Lebih Cepat, Harga Tetap

Anthropic merilis Claude Sonnet 5.5 pada 28 September, model kedua dalam keluarga Claude 5.5 setelah Opus 5.5. Dua angka utama yang diumumkan perusahaan: lebih cepat lebih dari 30% dibanding Sonnet 5, dan biaya per tugas turun hingga 30% untuk sebagian besar pekerjaan. Harga API tidak berubah, tetap 2 dolar AS per juta token input, 10 dolar AS per juta token output, dan 0,2 dolar AS untuk pembacaan cache.

Model ini langsung tersedia hari itu di platform Anthropic sendiri, AWS, Google Cloud, dan Microsoft Azure, dengan nama API claude-sonnet-5-5. Opsi zero data retention tetap tersedia di semua platform seperti sebelumnya. Pengembang independen Simon Willison mencatat bahwa paket gratis claude.ai sudah beralih ke Sonnet 5.5.

Rapor resmi dari Anthropic

Berikut hasil utama yang dicantumkan Anthropic di halaman rilisnya:

BenchmarkSonnet 5.5
Terminal-Bench 4.070,6%
OSWorld 2.1 (sebagian)80,1%
Humanity's Last Exam (dengan tool)64,5%
CursorBench 4.055,5%
FrontierCode 1.1 (Max)46,2%
GDPval-AA v2.11844

Sejumlah pelanggan awal memberi masukan yang terpusat pada kecepatan. Box menyebut model baru ini 2,4 kali lebih cepat dibanding versi sebelumnya, sementara Slack mengatakan mereka mendapat hasil yang lebih baik dan lebih cepat tanpa mengubah prompt.

"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."

—Tyler Nishida, Every

Sisi lain dari pengujian pihak ketiga

Artificial Analysis memberi Sonnet 5.5 skor indeks kecerdasan 56, menempatkannya di posisi kedua, hanya 2 poin di bawah Opus 5.5 yang mendapat 58. Dalam pengujian Terminal-Bench 4.0 versi mereka sendiri, Sonnet 5.5 mendapat 64%, sementara Opus 5.5 dan GPT-6 Astra sama-sama mendapat 60%. Kelemahannya ada pada soal-soal faktual: akurasi faktual hanya 54%, dibanding 66% milik Opus 5.5, dan skor penalaran sains juga 6 poin lebih rendah dari Opus 5.5.

Data biaya tidak sejalan dengan klaim resmi. Dengan menjalankan seluruh rangkaian pengujian pada tingkat penalaran tertinggi (max), Artificial Analysis mendapati Sonnet 5.5 menghasilkan rata-rata sekitar 193.000 token output per tugas — sekitar 60% lebih banyak dibanding tingkat max Opus 5.5 maupun Sonnet 5, dan tujuh kali lebih banyak dari GPT-6 Astra. Dengan harga per token yang sama tapi jumlah token yang jauh lebih besar, biaya per tugas berada di kisaran 7,6 dolar AS, sekitar 50% lebih tinggi dari Sonnet 5.

Kedua pihak sebenarnya mengukur hal yang berbeda. Anthropic berbicara tentang "sebagian besar pekerjaan" — tugas coding dan menulis sehari-hari pada tingkat default. Artificial Analysis menguji kasus ekstrem saat anggaran penalaran (thinking budget) dipakai penuh. Willison mengalami pola yang sama: ia meminta model membuat aplikasi WebGL kecil pada tingkat max, yang menghabiskan 128.000 token dan biaya 1,28 dolar AS; setelah beralih ke tingkat xhigh, tugas yang sama selesai dalam 41 detik dengan biaya hanya sekitar 0,06 dolar AS. Ia juga menyebut Sonnet 5.5 punya masalah yang sama dengan Opus 5.5 — pada tingkat max, model ini cenderung cepat menghabiskan batas token.

Dibandingkan dengan model sekelas

Jika dibandingkan secara horizontal, posisi lini Sonnet kini jelas: memberikan sekitar 80-90% kemampuan Opus dengan harga lebih murah. Saat Sonnet 5 diluncurkan, keunggulan yang ditonjolkan adalah biaya tugas agentic hanya sekitar sepertiga dari Opus; generasi 5.5 menambah kecepatan sekaligus mendekatkan skor benchmark ke Opus 5.5 — di papan peringkat Artificial Analysis, selisih keduanya kini hanya 2 poin.

Perubahan pada paket gratis berdampak pada lebih banyak orang. Menurut Willison, pengguna gratis claude.ai kini mendapat model yang jauh lebih kuat dibanding seri Luna yang dipakai paket gratis ChatGPT. GPT-6 Luna milik OpenAI mengambil jalur harga murah — data Arena terbaru menunjukkan biaya per tugasnya hanya sekitar 0,05 dolar AS. Anthropic belum mengumumkan Haiku 5.5; Willison memperkirakan model itu akan muncul dalam beberapa minggu ke depan, saat tingkat harga murah baru akan benar-benar berhadapan dengan Luna.

Bagi developer, langkah paling praktis adalah jangan langsung mengaktifkan tingkat max. Berdasarkan data yang tersedia saat ini, tingkat default atau xhigh lebih mendekati klaim resmi "lebih cepat dan lebih murah", sementara tagihan pada tingkat max bisa lebih tinggi dibanding generasi sebelumnya. Soal untung atau tidaknya untuk tugas tertentu, Anthropic belum merilis rincian biaya per tingkat, sehingga satu-satunya cara adalah mencobanya sendiri.

Sumber: halaman rilis resmi Anthropic, blog Simon Willison, CocoLoop, laporan benchmark Artificial Analysis; harga API mengacu pada halaman rilis Anthropic, biaya per tugas dan penggunaan token mengacu pada indeks kecerdasan Artificial Analysis pada tingkat max.