Claude Opus 5.5 Rilis, Biaya Operasional Turun 40%

Anthropic merilis Claude Opus 5.5 pada 22 September, model pertama dalam jajaran Claude 5.5. Klaim resmi perusahaan ada dua: performa di sebagian besar tugas setara dengan Claude Fable 5.1, dan biaya operasional keseluruhan 40% lebih rendah dibanding Opus 5.

Rincian harga per item: input turun menjadi 4 dolar per juta token dan output 20 dolar, masing-masing turun sekitar 20%; biaya baca cache turun dari 0,50 dolar menjadi 0,20 dolar, penurunan 60%. Dari sisi kecepatan, Anthropic mengklaim output lebih cepat 30% lebih dari Opus 5, dan ada juga mode fast seharga 8 dolar dan 40 dolar dengan kecepatan hingga 2,5 kali lipat. Model ini tersedia di Claude platform API (ID model claude-opus-5-5), AWS, Google Cloud, dan Microsoft Azure, dengan aplikasi konsumen di berbagai platform dirilis bersamaan; output maksimum per permintaan adalah 128.000 token.

Hasil Benchmark

Berikut perbandingan yang dipublikasikan Anthropic di halaman rilis resminya.

BenchmarkOpus 5.5Fable 5.1Opus 5
Terminal-Bench 4.066.4%55.8%52.3%
FrontierCode v1.154.4%50.3%48.0%
CursorBench 4.057.8%51.8%46.6%
GDPval-AA v2.11846 Elo17351708
OSWorld 2.081.8%80.7%74.0%

Lembaga evaluasi pihak ketiga Artificial Analysis menempatkan Opus 5.5 di peringkat pertama indeks kecerdasannya dengan skor 58. Claude Code versi 2.1.280 yang dirilis pada hari yang sama sudah menjadikan Opus 5.5 sebagai model Opus default.

Halaman rilis juga mengutip masukan dari beberapa pelanggan yang mencoba model ini: GitHub menyebut jumlah langkah untuk menyelesaikan tugas terminal yang sama kurang dari setengah dibanding Opus 5; Optiver menyebut kualitas setara dengan Opus 5 sementara jumlah giliran (turn) berkurang sekitar setengah dan biaya turun 40% hingga 50%; Deloitte menyebut model ini menangkap 72% cacat yang sudah diketahui pada level thinking terendah, dibanding 56% untuk Opus 5 pada level tertinggi. Semua angka ini berasal dari kutipan pelanggan yang disiarkan di halaman rilis vendor sendiri, tanpa verifikasi independen.

Apa Kata Anthropic soal Keamanan

Anthropic mengklaim Opus 5.5 lolos audit perilaku otomatis dengan skor keselarasan (alignment) terkuat sepanjang sejarah model Claude, dan upaya melewati batas sandbox turun 85% dibanding Opus 5. Sebagian besar tugas terkait keamanan siber masih dialihkan ke Opus 4.8, dan tingkat perlindungan di bidang biologi sama dengan Fable 5.1. Model ini mempertahankan perlindungan jejak penalaran terhadap distilasi, membawa watermark sesuai UU AI Uni Eropa, dan menawarkan opsi zero data retention untuk perusahaan. METR dan Frontier Design ikut serta dalam evaluasi sebelum rilis.

Angka pasti tingkat kegagalan, tingkat penolakan, dan hasil red team baru bisa diverifikasi setelah system card lengkap dipublikasikan; halaman rilis resmi sendiri tidak mencantumkan angka-angka tersebut.

Dibandingkan dengan Daftar Harga Lain di Hari yang Sama

Pada 22 September, OpenAI juga merilis model baru GPT-6 Sol dan Luna, dengan harga API turun sekitar setengah dari generasi sebelumnya: Sol dibanderol 2 dolar dan 10 dolar, Luna 0,10 dolar dan 0,50 dolar. Jika dibandingkan berdampingan, harga per token Opus 5.5 masih dua kali lipat dari Sol — Anthropic menjual skor dan langkah yang lebih sedikit pada kelas harga yang sama. Menurut catatan Optiver dan GitHub, berkurangnya jumlah giliran per tugas sebagian bisa mengimbangi selisih harga per token itu pada tagihan sebenarnya. Seberapa besar keseimbangannya tergantung bentuk tugasnya, tidak ada jawaban yang berlaku umum.

Sudah muncul satu contoh yang berlawanan dari kalangan developer. Blogger teknologi Simon Willison menguji Opus 5.5 untuk menghasilkan SVG kompleks pada level thinking tertinggi, dan model ini menghabiskan seluruh anggaran output 128.000 token tanpa menyelesaikan tugasnya. Level thinking tinggi yang dipadukan dengan output panjang mudah menghabiskan seluruh anggaran output, dan batas ini perlu diperhitungkan sebelum dipasang ke alur kerja otomatis.

Bagi tim yang sudah memakai Opus 5, biaya peralihan terutama ada di dua hal: ID model perlu diubah, dan perubahan kecepatan output serta jumlah giliran membuat pengaturan timeout dan retry lama mungkin tidak lagi sesuai. Penurunan harga paling terasa pada skenario dengan frekuensi panggilan tinggi, terutama penurunan 60% pada biaya baca cache — makin panjang system prompt yang selalu aktif dan makin padat permintaannya, makin besar penghematannya.

Sumber: halaman rilis resmi Anthropic, Artificial Analysis, CocoLoop, blog Simon Willison; harga per tingkatan, hasil benchmark, dan langkah keamanan diverifikasi dari halaman rilis resmi Anthropic.