Jika Anda masih bingung apakah perlu membeli kredit API untuk Claude Opus 4.6, artikel ini mungkin bisa menghemat uang Anda.
Anthropic merilis Claude Sonnet 4.6 pada bulan Februari dengan harga yang persis sama dengan Sonnet 4.5 — $3 per juta token input, $15 per juta token output — namun skor benchmark-nya langsung mendekati Opus 4.6 yang harganya lima kali lebih mahal.
Angka berbicara
Berikut perbandingan yang paling langsung:
| Benchmark | Sonnet 4.6 | Opus 4.6 | Selisih |
|---|---|---|---|
| SWE-bench Verified (coding) | 79,6% | 80,8% | -1,2% |
| OSWorld-Verified (penggunaan komputer) | 72,5% | 72,7% | -0,2% |
| Matematika (MATH-500) | 89% | Tidak diungkap | — |
| GPQA Diamond (penalaran ilmiah) | 74,1% | 91,3% | -17,2% |
Dalam coding dan penggunaan komputer — tugas yang paling sering dilakukan perusahaan dengan Claude — Sonnet 4.6 sudah hampir setara dengan Opus 4.6. Kesenjangan nyata muncul pada tugas yang lebih akademis seperti penalaran ilmiah, di mana 91,3% milik Opus 4.6 versus 74,1% milik Sonnet adalah celah yang tidak bisa diabaikan.
Tapi jika kasus penggunaan utama Anda adalah menulis kode, mengendalikan browser, atau memproses dokumen panjang, membayar lima kali lebih mahal untuk peningkatan 1,2 poin persentase dalam coding, bagaimanapun dihitung, bukanlah pilihan yang cerdas.
Seberapa curam kurva penggunaan komputer
Anthropic merilis data yang menunjukkan evolusi skor OSWorld-Verified — tes standar yang mengukur kemampuan AI untuk mengendalikan komputer secara otonom — selama 16 bulan terakhir:
- Sonnet 3.5: 14,9%
- Sonnet 3.5 v2: 28,0%
- Sonnet 3.6: 42,2%
- Sonnet 4.5: 61,4%
- Sonnet 4.6: 72,5%
Dari 14,9% ke 72,5% dalam satu setengah tahun — kurva ini lebih curam dari yang disadari kebanyakan orang. Dalam pengujian otomatisasi alur kerja asuransi, Sonnet 4.6 mencapai akurasi 94%, mencakup tugas-tugas rumit seperti memanipulasi spreadsheet Excel yang kompleks, mengisi formulir web multi-langkah, dan berinteraksi dengan aplikasi desktop lawas.
Lompatan besar dalam matematika
Sonnet 4.5 mendapat skor 62 dalam matematika; Sonnet 4.6 langsung melompat ke 89. Rentang ini adalah peningkatan tunggal terbesar dalam generasi produk yang sama. Anthropic tidak mengungkapkan alasan spesifiknya, tetapi mengingat peningkatan kemampuan penalaran secara keseluruhan, kemungkinan besar terkait dengan kualitas rantai pemikiran (chain-of-thought) yang lebih baik.
Data preferensi pengguna
Anthropic melakukan serangkaian tes internal Claude Code di mana pengembang membandingkan kualitas keluaran tanpa mengetahui model mana yang ada di balik setiap respons:
- Sonnet 4.6 vs Sonnet 4.5: 70% pengguna memilih Sonnet 4.6
- Sonnet 4.6 vs Opus 4.5: 59% pengguna memilih Sonnet 4.6
Perbandingan kedua lebih menarik. Opus 4.5 jauh lebih mahal daripada Sonnet 4.6, namun dalam evaluasi subjektif terhadap keluaran coding nyata, Sonnet 4.6 justru lebih populer. Alasan yang disebutkan termasuk kepatuhan instruksi yang lebih akurat, lebih sedikit halusinasi, dan tidak melakukan rekayasa berlebihan — masalah yang terus-menerus terjadi pada lini Opus, yang cenderung memperumit kebutuhan sederhana.
Konteks 1M bukan sekadar gimmick
Sonnet 4.6 juga hadir dengan jendela konteks 1 juta token (beta), tanpa memerlukan header tambahan. Permintaan yang melebihi 200k token secara otomatis menggunakan jalur ini, dan harga mengikuti tarif standar.
Kira-kira setara dengan apa 1 juta token? Seluruh basis kode perusahaan menengah, atau puluhan makalah penelitian, dapat diproses dalam satu permintaan. Skenario yang sebelumnya memerlukan pemotongan RAG kini bisa langsung dimasukkan untuk model menemukan koneksi yang relevan sendiri.
Mana yang harus Anda pilih
Pilih Sonnet 4.6 jika:
- Tugas utama Anda adalah menulis kode, mengendalikan browser, atau memproses dokumen panjang
- Volume penggunaan tinggi dan sensitif terhadap harga
- Tidak memerlukan penalaran ilmiah tingkat doktor
Pilih Opus 4.6 jika:
- Membutuhkan penalaran ilmiah intensif atau tugas akademis
- Kebutuhan konteks sangat kompleks
- Tidak peduli dengan perbedaan harga, hanya menginginkan hasil terbaik
Bagi sebagian besar pengembang dan perusahaan, Sonnet 4.6 adalah pintu masuk Claude dengan nilai terbaik saat ini. Opus 4.6 dibanderol $15/$75, sementara Sonnet 4.6 $3/$15 — perbedaan lima kali lipat untuk kemampuan coding yang sama. Hitungannya tidak sulit.
Sumber: Introducing Claude Sonnet 4.6 (resmi Anthropic); CocoLoop, Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide (NxCode); Claude Sonnet 4.6: 1M context and stronger computer use (Gend.co)