Anthropic merilis Claude Fable 5.1, dengan ID model claude-fable-5-1, yang tersedia serentak lewat Claude API, Bedrock, Google Cloud, dan Microsoft Foundry. Mythos 5.1, dengan spesifikasi dan harga yang persis sama, juga dirilis bersamaan tapi masih terbatas untuk klien undangan.
Fondasinya masih meneruskan generasi sebelumnya: harga seragam di seluruh jendela konteks 1 juta token, output maksimum 128.000 token, adaptive thinking aktif secara default, dan batas pengetahuan yang bisa diandalkan hingga Juni 2026.
Cuma Satu Sel di Daftar Harga yang Berubah
Harga input 10 dolar dan output 50 dolar per juta token, sama seperti generasi sebelumnya, dan harga cache write juga tidak berubah. Satu-satunya yang berubah adalah cache read: Fable 5.1 mengenakan tarif 0,025 kali harga input dasar, yaitu 0,25 dolar per juta token, sementara model Claude lain memakai tarif 0,1 kali.
Potongan harga ini hanya berlaku untuk satu pola pemakaian: prefix yang sama dibaca berulang kali. Hitungan kasarnya, system prompt 200.000 token plus prefix codebase, dibaca ulang 100 kali dalam satu sesi agent yang berjalan berjam-jam, jadi 20 juta token cache read — 20 dolar dengan harga lama, 5 dolar dengan harga baru. Harga write dan panjang minimum yang bisa di-cache, 512 token, sama sekali tidak berubah; seluruh penghematan datang dari tindakan "membaca ulang" itu sendiri.
Sesi agent yang berjalan lama justru situasi yang paling padat dengan pembacaan ulang seperti ini. Dengan mengarahkan potongan harga ke satu sel ini, tujuannya jadi jelas.
Tiga Perubahan yang Langsung Memicu Error
Bermigrasi dari generasi sebelumnya hanya dengan mengganti ID model tanpa menyentuh kode di sekitarnya akan bermasalah di setidaknya tiga tempat.
Pemanggilan tool secara paksa dihapus. Mengatur tool_choice ke any atau ke tool tertentu sekarang langsung mengembalikan error 400. Penjelasan resminya: model ini menjalankan thinking secara default, dan memaksa pemanggilan tool akan melewati langkah thinking itu — model malah akan menuliskan proses penalarannya ke dalam parameter tool, yang justru menurunkan kualitas parameter tersebut. Untuk mendapatkan JSON yang valid secara struktur, gunakan strict mode atau structured output sebagai gantinya.
Thinking block sekarang mengenali model asalnya. Setiap thinking block mencatat model mana yang menghasilkannya, dan catatan ini hanya bisa diteruskan satu arah: Fable 5.1 bisa membaca thinking block dari model sebelumnya, tapi tidak sebaliknya. Naik versi di tengah sesi, rantai penalaran tetap utuh; turun versi, penalaran dari giliran-giliran itu hilang. Saat routing atau fallback mengganti model di tengah percakapan, API diam-diam membuang block yang tidak bisa dibaca — tidak dikenakan biaya, dan secara default tidak diberitahukan.
Mengubah riwayat akan membatalkan semua thinking block sesudahnya. Menyentuh apa pun sebelum thinking block — system prompt, array tools, pesan sebelumnya — membuat permintaan berikutnya kena error 400. Aturan ini berlaku wajib untuk akun baru yang dibuat pada atau setelah 31 Agustus. Kesalahan paling umum: menyisipkan pengingat sementara per giliran ke riwayat lalu menghapusnya di giliran berikutnya, atau membangun ulang system prompt di antara permintaan. Pengguna klien resmi tidak perlu khawatir; yang perlu memeriksa ulang adalah integrasi yang menyusun sendiri array pesannya.
Uang yang Dihemat di Input Bisa Kembali Keluar Lewat Output
Yang lebih perlu diperhatikan daripada perubahan yang merusak kode adalah perubahan perilaku default yang terjadi tanpa menyentuh kode sama sekali. Anthropic mencantumkan tujuh perubahan, dan tiga di antaranya langsung berdampak pada tagihan.
Pertama, pemanggilan tool paralel jadi kurang stabil: jika generasi sebelumnya bisa mengirim beberapa panggilan sekaligus dalam satu giliran, 5.1 mungkin hanya mengirim satu per giliran — dokumentasi mengatakan kualitas jawaban tidak menurun, tapi giliran ekstra ini memakan token dan waktu bolak-balik. Kedua, model ini lebih condong menulis ulang seluruh file, hasilnya biasanya sama tapi memakan lebih banyak token output. Ketiga, pada tingkat effort rendah, panggilan pencarian berkurang, model lebih mengandalkan ingatannya sendiri untuk menjawab.
Jika dilihat berdampingan dengan daftar harga, yang dilakukan 5.1 bukan sekadar penurunan harga, melainkan lebih ke arah memindahkan biaya dari sisi input ke sisi giliran. Cache read jadi tiga perempat lebih murah, tapi pemanggilan tool yang lebih terpecah-pecah dan penulisan ulang seluruh file memakan harga output 50 dolar per juta token — lima kali lipat harga input. Apakah tagihan naik atau turun tergantung mana yang lebih dominan dalam loop agent spesifik Anda: membaca ulang konteks berkali-kali, atau berulang kali mengeluarkan konten baru. Menjalankan ulang evaluasi dan mencocokkan tagihan setelah migrasi adalah langkah yang tidak bisa dilewati.
Dari empat fitur beta baru, dua di antaranya — mengubah tingkat effort di tengah sesi, dan system message yang hanya berlaku untuk satu giliran — memang disiapkan untuk menghindari jebakan-jebakan di atas. Ada juga fitur asal-usul konten yang aktif secara default: teks yang dihasilkan membawa watermark statistik di semua platform, dan gambar serta video yang diambil membawa kredensial C2PA.
Kesenjangan Benchmark Terbesar Ada di Agent Riset
Dalam perbandingan head-to-head resmi Anthropic, peningkatannya sangat tidak merata:
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 (riset ilmiah berbasis agent) | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 (coding berbasis agent) | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 (pekerjaan pengetahuan, skor) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (penggunaan komputer, parsial / ketat) | 77.9% / 41.7% | 72.9% / 36.1% | 75.4% / 39.6% | — |
| Humanity's Last Exam (tanpa tool / dengan tool) | 60.9% / 65.0% | 57.8% / 63.8% | 56.6% / 63.6% | — |
| AutomationBench (alur kerja bisnis) | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 (coding berbasis agent) | 73.4% | 70.5% | 70.0% | 67.2% |
Kesenjangan terbesar ada di agent riset: 52,6% berbanding 24,7% pada generasi sebelumnya, naik lebih dari dua kali lipat. Ini juga satu-satunya area di mana generasi sebelumnya jelas tertinggal dari Opus 5 (24,7% vs 29,0%) — 5.1 menutup kelemahan ini, bukan sekadar peningkatan merata di semua lini. Baris alur kerja bisnis menunjukkan pola serupa, 31,4% berbanding 17,1%. Mythos 5.1 secara terpisah melaporkan 60,9% di Terminal-Bench 4.0.
Sebaliknya, untuk pekerjaan rutin: CursorBench naik dari 70,5% ke 73,4%, hanya bertambah 2,9 poin persentase; Humanity's Last Exam dengan tool naik 1,2 poin; pekerjaan pengetahuan ada di 1853 berbanding 1824 milik Opus 5, selisih 29 poin. Angka-angka ini sejalan dengan bagian harga di atas — biaya dua kali lipat itu membeli performa untuk tugas jangka panjang dan berdifikultas tinggi, sementara selisih pada coding sehari-hari dan tanya-jawab rutin kecil, bahkan mungkin tidak sebanding dengan harganya. Saran resmi Anthropic juga mengarah ke kesimpulan yang sama: sebagian besar beban kerja disarankan tetap mulai dari Opus 5, sementara Fable 5.1 disimpan untuk penalaran sulit dan tugas agent jangka panjang. Selisih harga mendukung saran ini — Opus 5 dibanderol 5 dolar dan 25 dolar, dengan latensi yang juga lebih cepat.
Sumber: dokumentasi model Anthropic, CocoLoop, halaman catatan rilis; harga, spesifikasi konteks, dan perubahan yang merusak kode diperiksa berdasarkan pengungkapan dokumentasi resmi, sementara estimasi biaya sesi panjang adalah perhitungan kasar berdasarkan tarif publik.