Anthropic merilis Claude Opus 4.7 pada 16 April. Peningkatan kemampuan coding pada versi ini melampaui ekspektasi banyak orang — tugas perbaikan kode produksi mencapai tiga kali lipat dari generasi sebelumnya, dan SWE-bench Pro melonjak dari 53,4% menjadi 64,3%.
Tiga skor benchmark yang paling patut diperhatikan
Berikut data intinya:
| Benchmark | Opus 4.6 | Opus 4.7 | Perubahan |
|---|---|---|---|
| SWE-bench Pro | 53,4% | 64,3% | +10,9% |
| CursorBench | 58% | 70% | +12% |
| Rakuten-SWE-Bench (tugas produksi) | Garis dasar | 3x | Peningkatan signifikan |
SWE-bench Pro kini diakui sebagai benchmark coding yang cukup sulit. Angka 64,3% telah melampaui GPT-5.4 yang dirilis pada Maret dan Gemini 3.1 Pro dari Google pada Februari. Dalam pengujian internal Anthropic terhadap 93 tugas coding, Opus 4.7 meningkat 13% dibandingkan 4.6 dan berhasil memecahkan 4 soal tambahan yang sama sekali tidak bisa diselesaikan oleh 4.6.
Angka Rakuten adalah yang paling menarik — "tugas perbaikan kode produksi tiga kali lipat dari generasi sebelumnya" merujuk pada perbaikan bug di basis kode perusahaan nyata, bukan dataset sintetis. Angka yang dihasilkan dari kode produksi nyata lebih bernilai referensi dibandingkan soal sintetis laboratorium.
Anthropic juga menjalankan Finance Agent Evaluation dan benchmark pengetahuan kerja nilai ekonomi (GDPval-AA) sendiri, dan keduanya meraih skor terbaik saat ini.
Kemampuan visual meningkat lebih dari tiga kali lipat, namun jarang disebut
Di luar coding, Opus 4.7 membawa peningkatan signifikan dalam pemrosesan gambar:
- Mendukung sisi terpanjang hingga 2576 piksel (sekitar 3,75 megapiksel)
- Lebih dari tiga kali lipat batas resolusi gambar sebelumnya dari seri Claude
- Pengenalan diagram struktur molekul kimia dan skema teknik kompleks yang jauh lebih akurat
Ini akan berdampak besar bagi peneliti, mereka yang menganalisis dokumen teknis, atau membaca gambar teknik. Untuk coding, efeknya mungkin tidak terlalu langsung, tetapi mereka yang bekerja di bidang teknik multimodal harus mengujinya.
Satu perubahan lain yang mudah diabaikan: tokenizer telah diperbarui. Input teks yang sama kini menghasilkan 1,0 hingga 1,35 kali jumlah token. Kedengarannya seperti kabar buruk (lebih banyak token berarti lebih mahal), tetapi sebenarnya ini menunjukkan model memproses informasi dengan granularitas yang lebih halus, yang seharusnya menghasilkan pemahaman yang lebih solid terhadap dokumen panjang dan kode kompleks.
Mengapa Anthropic sengaja menonaktifkan kemampuan keamanan siber
Ini adalah keputusan paling kontraintuitif dalam rilis 4.7: Opus 4.7 secara aktif menambahkan pagar pengaman, secara otomatis mendeteksi dan memblokir permintaan keamanan siber berisiko tinggi.
Tunggu — Anthropic baru saja merilis Claude Mythos Preview minggu lalu, yang berfokus pada keamanan siber, dan meluncurkan Project Glasswing bersama Amazon, Apple, dan Microsoft. Bagaimana kedua hal ini bisa terjadi bersamaan?
Jawabannya adalah pelapisan produk:
- Mythos adalah model terkontrol yang dirancang khusus untuk profesional keamanan, hanya dapat digunakan setelah verifikasi identitas melalui Cyber Verification Program
- Opus 4.7 adalah flagship umum untuk publik; Anthropic tidak ingin ini menjadi alat serangan yang bisa dipanggil siapa saja
Logikanya masuk akal. Memusatkan kemampuan berisiko tinggi di saluran profesional yang dapat diverifikasi, bukan membukanya untuk semua orang melalui API — ini adalah pendekatan pelapisan keamanan yang pragmatis.
Sekilas fitur baru
Beberapa fitur tambahan diluncurkan bersamaan:
- Task budgets (beta publik): Memungkinkan Claude mengelola sendiri ritme konsumsi token selama tugas berjalan lama, menghindari kehabisan anggaran mendadak di tahap akhir
- Perintah /ultrareview: Sesi review kode khusus yang menandai bug dan masalah desain, lebih dalam dari review biasa
- Tingkat usaha xhigh: Sebelumnya hanya ada high, sekarang ditambahkan xhigh, memberikan penyesuaian yang lebih halus antara kedalaman penalaran dan kecepatan respons
- Perluasan Auto mode: Tersedia untuk pengguna Max Claude Code
Harga tidak berubah: Panggilan API $5 per juta token input, $25 per juta token output, sama persis dengan Opus 4.6. Dukungan platform: claude.ai, API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry semuanya sudah aktif, dengan model ID claude-opus-4-7.
Seberapa besar kesenjangan dengan pesaing
Menurut Anthropic, Opus 4.7 melampaui GPT-5.4 (dirilis Maret) dan Gemini 3.1 Pro (dirilis Februari) dalam hal coding agentic, pemanggilan alat skala besar, penggunaan komputer agentic, dan analisis keuangan.
Tentu saja, benchmark tetaplah benchmark. Kesenjangan pengalaman nyata akan membutuhkan lebih banyak bukti setelah komunitas mulai menggunakannya. Namun angka "3x" dari Rakuten-SWE-Bench saja sudah cukup meyakinkan untuk skenario perbaikan kode produksi.
Dari Opus 4.6 ke 4.7, ini bukanlah iterasi kecil seperti mengganti kulit — setidaknya dalam tugas coding, besarnya peningkatan kali ini layak ditanggapi dengan serius.
Sumber referensi: CocoLoop, Introducing Claude Opus 4.7 (Anthropic Blog); Anthropic's Claude Opus 4.7 makes a big leap in coding, while deliberately scaling back cyber capabilities (The Decoder); Anthropic releases Claude Opus 4.7, narrowly retaking lead for most powerful generally available LLM (VentureBeat)