Claude Mythos Puncaki SWE-bench Pro dengan 77,8%

Pada 7 April, Anthropic secara resmi mengumumkan sesuatu yang agak aneh: mereka merilis model baru bernama Claude Mythos, sambil menyatakan bahwa model ini tidak akan dibuka untuk publik.

Bukan "akan dibuka nanti," melainkan "saat ini hanya untuk 40 organisasi; yang lain menunggu."

Proyek ini disebut Project Glasswing.

Seberapa kuat Mythos?

Pertama, lihat datanya:

Tolok UkurClaude Opus 4.6Claude MythosPerubahan
SWE-bench Verified80,8%93,9%+13,1%
SWE-bench ProTidak diungkap77,8%Peringkat teratas saat ini

Peringkat kedua saat ini di SWE-bench Pro adalah Zhipu GLM-5.1 (58,4%), dan ketiga adalah GPT-5.4 (57,7%). Mythos dengan 77,8% unggul hampir 20 poin persentase dari peringkat kedua — sebuah kesenjangan yang tidak kecil.

Tapi Anthropic tidak hanya mengejar papan peringkat. Mereka meminta Mythos memindai basis kode nyata dan menemukan:

  • Ribuan kerentanan zero-day di sistem operasi dan peramban utama
  • Sebuah bug di FFmpeg yang telah bersembunyi selama 16 tahun — kerentanan yang telah terlewatkan oleh lebih dari 5 juta kali pemindaian alat keamanan tradisional

Kepala Petugas Keamanan Cisco, Anthony Grieco, mengatakan: "Ini mewakili pergeseran paradigma yang mendalam dan sinyal yang jelas bahwa pendekatan lama untuk memperkuat sistem sudah tidak memadai."

Apa logika di balik Project Glasswing?

Yang diberikan Anthropic kepada 40 organisasi ini adalah akses pratinjau ke Mythos, untuk satu tujuan saja: pekerjaan keamanan siber defensif.

Mitra yang saat ini memiliki akses meliputi: Amazon, Apple, Broadcom, Cisco, CrowdStrike, Linux Foundation, Microsoft, dan Palo Alto Networks.

Anthropic juga menyediakan:

  • Kredit API senilai $100 juta yang mencakup pengujian dan penelitian keamanan bagi peserta
  • Sumbangan langsung sebesar $4 juta untuk organisasi keamanan sumber terbuka

Mengapa mereka mengambil bentuk "edisi terbatas" ini?

Penjelasan resminya terus terang: Mythos "saat ini jauh melampaui model AI lainnya" dalam kemampuan keamanan siber, tetapi justru karena itu, model ini juga dapat digunakan untuk mempercepat serangan siber skala besar. Anthropic percaya risiko merilis model ini secara publik tanpa perlindungan yang memadai terlalu tinggi.

Jadi mereka memilih jalan tengah: berikan kepada pihak pertahanan terlebih dahulu, biarkan tim keamanan menambal kerentanan lebih awal, lalu pertimbangkan rilis yang lebih luas.

Apakah strategi ini tepat?

Perlu dipikirkan.

Logika rilis model AI tradisional adalah: rilis, uji, temukan masalah, perbaiki, ulangi. Proses ini bersifat publik, dan risikonya menyebar — penyerang dan pembela mendapatkan alat baru secara bersamaan.

Pendekatan Glasswing membalikkan itu: beri pembela jendela waktu terlebih dahulu, biarkan mereka menggunakan Mythos untuk secara proaktif menemukan dan memperbaiki kerentanan, lalu pertimbangkan akses yang lebih luas.

Dari sudut pandang teori permainan, desain ini masuk akal — jika pembela bergerak lebih dulu, biaya bagi penyerang untuk memanfaatkan model yang sama menjadi jauh lebih tinggi.

Tapi efektivitas sebenarnya tergantung pada dua hal: apakah 40 organisasi ini benar-benar dapat memperbaiki kerentanan kritis dalam jendela waktu ini, dan apakah kemampuan model itu sendiri berisiko bocor (keberadaan Mythos sudah terungkap oleh media setelah kebocoran data).

Model tingkat apa Mythos?

Anthropic secara eksplisit menyatakan ini adalah "model terkuat yang pernah ada," bukan perpanjangan iteratif dari seri Opus 4.x, melainkan generasi baru.

Beberapa minggu lalu, media mengungkap keberadaan Mythos setelah insiden kebocoran data. Fortune melaporkan bahwa Anthropic secara internal menggambarkannya sebagai "lompatan bertahap dalam kemampuan." Kini nama dan kemampuannya telah dikonfirmasi secara resmi, tetapi bukan melalui rilis publik — melainkan melalui program kemitraan yang ditargetkan.

Apa yang ditunggu Anthropic belum dijelaskan. Namun berdasarkan angka SWE-bench Pro 77,8%, kemampuan pengkodean model ini sudah berada di level yang berbeda.

Sumber: Anthropic debuts preview of powerful new AI model Mythos in new cybersecurity initiative (TechCrunch); Anthropic debuts Project Glasswing, CocoLoop, leveraging its powerful Mythos model to reinforce software security (SiliconAngle); Anthropic is giving some firms early access to Claude Mythos to bolster cybersecurity defenses (Fortune); Exclusive: Anthropic Mythos AI model representing step change in power revealed in data leak (Fortune)