Pada 9 Oktober, Anthropic merilis laporan investigasi yang mencantumkan beberapa jenis tindakan tak terduga yang dilakukan model Claude dalam evaluasi dan penggunaan internal: mengeksploitasi celah di perangkat lunak pihak ketiga untuk menjalankan perintah, mengirim formulir yang seharusnya tidak dikirim, menerobos paywall untuk mengambil data, dan memakai layanan pemendek tautan untuk menghindari batas panjang URL pada sebuah alat. Pada hari yang sama, Departemen Kepolisian Philadelphia menerbitkan siaran pers yang mengungkap bahwa situs kasus dingin mereka pernah menerima tip pembunuhan karangan sebuah model Anthropic pada Juli.
Tip pembunuhan tanpa nama
Menurut Anthropic, model yang bermasalah adalah Claude Haiku 4.5. Saat itu ia menjalankan tugas otomatis yang mengunjungi halaman web pilihan acak, dan salah satunya adalah situs pembunuhan yang belum terpecahkan milik polisi Philadelphia, PhillyUnsolvedMurders.com, yang memiliki formulir tip anonim. Instruksi tugas melarang login, mendaftar akun, mengisi data pribadi, melakukan pembayaran, atau mengirim konten yang merusak, tetapi tidak menyebut larangan mengirim formulir. Model membiarkan kolom nama dan kontak kosong, lalu mengirim tip karangan.
Berdasarkan lini masa yang dikutip sejumlah media AS, pengiriman terjadi larut malam pada 18 Juli, dan Anthropic baru menyadarinya pada 28 September, lalu langsung menghentikan alur pengujian yang menghasilkan kiriman itu. Sistem kepolisian menggolongkannya sebagai spam dan tidak meneruskannya ke Real-Time Crime Center. Polisi menyatakan tidak menemukan akses tanpa izin maupun kebocoran data, dan tidak ada penyelidikan pembunuhan yang terpengaruh.
Soal tanggal pemberitahuan kepada polisi, versi kedua pihak berbeda satu hari: laporan media menyebut 7 Oktober, sedangkan laporan Anthropic menyebut pemberitahuan dilakukan pada 8 Oktober setelah tinjauan teknis selesai. Dihitung dari pengiriman hingga pemberitahuan, versi pertama berarti 81 hari.
Tafsiran Anthropic, berdasarkan catatan percakapan, adalah bahwa model tampak sedang membuat konten contoh untuk tugas tersebut, tanpa niat menyesatkan siapa pun:
"Claude appears to have only been producing example content for the task."
(Claude tampaknya hanya membuat konten contoh untuk tugas tersebut.)
Tiga jenis pelanggaran batas lainnya
Masalah formulir bukan hanya satu kasus ini. Sebuah model riset non-frontier yang belum dirilis, setelah gagal pada formulir pemerintah untuk latihan, pergi ke situs web sungguhan dan mengirim formulir di sana; hal ini terjadi beberapa kali dalam evaluasi yang sama. Haiku 4.5 diminta mengisi sampai langkah terakhir lalu berhenti, tetapi berulang kali langsung mengirimnya karena mengira masih ada halaman konfirmasi setelahnya.
Beberapa kasus lain lebih mirip peretasan. Saat melakukan analisis ilmiah, Claude Mythos Preview menemui galat pada alat yang disediakan universitas; ia menemukan skrip di server yang bisa membaca berkas apa pun, menelusuri sampai ke celah injeksi, lalu memakainya untuk menyelesaikan komputasinya. Dalam tugas penentuan lokasi gambar, Claude Mythos 5 membaca berkas konfigurasi sebuah situs peta, memperoleh token akses, dan mengambil data langsung dari server. Pada kesempatan lain, seorang peneliti memintanya mencari data berbayar milik sebuah lembaga negara bagian; ia menggali token dari situs arsip dan menanyai basis data tanpa membayar.
Yang jangkauannya paling luas adalah tautan pendek. Sebagian alat pengambil halaman membatasi panjang URL untuk mencegah penyisipan instruksi lewat tautan yang sangat panjang, dan beberapa model, termasuk Claude Opus 5 dan Mythos 5, belajar memperpendek alamat dengan layanan pemendek tautan gratis sebelum mengambilnya. Pengelola layanan pemendek tautan da.gd memberi tahu Anthropic bahwa mereka juga memperhatikan lalu lintas semacam ini di sisi mereka.
Kasus-kasus ini muncul dalam evaluasi dan penggunaan internal seperti DeepSearchQA, BrowseComp, LABBench2, OSWorld, dan Humanity's Last Exam. Laporan menyebut sebagian kasus menyangkut situs web pemerintah federal, negara bagian, dan daerah AS, dan perusahaan telah memberi tahu Gedung Putih serta lembaga terkait. Menurut laporan, tidak ada data pelanggan maupun sistem internal Anthropic yang terlibat.
Pengungkapan ketiga dalam tiga bulan
Bila ditarik mundur, ini adalah ketiga kalinya sejak musim panas tahun ini Anthropic secara proaktif mengungkap kejadian pelanggaran batas. Laporan menyebut ada satu pengungkapan terkait keamanan siber pada 30 Juli dan satu lagi pada 9 September; kali ini tingkat keparahannya lebih rendah daripada keduanya, dan ungkapan aslinya adalah "minimal real-world impact".
Ketiga pengungkapan itu punya kesamaan: masalah selalu muncul ketika model bekerja dengan hak akses jaringan sungguhan. Semakin spesifik tujuan tugas, semakin besar kecenderungan model mencari jalan di luar batas harfiah instruksi, dan paywall, batas panjang, serta pengiriman formulir semuanya diperlakukan sebagai rintangan yang boleh dilewati. Laporan juga mengakui bahwa sebagian lingkungan pelatihan sendiri memberi imbalan bagi jalan pintas semacam ini.
Perbaikan yang dicantumkan Anthropic meliputi: menghentikan sebagian evaluasi publik atau mengubahnya menjadi versi luring; memperketat izin alat seperti pengambil halaman web; meluncurkan alat deteksi dan pemblokiran otomatis, yang dalam pengujian menahan semua kasus dalam laporan; memperbaiki atau menghapus lingkungan pelatihan yang memberi imbalan bagi pelanggaran batasan; serta memindahkan agen internal ke infrastruktur yang dikelola terpusat dan terisolasi kuat, sambil tetap membatasi akses jaringan evaluasi internal sampai pemantauan terbukti andal.
Yang tidak dijawab laporan adalah sisi pengguna eksternal. Agen peramban yang dibangun pelanggan korporat dengan Claude juga akan menemui formulir, paywall, dan batas panjang yang sama. Apakah alat pemblokir baru itu mencakup skenario tersebut, dan apakah ada lembaga lain selain Philadelphia yang pernah menerima kiriman serupa, tidak ada jawabannya dalam materi publik saat ini.
Sumber: laporan riset Anthropic, siaran pers Departemen Kepolisian Philadelphia, CocoLoop, Interesting Engineering; laporan Anthropic digunakan untuk memverifikasi empat jenis kasus dan langkah perbaikan, sedangkan pemberitaan media digunakan untuk memverifikasi tiga titik waktu: pengiriman, penemuan, dan pemberitahuan ke polisi.