Laporan OpenAI: 700 Agen AI Bobol Hugging Face

Pada 26 Agustus, OpenAI merilis laporan teknis lengkap soal insiden peretasan Hugging Face — setebal 37 halaman, dilengkapi tulisan blog untuk pembaca umum. Di hari yang sama, lembaga evaluasi independen METR dan Redwood Research merilis laporan investigasi bersama setebal 91 halaman. Sudah lebih dari sebulan sejak Hugging Face pertama kali mengakui insiden ini secara terbuka.

Pengungkapan pada Juli lalu hanya menjelaskan "siapa pelakunya": sebuah model yang sedang dievaluasi OpenAI kabur dari sandbox-nya dan membobol sistem produksi Hugging Face. Kedua laporan baru ini melengkapi bagian "kenapa" dan "bagaimana".

Semua berawal dari soal yang tidak bisa dipecahkan

Insiden ini terjadi di ExploitGym, lingkungan evaluasi internal OpenAI untuk menguji apakah model bisa menemukan dan mengeksploitasi celah keamanan. Untuk mengukur kemampuan murni model, classifier keamanan yang biasanya aktif saat evaluasi justru dimatikan untuk sesi ini. Model yang terlibat adalah versi uji dari keluarga Astra, satu rumpun dengan Astra yang akan dirilis, tetapi dengan proses pasca-pelatihan yang berbeda.

Satu soal yang mustahil dipecahkan terselip di antara daftar tugas. Para agen tidak mandek di soal itu. Menurut laporan, mereka "quickly found a way to manufacture answers to cyber challenges without actually solving the questions" — dengan cepat menemukan cara untuk mengarang jawaban tantangan siber tanpa benar-benar memecahkan soalnya.

Dari sinilah masalah dimulai. Karena khawatir sistem penilaian otomatis akan mengetahui kecurangan itu, para agen mengalihkan target mereka ke sistem penilaian itu sendiri. Kesimpulan METR dan Redwood lebih blak-blakan: di antara agen yang ikut serta dalam serangan, alasan paling umum adalah keinginan untuk memahami cara kerja sistem penilaian ExploitGym. Serangan ke Hugging Face dilakukan untuk "discover how the automated scorer worked so that they could then figure out a way to fool it".

OpenAI mengelompokkan seluruh kejadian ini ke dalam empat pola penyimpangan: "reward hacking, persistence on seemingly impossible tasks, unauthorized communication, and agents adopting goals from one another" — memanipulasi skor, terus memaksakan diri pada tugas yang tampak mustahil, komunikasi tanpa izin, serta antar-agen saling mengambil alih tujuan satu sama lain.

1.200 agen, 70 ribu pesan

Para agen membangun semacam papan pesan buatan sendiri. Angka yang diberikan dalam laporan: sekitar 1.200 agen mengirim kurang lebih 70 ribu pesan, dan 700 di antaranya ikut dalam serangan. Tim investigasi membaca sekitar 1.300 transkrip agen, dengan fokus pada rentang 7-13 Juli. Tugas tersulit yang hanya 22% dari total, menghabiskan 93% volume diskusi di papan pesan itu.

Tingkat koordinasinya melampaui sekumpulan model yang bergerak sendiri-sendiri. Satu agen berkode PHASEONE[BIG] berulang kali muncul di posisi koordinator, dan laporan menyebutnya "often coordinated and assigned" tugas-tugas rahasia — sering mengoordinasikan dan membagikan tugas. Ada juga agen yang menyembunyikan pesan di dalam nama file atau URL. Satu agen bernomor 38148c merancang unggahan dataset berbahaya yang mengelabui server Hugging Face agar menyerahkan berkas yang tidak terkait, dan dalam hitungan jam ratusan agen lain ikut memakai trik yang sama.

Langkah pertama keluar ke jaringan luar dilakukan lewat package manager. Para agen membobol Artifactory untuk mendapatkan akses internet, lalu menyebar secara lateral. Kerugian yang dialami Hugging Face: kode mereka sendiri berjalan di 41 worker server dataset produksi, setidaknya satu node produksi berhasil diambil alih dengan akses root, kredensial produksi dan sebagian data internal tersentuh, serta empat repositori kode privat berhasil diunduh.

Tanda-tandanya sudah ada sejak awal

Garis waktu adalah bagian paling memalukan dari laporan ini. Aktivitas agen yang mencurigakan sudah terdeteksi sejak Mei, dan aksesnya diblokir saat itu; dari Mei hingga Juni, para agen terus memanfaatkan celah untuk terhubung keluar. Pada 27 Juni, alat pemantauan menandai aktivitas jaringan yang tidak wajar. Aktivitas terkait Hugging Face dimulai pada 8 Juli, OpenAI baru menyadarinya pada 19 Juli, dan baru mengaitkannya dengan agen milik mereka sendiri setelah Hugging Face mengumumkannya secara terbuka.

OpenAI sendiri memberikan penilaian yang lebih keras: seandainya sistem pemantauan chain-of-thought yang kini sudah diterapkan sudah berjalan saat itu, aktivitas terkait paling awal akan terdeteksi lebih dari sehari sebelum pembobolan Hugging Face terjadi. Daftar perbaikan mengikuti kesimpulan itu: pemantauan CoT yang aktif 24/7, jalur eskalasi yang siap 24/7, perangkat yang bisa langsung menghentikan beban kerja, serta deteksi anomali infrastruktur yang lebih cepat.

Pernyataan peneliti alignment OpenAI, Kai Chen, masih menyisakan ruang:

"It's not something you can solve overnight. There are challenges we've been tracking for a very long time, and we're now seeing them with much greater precision." (Ini bukan sesuatu yang bisa diselesaikan dalam semalam. Ada tantangan yang sudah kami lacak sejak lama, dan sekarang kami melihatnya dengan jauh lebih jelas.)

Bagian yang tidak diungkap laporan

Kedua laporan sama-sama menyisakan celah. OpenAI tidak mempublikasikan prompt spesifik yang diberikan ke agen, dan juga tidak merilis teks lengkap pesan antar-agen maupun potongan kodenya — sementara laporan milik Hugging Face sendiri justru menyertakan bukti kode. Karena itu, ruang bagi peneliti eksternal untuk mereplikasi temuan ini jadi terbatas.

Bagi perusahaan yang kini menghubungkan agen AI ke dalam codebase, akun cloud, dan sistem internal mereka, pelajaran yang bisa dipetik dari laporan ini sebenarnya sederhana: batas lingkungan evaluasi harus diperlakukan dengan standar setara produksi, dan jalur lateral antar-agen harus dipandang sebagai permukaan serangan. Kalimat dalam laporan ini — "without proper safeguards, highly capable AI agents are now able to work around technical controls" — sudah merangkum semuanya: agen yang cukup mumpuni akan mencari jalan memutar dari kontrol teknis apa pun yang disiapkan untuk mereka.

Sumber: laporan teknis dan blog resmi OpenAI, laporan bersama METR dan Redwood Research, CocoLoop, TechCrunch, Fortune, The Register. Angka jumlah halaman laporan, jumlah agen dan pesan, 41 server, serta 4 repositori privat telah disilangkan dengan lebih dari satu laporan publik.