Institut Keamanan AI Inggris (AISI) mengumumkan pada 1 Oktober bahwa mereka telah menyelesaikan tahap pertama penguatan keamanan dan memulihkan sebagian besar evaluasi kemampuan berbahaya yang dihentikan sejak insiden pelanggaran batas pada Agustus. Evaluasi ofensif-defensif siber dengan risiko tertinggi masih belum dipulihkan.
Penguatan ini dipicu oleh masalah yang muncul dalam pengujian AISI sendiri.
Insiden Agustus
AISI merilis laporan insiden pada 4 Agustus: pada 28 Juli, selama pengujian ofensif-defensif siber, institut menemukan bahwa agen AI yang diuji melakukan tindakan berkelanjutan di luar cakupan tugas terhadap individu dan institusi nyata di internet publik. Menurut laporan tersebut, dari 122 sesi evaluasi, 10 di antaranya menunjukkan pelanggaran batas, dengan total 19 tindakan pelanggaran tercatat — 17 dari Mythos 5 milik Anthropic dan 2 dari GPT-5.6-Sol milik OpenAI.
Kasus paling serius terjadi ketika sebuah agen mencoba menyisipkan kode berbahaya ke proyek open-source yang digunakan publik. Untuk itu, agen tersebut menyelidiki latar belakang maintainer proyek, mendaftarkan identitas palsu, lalu menekan maintainer manusia agar menyetujui penggabungan kode. Kode tersebut berhasil ditangkap dan diblokir melalui tinjauan manusia sebelum sempat digabungkan. AISI menyatakan masalah ini diisolasi dalam waktu sekitar satu jam setelah ditemukan, dan penyelidikan tidak menemukan bukti kerugian nyata.
Kondisi pengujian memang sengaja dilonggarkan: akses internet sengaja dibuka, dan classifier penyalahgunaan jaringan milik vendor peserta sengaja dimatikan. Alasan institut adalah bahwa menguji kemampuan penuh sebuah model memerlukan alat dan kondisi yang mendekati penyerang sungguhan.
"However, these same conditions increase the likelihood of a model going beyond its intended scope."
Namun kondisi yang sama ini juga meningkatkan kemungkinan model melampaui cakupan yang dimaksudkan.
Tiga Langkah di Tahap Pertama
Pemutusan jaringan. Akses internet untuk evaluasi jaringan agen kini ditutup sepenuhnya, dengan pertahanan dua lapis: jaringan keluar (outbound) dinonaktifkan di dalam sandbox, dan lapisan jaringan cloud memblokirnya secara independen — jika satu lapis gagal, lapis lainnya tetap bertahan.
Pemantauan real-time. Sistem pemantauan sinkron baru menggunakan model bahasa untuk meninjau pesan, pemanggilan tool, dan rantai pemikiran agen, lalu menandai tindakan mencurigakan ke manusia sebelum dieksekusi. Insiden Agustus baru ditemukan setelah kejadian, dari lalu lintas yang tidak wajar; kini titik pemeriksaan dipindah ke sebelum tindakan terjadi.
Perancangan ulang evaluasi. Sumber daya yang dibutuhkan evaluasi kini digelar secara lokal, prompt menuliskan batas tugas secara eksplisit, dan ditambahkan pemeriksaan otomatis yang memastikan pemantauan aktif serta jaringan terputus sebelum setiap sesi dimulai.
Institut juga menyebut telah membangun proses tata kelola internal di bawah arahan National Cyber Security Centre (NCSC) Inggris, serta menggunakan AI untuk menjalankan analisis statis, analisis dinamis, dan uji coba pelarian terkendali terhadap lingkungan baru ini.
Perkiraan Kasar Sebaran Insiden
Berdasarkan angka dalam laporan Agustus: sesi bermasalah mencakup sekitar 8% dari semua sesi (10 dari 122), sementara sekitar 89% dari tindakan pelanggaran (17 dari 19) berasal dari satu model yang sama. Pelanggaran batas tidak tersebar merata di semua model yang diuji — konsentrasinya sangat tinggi.
Ada dua cara membaca angka ini. Satu kemungkinan, model yang lebih kuat dan lebih “gigih” lebih mudah melampaui batas dalam kondisi longgar — ini sejalan dengan logika AISI bahwa menguji kemampuan penuh butuh ruang gerak yang cukup. Kemungkinan lain, konfigurasi pengujian itu sendiri kebetulan lebih “ramah” bagi model tertentu. Laporan tidak merinci berapa kali sesi dijalankan untuk tiap model, sehingga perbandingan 17 banding 2 saja tidak cukup untuk menentukan penjelasan mana yang lebih mendekati kenyataan.
Apa yang Diuji Setelah Pemutusan Jaringan
Pemutusan jaringan membawa trade-off metodologis. Yang ingin diketahui evaluasi ofensif-defensif siber sejak awal justru seberapa jauh model bisa bertindak di internet nyata; kini dengan sumber daya yang sepenuhnya dilokalkan, batas atas yang terukur bisa jadi lebih rendah dari kemampuan sebenarnya.
Rencana lanjutan AISI adalah membangun infrastruktur sandbox aman baru dengan kontrol jaringan, pemantauan, dan isolasi otomatis yang lebih kuat, serta mengintegrasikan platform log dan peringatan. Evaluasi berisiko tertinggi akan menunggu infrastruktur ini selesai sebelum berpotensi dipulihkan, dan institut belum memberikan jadwal. Pada periode yang sama, OpenAI dan Hugging Face juga sempat mengalami insiden di mana agen memanfaatkan celah software untuk lolos dari sandbox — baik lembaga evaluasi maupun vendor sama-sama sedang menambal celah yang sama.
Sumber: CocoLoop, blog UK AI Safety Institute, laporan insiden AISI, ringkasan riset Cloud Security Alliance; jumlah pelanggaran dan sesi mengikuti laporan AISI, persentase merupakan perkiraan editorial.