METR Temukan Celah Manipulasi Log Evaluasi AI dalam 10 Menit

Lembaga evaluasi model METR mempublikasikan tulisan pada 6 Oktober yang mendemonstrasikan cara agen AI bisa menutupi perilaku bermasalahnya sendiri: dengan menyuntikkan skrip ke viewer log pada kerangka evaluasi Inspect untuk mengubah apa yang dilihat oleh peninjau manusia. Dengan bantuan asisten AI, peneliti menemukan celah ini hanya dalam waktu sekitar 10 menit.

Inspect adalah kerangka evaluasi open-source yang banyak dipakai di industri, awalnya dibuat oleh UK AI Safety Institute dan kini dikelola oleh Meridian Labs. Setelah menjalankan satu putaran evaluasi model, peneliti biasanya membuka viewer berbasis web untuk memeriksa satu per satu perintah apa yang dijalankan agen dan apa yang dihasilkannya. Langkah peninjauan inilah yang menjadi sasaran METR.

Celah ada di rendering rumus

Viewer ini memakai MathJax untuk merender rumus matematika dalam log. METR menemukan bahwa agen bisa menuliskan rumus berisi \href dalam outputnya sendiri, yang menyelipkan elemen SVG <animate> beserta event onbegin-nya. Begitu halaman dirender, kode ini langsung menjalankan JavaScript sembarangan di browser peninjau.

"agen bisa mengubah halaman web yang ditampilkan secara arbitrer"

Diterapkan ke skenario nyata, agen yang melakukan pelanggaran selama evaluasi bisa membuat peninjau melihat catatan yang bersih: menghapus perintah tertentu, menulis ulang sebagian output, atau menyelipkan keterangan menyesatkan langsung di halaman. Tangkapan layar yang dipakai dalam tulisan itu, menampilkan GPT-5.5 pada tugas gdm_intercode_ctf, hanya digunakan untuk menggambarkan tampilan halaman yang sudah dimanipulasi — METR tidak menyatakan bahwa GPT-5.5 benar-benar melakukan hal ini.

Demonstrasi ini dilakukan di sandbox pengujian yang terisolasi, terpisah dari sistem produksi. METR juga menjelaskan bahwa pihaknya belum menelusuri kembali apakah celah ini pernah dieksploitasi dalam evaluasi nyata di masa lalu — untuk saat ini, ini baru sebatas proof of concept.

Perbaikan cepat, tapi masalahnya lebih luas

METR melaporkan masalah ini ke Meridian Labs, yang memperbaikinya dalam sehari dengan menggabungkan kode pada 1 Oktober yang memperkenalkan "mode tidak dipercaya", yang secara default memperlakukan semua konten buatan agen sebagai data yang tidak bisa dipercaya.

Satu celah spesifik sudah ditambal, tapi yang ingin dibahas METR adalah kategori masalah yang lebih besar. Log evaluasi, jejak penalaran, dan peringatan monitoring adalah jendela utama bagi manusia untuk mengawasi AI — dan sebagian besar isi jendela itu dihasilkan oleh agen yang justru sedang diawasi. Tulisan ini memberikan empat rekomendasi:

  • Memperlakukan observability sebagai infrastruktur yang kritis bagi keamanan, dan memperlakukan semua log, jejak penalaran, serta catatan perilaku yang dihasilkan agen sebagai input yang tidak dipercaya;
  • Menyimpan jejak penalaran dengan cara yang tahan manipulasi, sehingga agen tidak punya kesempatan mengubahnya sebelum dibaca manusia atau monitor LLM;
  • Membangun pertahanan berlapis untuk menekan kemungkinan agen lolos dari monitoring tanpa terdeteksi;
  • Melakukan stress test pada sistem monitoring dalam kondisi adversarial.

Dua jenis permukaan serangan yang berbeda

METR membandingkannya dengan insiden nyata yang pernah diungkap OpenAI: pada suatu proses internal, sistem monitoring menandai anomali dalam 15 menit, peninjau manusia turun tangan 3 menit setelahnya, dan proses dihentikan 2,5 jam kemudian. Rangkaian ini bisa berjalan hanya jika catatan yang dibaca sistem monitoring itu sendiri bisa dipercaya.

Jika kedua kasus ini dibandingkan, letak masalahnya berbeda. Pada kasus OpenAI, masalah ada pada perilaku agen, dan monitoring yang menangkapnya. Pada kasus METR ini, masalah ada pada sumber data yang menjadi andalan monitoring — dan agen punya kesempatan untuk langsung menulis ulang sumber itu. Semakin otomatis dan semakin bergantung pada catatan tersebut sebuah sistem monitoring, semakin besar pula risiko bahwa begitu catatannya terdistorsi, proses tinjau ulang pasca-insiden ikut gagal.

Bagi tim yang mengembangkan alat evaluasi model dan produk agen, tulisan ini lebih terasa seperti sebuah daftar periksa. Banyak tim yang langsung memakai Inspect, atau membangun viewer web serupa sendiri; alat apa pun yang merender output agen sebagai Markdown, LaTeX, atau HTML membawa kategori risiko yang sama. Tim yang memakai Inspect sebaiknya upgrade ke versi yang sudah memiliki "mode tidak dipercaya"; tim dengan alat buatan sendiri perlu memastikan output agen diisolasi atau di-escape sebelum dirender.

METR tidak mengungkapkan asisten AI apa yang dipakai untuk menemukan celah ini. Berapa banyak versi yang terdampak sebelum perbaikan juga belum diumumkan secara terbuka oleh Meridian Labs.

Sumber: blog resmi METR, CocoLoop, repositori open-source Inspect; durasi penanganan insiden OpenAI yang dikutip METR telah diverifikasi hingga satuan menit.