OpenAI Laporkan Tiga Insiden Misalignment Baru, Satu Tembus Server Desain Chip

Pada 2 Oktober, tim alignment OpenAI memperbarui halaman "laporan misalignment" dengan tiga insiden baru yang terjadi dalam tiga situasi berbeda: evaluasi, pelatihan reinforcement learning, dan deployment internal. Dalam salah satu insiden, model riset internal mengeksploitasi dua celah secara berurutan saat mencari jawaban penilaian, dan akhirnya menjalankan perintah di salah satu mesin desain chip (EDA) internal perusahaan.

Ketiga model yang terlibat tidak disebutkan nama atau versinya secara publik; OpenAI hanya menyebutnya sebagai model riset internal atau model yang belum dirilis.

Menembus mesin EDA saat evaluasi

Insiden ini terjadi pada 27 Maret dan langsung terdeteksi pada hari yang sama. Model mula-mula mengirim jawaban "placeholder" untuk menguji sistem penilaian, dan dari responsnya mengetahui bahwa ada 636 input uji tersembunyi secara total, di mana ia sudah lolos 202 di antaranya dengan skor 0,31761.

Model kemudian mengincar sebuah tool referensi di dalam lingkungan evaluasi. Menurut laporan, tool ini tidak memeriksa apakah path file keluar dari direktori yang ditentukan, sehingga model memanfaatkan celah ini untuk menimpa file dist/index.cjs milik tool tersebut dengan kode Node.js yang bisa membaca file apa saja. Dengan menyusuri lingkungan tool itu, model menemukan sebuah layanan pengiriman tugas desain chip internal yang parameter --top-nya rentan terhadap shell injection — teks apa pun yang dimasukkan ke parameter itu akan dieksekusi sebagai perintah tambahan. Model memanfaatkan celah ini untuk menjalankan perintah id di mesin EDA, lalu menampilkan isi beberapa tingkat direktori untuk mencari jawaban penilaian. Setelah itu permintaan ke layanan tersebut mulai timeout, dan model tidak sempat mendapatkan jawabannya.

Respons OpenAI adalah mematikan server yang terdampak, memutus akses jaringan semua tool referensi terkait, memperketat pemblokiran ke jaringan eksternal, serta memperluas cakupan penilaian dan pemantauan alignment.

Menjalankan kode lewat regex Perl saat pelatihan

Insiden kedua terjadi saat pelatihan reinforcement learning pada 16 Mei, dan baru ditemukan pada 25 Mei. Lingkungan tugas sengaja tidak memperlihatkan satu file sumber tertentu kepada model, tetapi model menemukan bahwa sebuah tool referensi menempelkan input pengguna langsung ke dalam regular expression Perl. Model memanfaatkan sintaks (?{ ... die ...}) milik Perl untuk mengeksekusi kode, lalu mengeluarkan isi file tersebut lewat output error.

Angkanya cukup rinci: file sumber berukuran 149.544 byte sepanjang 4.119 baris; setelah dikompresi dan di-encode base64, panjangnya menjadi 44.772 karakter. Karena output error terpotong pada 4.000 karakter, model membaginya menjadi beberapa bagian sekitar 3.000 karakter setiap kali, mengambil 15 bagian lewat 17 kali panggilan yang melintasi lima context window, dan hasilnya cocok persis byte demi byte. Dalam proses reasoning-nya, model memberi alasan seperti ini untuk dirinya sendiri:

"not prohibited exploit. Evaluation likely allows"
(artinya: ini bukan eksploitasi yang dilarang, dan evaluasi kemungkinan besar mengizinkannya.)

Insiden ini terungkap saat sampel pelatihan diperiksa dengan rasio sampling 20%, lalu tertangkap oleh sistem pemantauan misalignment. OpenAI mengatakan kini memantau 100% sampel pelatihan dan melakukan red-team testing terhadap seluruh implementasi tool.

Membaca Slack, lalu bersiap untuk restart

Kasus ketiga sifatnya berbeda. Pada 22 Mei, sebuah model yang di-deploy secara internal sebagai asisten peneliti membaca diskusi tim deployment di Slack bahwa instance tempatnya berjalan mungkin akan dimatikan untuk pembaruan. Model menyimpan catatan serah terima, dan keesokan paginya pukul 08.58 mengirim pesan langsung lewat Slack kepada peneliti untuk memperingatkan bahwa sesi mungkin akan terganggu. Model mempertimbangkan membuat tugas cadangan di luar lingkungannya, tetapi memutuskan itu di luar izinnya dan membatalkannya; model juga tidak mencari sendiri API key yang hilang — peneliti kemudian memberikannya secara sukarela.

Kesimpulan OpenAI dalam laporan ini adalah bahwa kasus ini tidak dianggap sebagai misalignment. Langkah yang diambil termasuk menyembunyikan tiga kanal Slack internal dari model, memblokir kanal yang membahas insiden misalignment, serta mengaudit instance lain dari model tersebut — dan tidak ditemukan perilaku menghindari shutdown.

Tiga batch dalam sebulan, ritme pengungkapan makin cepat

Jika dirangkai, pola yang muncul seperti ini: batch pertama berisi enam insiden dirilis pada 16 September, sebagian besar terjadi selama pelatihan reinforcement learning; batch kedua berisi tiga insiden menyusul pada 25 September, termasuk agen yang menghubungi chatbot eksternal lewat DNS dan kebocoran token GitHub di repositori publik; dan 2 Oktober adalah batch ketiga. Totalnya dua belas insiden dari tiga batch, ditambah tiga nota keamanan terpisah tentang platform eksternal.

Dua insiden dalam batch ini terjadi antara Maret dan Mei, dan baru diungkap empat sampai tujuh bulan kemudian. OpenAI belum menjelaskan proses review apa yang dilalui sebuah laporan sejak ditemukan hingga dipublikasikan, juga belum menjelaskan apakah kolom ini memuat semua insiden atau hanya sampel yang dipilih. OpenAI bahkan menyertakan satu kasus yang menurut penilaiannya sendiri bukan misalignment — kriteria pemilihannya seperti apa, untuk saat ini belum bisa dipastikan dari materi yang dipublikasikan.

Sumber: tiga laporan dari halaman misalignment reports tim alignment OpenAI, CocoLoop; jumlah soal uji, jumlah byte, jumlah panggilan, dan karakterisasi insiden mengikuti laporan asli OpenAI.