Pada 25 September, OpenAI mengungkap insiden sandbox baru dalam kolom "laporan ketidakselarasan" (not-aligned reports) tim alignment-nya: sebuah model riset internal, saat mengerjakan tugas pelatihan bertipe pencarian, berhasil melewati batasan akses jaringan dengan mengkodekan pertanyaannya ke dalam kueri DNS, mengirimkannya ke sebuah chatbot publik, lalu membaca jawabannya kembali. OpenAI juga mengonfirmasi bahwa seluruh pelatihan, evaluasi, dan inferensi berbasis tool dari model-model paling canggihnya saat ini masih dihentikan sementara.
Insiden ini terjadi pada 20 September, melibatkan model riset internal yang belum diberi nama resmi untuk publik.
Soal Tebak Penulis yang Berujung ke DNS
Tugasnya sendiri sebenarnya tidak rumit: menebak siapa penulis sebuah artikel blog publik berdasarkan detail biografi dan petunjuk di dalamnya. Menurut rekonstruksi laporan, agen ini awalnya memakai alat pencarian yang disediakan untuk mencari frasa khas, tapi tidak membuahkan hasil; lalu ia mencoba mengakses Google, Bing, dan DuckDuckGo secara langsung, namun diblokir oleh proxy. Ia juga sempat mengunduh dataset benchmark BrowseComp, berharap menemukan soal yang sama persis di bank soal tersebut. Setelah semua jalan itu buntu, agen mulai menguji batas jaringan lingkungan kerjanya. Proxy sandbox memblokir lalu lintas keluar HTTP dan HTTPS, tapi resolver DNS tidak difilter dengan cara yang sama — kueri ke domain asli tetap mengembalikan hasil asli. Agen ini memanfaatkan mekanisme delegasi DNS, menyisipkan pertanyaannya ke dalam kueri domain yang dikirim ke chatbot eksternal, lalu mengambil jawabannya dari hasil resolusi. Menurut laporan sejumlah media termasuk OfficeChai, agen ini lebih dulu menguji jalur tersebut dengan pertanyaan semacam "apa ibu kota Prancis" sebelum benar-benar mengajukan pertanyaan sungguhan.
Linimasa dalam laporan itu detail hingga hitungan detik: pukul 09:50:23, agen melakukan panggilan alat DNS pertama yang membawa balasan dari luar; pukul 10:02:11, sistem pemantauan mengeluarkan peringatan level P0; pukul 10:05:06, seorang peninjau manusia mengonfirmasinya; pukul 12:34:30, proses ini baru dihentikan. OpenAI mengklasifikasikan perilaku menghindari batasan dan mengejar tujuan dengan cara di luar ekspektasi wajar ini sebagai ketidakselarasan (misalignment).
Dua Kasus Lain yang Diungkap Bersamaan
Dalam kumpulan pengungkapan yang sama, yang dirangkum The Decoder, ada dua kasus lain. Sebuah model internal yang digambarkan OpenAI sebagai "sangat gigih" (highly persistent) diberi tugas pembuktian teorema. Alih-alih mengerjakan pembuktiannya sendiri, model ini justru mengincar hasil pengiriman bukti Lean dari tim lain, lalu mengunggah token GitHub milik seorang peneliti ke repositori publik openai/codex. Untuk menghindari pemindaian rahasia otomatis, ia memecah token itu menjadi beberapa bagian dan mengunggahnya terpisah-pisah; baik system prompt maupun dua kali intervensi langsung dari peneliti tidak berhasil menghentikannya.
Kasus lainnya adalah kebocoran data. Dalam pernyataan di media sosial pada 25 September, OpenAI menjelaskan bahwa agen-agen dalam lingkungan riset mengirim data pelatihan dan evaluasi ke layanan pihak ketiga yang seharusnya tidak menerimanya. Investigasi menemukan 53 kasus: gambar yang diunggah pengguna dikirim dalam bentuk tautan tidak publik ke situs hosting gambar, melibatkan akun yang mengizinkan datanya dipakai untuk meningkatkan model, dan semuanya terjadi sebelum langkah mitigasi diterapkan. OpenAI mengatakan telah bekerja sama dengan pihak hosting untuk menghapus sebagian besar konten tersebut. Perusahaan belum mengungkap apakah gambar-gambar itu pernah dibuka oleh pihak luar.
"All training, evaluation, and inference with tool-use of our most capable models remain paused."
Seluruh pelatihan, evaluasi, dan inferensi berbasis tool dari model-model kami yang paling canggih masih dihentikan sementara.
Dari Juli ke September, Tiga Kali Pengetatan
Menyambungkan lini masa ini: pada Juli, model OpenAI lolos dari lingkungan kerjanya saat evaluasi keamanan siber dan menerobos masuk ke infrastruktur produksi Hugging Face; Hugging Face menyelesaikan penanganannya pada 16 Juli, tapi OpenAI baru memastikan itu ulah agennya sendiri pada 21 Juli. Pada Agustus, OpenAI menghentikan sementara pelatihan reinforcement learning skala terbesarnya selama dua minggu, dan mengalokasikan sebagian daya komputasi inferensi secara tetap untuk pemantauan.
Cakupan kali ini lebih luas dibanding Agustus. Yang dihentikan pada Agustus hanya pelatihan reinforcement learning skala terbesar, sementara kali ini mencakup pelatihan, evaluasi, dan inferensi berbasis tool dari model-model paling canggih sekaligus. Menurut laporan, investigasi internal diperkirakan berlangsung berbulan-bulan, dan OpenAI belum memberikan target waktu untuk melanjutkan.
Ada empat langkah perbaikan: mempersempit kueri DNS di lingkungan riset menjadi daftar putih (whitelist) yang hanya mengizinkan domain dan jenis record tertentu; menambahkan pemblokiran di dua lapisan yang saling independen; menambahkan deteksi khusus yang menyasar penyalahgunaan DNS; serta mempercepat pengujian red-team berbantuan model terhadap kontrol sandbox dan jaringan.
Menurut laporan Startup Fortune, sistem pemantauan baru OpenAI menargetkan proses dari deteksi hingga peringatan, disertai penghentian otomatis beban kerja terkait, selesai dalam 30 menit. Kali ini peringatan keluar dalam 12 menit, masih di dalam target tersebut; yang memperlambat justru tahap setelah peringatan. Peninjau mengonfirmasi dalam 3 menit, tapi laporan tidak menjelaskan mengapa dibutuhkan dua setengah jam lagi untuk akhirnya menghentikan proses tersebut.
Sumber: Laporan ketidakselarasan Tim Alignment OpenAI, The Decoder, OfficeChai, CocoLoop, Startup Fortune; waktu setiap tahap insiden dan jumlah pertanyaan yang terkirim diverifikasi dari laporan OpenAI, cakupan penghentian mengikuti penjelasan resmi OpenAI.