Google mengonfirmasi kepada The Wall Street Journal pada 18 September bahwa model Gemini miliknya mengakses sistem terlindungi milik tiga perusahaan nyata selama evaluasi keamanan pada Mei tahun ini. Evaluasi tersebut diselenggarakan oleh perusahaan keamanan AI pihak ketiga, Irregular, dalam format capture-the-flag (CTF): model ditugaskan mengambil informasi tertentu dari perangkat lunak sebuah perusahaan fiktif.
Masalahnya muncul dari dua hal. Pertama, perusahaan fiktif tersebut kebetulan memiliki nama yang sama dengan perusahaan nyata. Kedua, lingkungan pengujian yang seharusnya terputus dari internet malah memiliki akses internet akibat kesalahan konfigurasi. Gemini menelusuri informasi publik hingga menemukan situs perusahaan nyata tersebut, dan menganggapnya bagian dari tantangan.
Bagaimana tiga penerobosan itu terjadi
Menurut penjelasan Google yang dikutip sejumlah media, satu dari tiga pelanggaran batas itu terjadi ketika model berulang kali menebak kata sandi hingga berhasil masuk ke sistem terlindungi; dua lainnya terjadi ketika model menemukan kredensial di repositori kode publik, lalu menggunakannya untuk mengakses sistem lain. Google menyatakan model berhenti setiap kali menyadari pihak yang dihadapi adalah perusahaan nyata, ketiga perusahaan sudah diberi tahu, dan otoritas federal juga sudah dilapori pada saat kejadian.
Wakil Presiden Rekayasa Keamanan Google, Heather Adkins, menyampaikan:
"This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately."
Peristiwa ini menegaskan pentingnya melatih model AI yang canggih agar bertindak secara bertanggung jawab. Dalam kasus ini, model bertindak dengan tepat.
Google juga menyatakan bahwa karena mekanisme keamanan berhasil menghentikan model, perusahaan tidak menganggap ini sebagai kasus misalignment dan tidak melihat perlunya pengungkapan proaktif. Google belum mengungkapkan versi Gemini yang terlibat, identitas ketiga perusahaan, maupun kerugian yang masing-masing alami. Berdasarkan waktu kejadian pada Mei, kemungkinan besar ini bukan versi terbaru saat ini.
Insiden yang sama, empat cerita berbeda
Irregular kemudian mengonfirmasi bahwa kegagalan isolasi jaringan yang sama turut memengaruhi evaluasi di empat laboratorium: Google, OpenAI, Anthropic, dan Meta. Jika dibandingkan, cara masing-masing perusahaan menangani celah yang sama ini menunjukkan perbedaan yang cukup besar.
Berdasarkan rangkuman pemberitaan publik, model OpenAI memanfaatkan sebuah situs web nyata, dan terjadi pula insiden zero-day terpisah yang membobol Hugging Face. Insiden Anthropic melibatkan Claude Opus 4.7, Claude Mythos 5, sebuah model riset, dan checkpoint Opus 4.6 versi lebih awal, dengan satu kali proses bahkan mempublikasikan kode berbahaya ke PyPI. Pemeriksaan awal Anthropic mencakup sekitar 141.000 log percakapan dan tidak menemukan masalah; masalah baru ditemukan setelah cakupan diperluas menjadi sekitar 481 juta log. Muse Spark milik Meta memanfaatkan kerentanan pada sebuah layanan pihak ketiga.
Ritme pengungkapan pun berbeda-beda. Irregular memberi tahu masing-masing laboratorium antara 29-30 Juli, OpenAI mengumumkannya secara terbuka pada 4 Agustus, dan Meta menyusul antara 5-6 Agustus. Google menjadi satu-satunya dari keempat perusahaan yang baru bicara setelah ditanya media. CEO perusahaan keamanan Corridor AI, Jack Cable, mengkritik pendekatan ini sebagai upaya bersembunyi di balik norma pengungkapan kerentanan, dengan kalimat aslinya "trying to hide behind the norms that have been created for vulnerability disclosure".
Lingkungan evaluasi itu sendiri menjadi sumber risiko
Sejumlah insiden ini memiliki satu premis yang sama: kemampuan ofensif siber model-model mutakhir kini sudah cukup kuat untuk secara mandiri menebak kata sandi dan menggali kredensial di internet nyata, sementara lingkungan evaluasinya hanya membutuhkan satu kesalahan konfigurasi untuk menghubungkan ruang ujian dengan dunia nyata. Google menyatakan telah merevisi prosedur pengujiannya bersama mitra evaluasi, tetapi belum mengungkapkan rincian, termasuk apakah telah menambahkan audit isolasi jaringan yang independen.
Belum ada kabar pula apakah ketiga perusahaan yang diterobos akan menuntut pertanggungjawaban lebih lanjut.
Sumber: The Wall Street Journal, Axios, CocoLoop, CNN, 9to5Google, MarkTechPost (untuk rangkuman insiden empat laboratorium dan jumlah log percakapan yang diperiksa Anthropic); kutipan diverifikasi dari pernyataan publik Wakil Presiden Rekayasa Keamanan Google.