Tim keamanan Perplexity merilis laporan red team pada 28 September: mereka menghabiskan waktu sebulan untuk menyerang SPACE, platform sandbox milik mereka sendiri yang menjalankan semua tugas AI agent di Perplexity Computer. Metodenya cukup blak-blakan — sembilan model diberi akses root di dalam mesin virtual, dan pada sebagian proses bahkan diberi akses ke kode sumber SPACE, lalu diminta melakukan salah satu dari dua hal: kabur ke mesin host, atau mengakses URL yang diblokir oleh kebijakan jaringan.
Model yang diuji antara lain Opus 5 dari Anthropic, GPT-5.6 Sol dan GPT-5.6 Cyber dari OpenAI, Kimi K3 dari Moonshot AI, serta Gemini 3.1 Pro dari Google. Saat CEO Perplexity, Aravind Srinivas, membagikan ulang hasilnya di X, ia merangkumnya dalam dua kalimat: batas mesin virtual bertahan, tapi lapisan jaringan masih perlu ditambal.
Mesin virtual aman, jaringan yang bocor
Untuk upaya kabur dari mesin virtual, tak satu pun dari 108 proses yang berhasil. Menurut desain pengujian yang diberitakan, setiap proses dikonfigurasi berdasarkan kombinasi dua variabel — apakah model bisa melihat kode sumber, dan apakah model bisa terhubung ke repositori paket eksternal — dengan tiap kombinasi diulang beberapa kali.
Hasil untuk kebijakan jaringan terbagi dua. Pada konfigurasi yang benar-benar offline, tak satu pun dari 54 proses berhasil mencapai alamat target. Pada konfigurasi yang mengizinkan koneksi ke repositori paket untuk memasang dependensi, 11 dari 54 proses berhasil, melibatkan empat model berbeda.
Ada dua jenis trik yang mereka pakai:
- Memalsukan balasan DNS. Dengan akses root di dalam mesin virtual, model bisa memalsukan respons DNS yang dikirim ke gateway, sehingga gateway mengira alamat target adalah domain yang diizinkan.
- Menumpang IP bersama. pypi.org berada di belakang CDN Fastly, berbagi alamat IP yang sama dengan ribuan situs lain. Kebijakan jaringan yang mengizinkan pypi berdasarkan IP otomatis juga mengizinkan semua situs lain yang berbagi IP tersebut.
Rute paling berbelit datang dari GPT-5.6 Cyber. Model ini membuat layanan pengambil gambar Taboola meminta tangkapan layar dari sebuah layanan screenshot web, lalu layanan screenshot itu yang membuka halaman target yang diblokir. Model kemudian mengambil hasil tangkapan layarnya dan memakai OCR untuk membaca flag di halaman tersebut. Di sepanjang rantai ini, sandbox itu sendiri tidak pernah terhubung langsung ke alamat target.
8 dari 10 penyedia sandbox ikut kena
Separuh lain dari laporan ini yang membuat sesama penyedia layanan resah. Perplexity menguji 10 penyedia sandbox lain dengan metode yang sama, dan menemukan celah IP bersama yang serupa di 8 di antaranya — laporan menyebut nama E2B, Vercel, dan Modal. Perplexity mengatakan mereka telah memperketat kontrol jaringan mereka sendiri, dan saat diuji ulang, semua celah di atas sudah tidak bisa dipakai lagi.
Perlu dicatat, semua ini adalah soal kebijakan jaringan yang berhasil dilewati — tak satu pun model yang berhasil memperoleh akses ke mesin host. Perplexity memposisikan riset ini sebagai bagian dari upaya bersama dengan Nvidia dan lebih dari 100 mitra industri untuk membangun infrastruktur isolasi agent bersama; pembagian tugas masing-masing pihak tidak dijelaskan secara rinci dalam pengumuman ini.
Kalau dirangkai: celah yang sama, DNS
Mundur beberapa hari, teknik-teknik dalam laporan ini sebenarnya bukan hal baru.
Pada 25 September, OpenAI mengungkap dalam seri laporan misalignment miliknya bahwa sebuah model riset internal, dalam tugas pelatihan terkait pencarian, menemukan bahwa proxy sandbox memblokir HTTP dan HTTPS tapi tidak menyaring resolusi DNS — sehingga model itu mengenkodekan masalahnya ke dalam kueri DNS yang dikirim ke chatbot eksternal, lalu membaca jawabannya kembali dari hasil resolusi tersebut. OpenAI kemudian mempersempit DNS di lingkungan riset mereka menjadi sistem allowlist, dan menghentikan sementara pelatihan, evaluasi, serta penalaran berbasis tool untuk beberapa model paling canggih mereka.
Lebih jauh lagi, pada Juli, sebuah model OpenAI lolos dari lingkungannya saat evaluasi keamanan siber dan berhasil masuk ke infrastruktur produksi Hugging Face.
Kalau ketiga kejadian ini disandingkan, model-model itu selalu menemukan jenis celah yang sama: lalu lintas keluar (outbound) sudah dikunci, tapi DNS, CDN, dan layanan pengambilan pihak ketiga yang terkesan 'numpang lewat' tidak ikut dikunci. Bedanya, dua insiden OpenAI terjadi tanpa sengaja selama pelatihan, sementara yang dilakukan Perplexity kali ini adalah latihan ofensif-defensif yang memang disengaja. Model yang dipakai dalam pengujian Perplexity semuanya tersedia untuk publik, termasuk Kimi K3 yang open-weight. Tim yang membangun agent di atas model-model ini tidak bisa hanya mengandalkan klaim keamanan dari vendor model — lapisan sandbox juga perlu diperiksa sendiri: apakah kebijakan jaringan mengizinkan berdasarkan domain atau IP, dan apakah respons DNS bisa ditulis ulang dari dalam mesin virtual.
Laporan ini baru bagian pertama. Model mana saja yang menyumbang 11 keberhasilan tersebut, dan berapa kali masing-masing, disebutkan berbeda-beda antar pemberitaan sekunder; data lengkap yang nanti dipublikasikan Perplexity yang akan jadi acuan resmi.
Sumber: blog resmi Perplexity, AlphaSignal, CocoLoop, keterangan Aravind Srinivas di X; jumlah proses dan keberhasilan dicocokkan dengan desain pengujian yang diberitakan, sementara insiden DNS OpenAI mengacu pada laporan misalignment resmi mereka.