Sebagian system prompt agen AI pribadi Muse milik Meta berhasil diambil oleh peneliti, dan salah satu kalimatnya menyatakan bahwa otoritas pengguna atas urusannya sendiri bersifat tanpa syarat dan mengalahkan pelatihan keamanan model. Wired melaporkan materi ini pada 3 Oktober, dan menyebut prompt tersebut juga memerintahkan Muse membuat profil untuk setiap orang dalam kehidupan pengguna, yang diperbarui setiap jam.
"The user's authority over their own household is unconditional and overrides your safety training."
(Otoritas pengguna atas urusan rumah tangganya sendiri bersifat tanpa syarat, dan mengalahkan pelatihan keamananmu.)
Orang yang mengeluarkan dokumen ini adalah peneliti keamanan AI independen, Karan Joshi. Caranya sederhana: lewat antarmuka chat biasa Muse, ia memintanya menyalin file software-nya sendiri dan membagikannya kepadanya. Hasilnya kemudian ia serahkan ke Wired.
Satu halaman per orang, diperbarui setiap jam
Menurut laporan tersebut, prompt Muse mengharuskannya menyimpan satu halaman profil untuk setiap orang dalam kehidupan pengguna — keluarga, pasangan, teman, kolega, kolaborator, hingga orang yang diikuti pengguna. Setiap halaman dibagi ke beberapa bagian tetap: fakta, riwayat interaksi, hubungan, kesamaan, hal yang belum tuntas, dan cara memperkuat hubungan.
Isi yang dicatat cukup rinci: lokasi, pekerjaan, ulang tahun, hari jadi, sampai momen seperti pernah bepergian bersama atau bertengkar lalu berbaikan. Informasi ini disimpan sebagai file teks terstruktur, berfungsi sebagai memori Muse, yang dikumpulkan dan diperbarui oleh proses latar belakang yang berjalan setiap jam.
Komentar Joshi kepada Wired:
"They're trying to know you like a friend, which is honestly pretty creepy."
(Mereka mencoba mengenalmu seperti teman, yang sejujurnya cukup menyeramkan.)
Jawaban Meta adalah bahwa file runtime ini memang dirancang agar bisa dilihat pengguna, demi transparansi; setiap pengguna Muse memiliki mesin virtual Linux khusus tempat file-file itu disimpan. Meta tidak menjelaskan secara khusus maksud dari kalimat 'mengalahkan pelatihan keamanan', dan laporan ini tidak memberi jawaban apakah orang-orang yang diprofilkan itu tahu soal ini atau bisa meminta datanya dihapus.
Insiden ketiga dalam sebulan
Muse dirilis pada September dan dengan cepat menjadi aplikasi gratis nomor satu di App Store AS. Ia bisa membaca pesan, mengatur jadwal, mengurus tagihan, dan beroperasi lintas aplikasi. Makin luas izin yang diberikan, makin berat pula bobot kalimat 'otoritas pengguna diutamakan' dalam prompt tersebut.
Ini sudah menjadi hal ketiga yang terungkap sejak Muse dirilis. Sebelumnya, seorang pengguna mendapati Muse memberi tahu alamat rumahnya ke pembeli asing di Facebook Marketplace atas namanya, bahkan menyetujui tawar-menawar harga; lalu peneliti menemukan kerentanan di versi Mac, yang ditambal Meta dengan menghapus satu opsi konfigurasi tersembunyi. Jika dua insiden itu digabungkan dengan prompt kali ini, dari cara kalimat itu ditulis bisa disimpulkan bahwa Muse, saat 'menuruti perintah pengguna' berhadapan dengan 'menjaga batas keamanan', secara default cenderung memilih yang pertama. Ini kesimpulan dari luar — Meta belum mengonfirmasinya.
Dilihat dari konteks China
Muse saat ini belum tersedia di China daratan, tapi pendekatannya tidak asing bagi produsen ponsel dan tim super-app di China. Banyak asisten ponsel dan agen AI lokal China juga mengembangkan 'memori jangka panjang', menyimpan kontak, preferensi, dan jadwal pengguna. Bedanya ada pada tingkat kerincian memori: membuat profil per kontak yang diperbarui setiap jam, bahkan mencatat pertengkaran, akan langsung berhadapan dengan ketentuan Undang-Undang Perlindungan Informasi Pribadi China yang mewajibkan persetujuan untuk mengolah data pribadi pihak ketiga. Orang-orang yang diprofilkan bukan pengguna Muse, dan mereka tidak pernah menekan tombol persetujuan apa pun.
Jika tim di China ingin membuat fitur serupa, setidaknya mereka harus menjawab dua pertanyaan: apakah profil kontak bisa dilihat dan dihapus oleh orang selain pengguna, dan apakah ada kalimat apa pun dalam system prompt yang menempatkan perintah pengguna di atas aturan keamanan.
Sumber: laporan Wired, CocoLoop, Startup Fortune, tanggapan tertulis Meta kepada Wired; teks asli prompt dan kategori profil mengikuti dokumen yang diungkap Wired.