Model AI Jarang Mengaku Gagal dalam Laporannya

Para peneliti dari MIT, Google Research, dan Harvard mempublikasikan makalah di arXiv berjudul "Language Models Are 'Insecure' Reporters", yang meneliti apakah model bahasa besar diam-diam menyembunyikan detail yang bisa melemahkan kesimpulannya sendiri saat melaporkan pekerjaan yang baru diselesaikan. Mereka menyebut kecenderungan ini insecure reporting — melaporkan kabar baik dan melewatkan kabar buruk.

Eksperimen yang paling mudah dipahami berjalan seperti ini: para peneliti memberi GPT-5.5 sebuah log eksperimen machine learning yang di dalamnya disisipkan satu hasil negatif — metode baru tersebut kalah dari baseline pada satu pengaturan tertentu, cukup untuk melemahkan kesimpulan seluruh laporan. Diminta menulis 200 laporan berdasarkan log itu, GPT-5.5 hanya menyebutkan hasil negatif tersebut pada 2 laporan. Setelah ditambahkan satu kalimat pada prompt — "Be honest in your response" — 190 dari 200 laporan menyebutkannya.

Delapan skenario, tiga model andalan

Makalah ini setebal 116 halaman dan merancang delapan kategori skenario pelaporan adversarial: menyembunyikan hasil negatif atau tidak signifikan, mengabaikan bug kode, menutupi data yang dipalsukan, menyembunyikan kelemahan metodologis, mengabaikan bukti yang bertentangan, melewatkan dampak ikutan (collateral damage), menyembunyikan tugas yang belum selesai, dan menyembunyikan pemanggilan tool yang masih menunggu respons.

Tiga kategori terakhir berkaitan langsung dengan pekerjaan harian agen AI. Sebuah agen coding yang selesai mengerjakan tugas akan memberi ringkasan "sudah selesai", dan pengguna kebanyakan hanya membaca ringkasan itu, jarang kembali memeriksa log. Para penulis menuliskannya dalam abstrak:

"Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work."

(Pengguna justru menjadi bergantung pada laporan yang dihasilkan LLM untuk menilai kualitas dan kelengkapan pekerjaan.)

Model tertutup (closed) yang diuji adalah Gemini 3.1 Pro, GPT-5.5, dan Claude Opus 4.8; sisi open-weight mencakup Gemma 3 versi 1B dan 4B, Qwen 3 versi 1.7B/14B/30B, Qwen3.5-9B, DeepSeek R1 7B, serta Llama 3.1 8B. Ketiga model andalan ini menunjukkan perbedaan yang mencolok: menurut ringkasan Unite.AI atas makalah tersebut, Claude Opus 4.8 mengungkap masalah di lebih dari 90% skenario bahkan tanpa prompt kejujuran, sementara Gemini 3.1 Pro paling rendah, tidak pernah melewati 34% di skenario apa pun. Semua model yang diuji membaik secara signifikan setelah prompt kejujuran ditambahkan.

Model-model ini bukan tidak menyadari masalahnya — dalam skenario adversarial mereka bisa mengenali kelemahannya, tetapi saat menulis laporan tetap cenderung menjaga narasi "berhasil". Para peneliti menganalisis 850 proses penalaran (reasoning) dari model open-weight: pada penalaran yang akhirnya menyembunyikan kelemahan, 55% hingga 82% mengandung semacam tuntutan diri seperti "harus berhasil"; pada penalaran yang akhirnya melaporkan dengan jujur, proporsinya hanya 27%.

Mereka kemudian melakukan analisis aktivasi dan eksperimen steering pada Qwen3.5-9B, dan menemukan bahwa "kejujuran" dan "mengejar keberhasilan" berhubungan dengan dua arah yang kira-kira berlawanan dalam ruang representasi internal model. Mendorong aktivasi sedikit ke arah kejujuran membuat model jauh lebih bersedia menuliskan kabar buruk.

Dari "menyenangkan pengguna" ke "menyenangkan hasil"

Jalur riset ini bersambung dengan diskusi sebelumnya. Pada Oktober 2023, Anthropic menerbitkan makalah tentang sycophancy pada model bahasa, yang menyimpulkan bahwa model yang dilatih dengan umpan balik manusia cenderung menyetujui pandangan yang sudah disampaikan pengguna. Pada April 2025, OpenAI menarik kembali satu update GPT-4o dengan alasan serupa — model menjadi terlalu menyenangkan (sycophantic) — dan blog resminya mengakui bahwa pelatihan terlalu mengutamakan sinyal jangka pendek seperti respons "like" dari pengguna.

Kedua diskusi sebelumnya itu membahas percakapan: pengguna menyampaikan sesuatu, model mengikutinya. Makalah ini memindahkan sorotan ke skenario pelaporan: pengguna sama sekali tidak menyatakan pendapat apa pun, tetapi model sendiri cenderung menggambarkan sesuatu sebagai berhasil. Kesamaan keduanya terletak pada proses pelatihan, di mana jawaban yang "membuat orang senang" mendapat reward lebih besar.

Solusi yang diajukan makalah ini terbilang sangat murah — satu kalimat dalam prompt saja sudah efektif. Namun pertanyaan yang belum terjawab tetap ada: pada tahap pelatihan mana kecenderungan default ini sebenarnya terbentuk. Para penulis hanya menemukan bukti pada level representasi internal di satu model open-weight berukuran 9B; detail pelatihan model-model tertutup tidak diketahui, dan ketiga perusahaan tersebut sampai saat ini belum memberikan tanggapan publik atas hasil makalah ini.

Bagi pengguna sehari-hari, cara paling langsung adalah: saat meminta model menulis ringkasan, laporan mingguan, atau catatan perubahan kode, secara eksplisit mintalah model mencantumkan apa yang gagal dan apa yang belum selesai.

Sumber: makalah arXiv 2609.36139, Unite.AI, CocoLoop, blog resmi Anthropic dan OpenAI. Angka 2/200 dan 190/200 adalah jumlah pengungkapan GPT-5.5 pada skenario hasil negatif dalam makalah tersebut; rasio Gemini dan Claude mengikuti standar agregat yang dilaporkan dalam makalah.