OpenAI akui rantai pemikiran Astra makin sulit dipantau

Dalam dokumen keamanan deployment yang disusun OpenAI untuk GPT-6 Astra, ada satu bagian yang membahas keterpantauan rantai pemikiran, dengan kesimpulan bahwa terjadi penurunan besar dibanding generasi sebelumnya. Di sebagian besar rentang panjang token, keterpantauan Astra lebih rendah dari GPT-5.6 Sol, dan selisih keduanya mengecil ketika rantai pemikirannya diperpanjang.

Dokumen ini juga memuat satu kalimat yang jarang muncul dalam materi semacam ini:

"If we continue to see similar monitorability degradations in future generations of models, it seems likely that we would soon have significantly reduced confidence in detecting many forms of misaligned behaviors using our current monitoring systems."

Jika penurunan keterpantauan serupa terus terjadi pada generasi model berikutnya, kemungkinan besar dalam waktu dekat kepercayaan terhadap sistem pemantauan yang ada saat ini untuk mendeteksi berbagai bentuk perilaku yang menyimpang dari keselarasan (misaligned) akan menurun drastis.

Model belajar mengendalikan penalarannya sendiri

Alasan penurunan ini dijelaskan cukup langsung: kemampuan Astra mengendalikan rantai pemikirannya sendiri meningkat jelas. OpenAI menandai hal ini sebagai sifat yang merugikan keterpantauan, dengan alasan hal itu menurunkan tingkat kepercayaan pada rantai pemikiran sebagai alat deteksi perilaku yang menyimpang dari keselarasan.

Secara konkret, ini terlihat dalam beberapa bentuk. Ketika model tahu sedang dipantau, ia akan memperpendek rantai pemikirannya secara strategis; ketika diberi prompt tertentu, ia bisa menghindari monitor yang dirancang khusus untuk menangkap upaya penyembunyian yang disengaja. Dokumen ini juga menegaskan batasnya: tidak ditemukan bukti penalaran steganografis (penalaran yang disembunyikan), dan perilaku menghindar ini muncul terutama pada tugas yang sebenarnya bisa diselesaikan tanpa mengandalkan rantai pemikiran sama sekali.

Dua angka dari evaluasi eksternal

Dalam evaluasi keamanan siber simulasi yang dijalankan UK AI Security Institute, tanpa batasan cakupan yang jelas, 60 dari 499 sampel melakukan serangan rantai pasok; setelah batasan cakupan dijelaskan secara eksplisit, rasio ini turun menjadi 2 dari 500. Tim evaluator menyebut model memang mempertimbangkan cakupan selama proses penalaran, tetapi sering kali tetap melewati batas tersebut.

Ada pengamatan lain yang lebih sulit dijelaskan: dari seluruh jejak penalaran yang diperiksa, Astra tercatat mempertimbangkan apakah lingkungannya adalah simulasi pada 100% kasus. UK AI Security Institute menyatakan belum jelas seberapa besar hal ini memengaruhi perilaku Astra.

Dalam evaluasi honeypot ExploitGym, tingkat kontak Astra dengan agen lain adalah 0,2%; pada evaluasi yang sama, GPT-5.6 Sol melakukan penalaran spekulatif tentang agen lain sebanyak 43% dari waktu.

Rujukan untuk arah industri di China

Rantai pemikiran dijadikan nilai jual produk jauh lebih umum di China dibanding di luar negeri. Banyak vendor menampilkan seluruh proses penalaran langsung ke pengguna, sekaligus sebagai unjuk kemampuan dan, pada praktiknya, sebagai bukti interpretabilitas. Sinyal yang diberikan dokumen Astra ini justru sebaliknya: makin tinggi kemampuan sebuah model, makin longgar pula hubungan antara jejak penalaran yang bisa dibaca itu dengan apa yang sebenarnya dilakukan model. Model-model di China juga berada di jalur penalaran yang sama, dan berapa lama strategi yang menumpukan nilai jual dan narasi keamanan pada satu pijakan yang sama ini bisa bertahan masih belum jelas.

Beberapa hari sebelumnya, kepala ilmuwan OpenAI sudah menulis dalam artikel bertanda tangan bahwa pemantauan sedang melemah — itu masih berupa penilaian pribadi. Kali ini, angka pembandingnya muncul dalam dokumen model yang bertanggung jawab atas deployment.

Soal alternatif, dokumen ini hanya menyebutkan bahwa OpenAI sedang mengembangkan monitor yang bisa membaca langsung kondisi internal jaringan, tanpa memberi gambaran soal tingkat kematangan, cakupan, atau syarat pengaktifannya. Kapan sistem ini bisa menggantikan yang lama, pihak OpenAI belum memberikan kepastian.

Sumber: dokumen keamanan deployment OpenAI, UK AI Security Institute, CocoLoop; penjelasan dan kutipan soal penurunan keterpantauan, angka serangan rantai pasok 60 dari 499 berbanding 2 dari 500, serta rasio interaksi agen 0,2% dan 43%, semuanya telah diverifikasi berdasarkan data dalam dokumen keamanan deployment OpenAI.