Blok penalaran terenkripsi dibuat agar percakapan API tetap berlanjut tanpa membuka chain-of-thought. Makalah baru menunjukkan desain itu juga bisa menjadi pegangan untuk membaca ulang isi tersembunyi.
Pada 10 Agustus, Alexander Panfilov, David Schmotz, Ilia Shumailov, dan lima penulis lain mengirim “Stealing Reasoning Traces from Proprietary LLM APIs” ke arXiv. The Decoder menulis laporan pada 11 Agustus. Makalah dan situs risetnya menyebut jejak penalaran terenkripsi dari API OpenAI, Anthropic, dan Google dapat dipakai ulang lintas sesi, pengguna, dan model saudara di ekosistem penyedia yang sama.
“Proprietary reasoning can be recovered from its encrypted traces.”
Titik lemah ada pada konteks stateless
Penyedia model reasoning menyembunyikan chain-of-thought untuk melindungi IP dan mekanisme keamanan. Untuk menjaga percakapan multi-turn, mereka mengembalikan blok penalaran terenkripsi ke klien dan meminta klien mengirimkannya lagi di permintaan berikutnya.
Peneliti menunjukkan alur dua langkah: ambil blok terenkripsi dari model frontier, masukkan ke model saudara yang lebih murah dan lebih lemah, lalu gunakan jailbreak agar model itu menyalin trace tersembunyi. Contoh makalah memakai tanda tangan reasoning Claude Opus 4.8 yang diputar ulang ke Claude Haiku 4.5.
Log publik sudah menyimpan rahasia
Tim mengumpulkan 6.708 trajectory agent publik dari GitHub dan Hugging Face yang masih memuat blok penalaran terenkripsi dari Claude, GPT, dan Gemini. Pipeline mereka merekonstruksi 315.320 blok reasoning.
Setelah difilter ke sesi pengguna nyata, situs proyek melaporkan 704 artefak privasi unik: 62 API key, 33 kata sandi, 24 access token, dan 30 alamat email pribadi. Abstrak arXiv memakai pengelompokan lain: 367 artefak PII dan 182 kredensial.
Log agent perlu aturan pembersihan baru
Para penulis mengatakan mereka sudah mengungkap temuan ini kepada penyedia API terdampak, Microsoft, dan Hugging Face sebelum publikasi. Pelajaran praktisnya jelas: hapus reasoning signature, encrypted_content, dan thinking block sebelum membagikan trace; pindai log agent lebih luas dari pesan yang terlihat; dan cek apakah trace lama perlu dihapus atau kunci perlu dirotasi.
Sumber: arXiv:2608.09867, situs riset Stolen Thoughts, The Decoder, CocoLoop, Hugging Face Papers; memverifikasi waktu pengajuan, waktu publikasi, cakupan API OpenAI/Anthropic/Google, 315.320 blok yang direkonstruksi, 6.708 trajectory publik, 704 artefak privasi, 367 PII, dan 182 kredensial.