Khối suy luận mã hóa làm lộ bản nháp mô hình

Khối suy luận mã hóa ban đầu được dùng để giữ mạch hội thoại API mà không lộ chain-of-thought. Một bài báo mới cho thấy chính thiết kế đó có thể trở thành điểm bám để đọc lại phần ẩn.

Ngày 10 tháng 8, Alexander Panfilov, David Schmotz, Ilia Shumailov và năm đồng tác giả nộp “Stealing Reasoning Traces from Proprietary LLM APIs” lên arXiv. The Decoder đưa tin ngày 11 tháng 8. Bài báo và trang nghiên cứu nói rằng reasoning trace mã hóa từ API OpenAI, Anthropic và Google có thể được dùng lại qua phiên, người dùng và mô hình cùng nhà cung cấp.

“Proprietary reasoning can be recovered from its encrypted traces.”

Điểm yếu nằm ở cách giữ ngữ cảnh không trạng thái

Các nhà cung cấp mô hình suy luận che giấu chain-of-thought để bảo vệ tài sản trí tuệ và cơ chế an toàn. Để duy trì hội thoại nhiều lượt, họ trả khối suy luận mã hóa cho client và yêu cầu client gửi lại trong yêu cầu tiếp theo.

Nhóm nghiên cứu mô tả hai bước: lấy khối mã hóa từ mô hình mạnh, đưa vào mô hình anh em rẻ hơn và ít được bảo vệ hơn, rồi jailbreak mô hình đó để nó chép lại trace ẩn. Ví dụ trong bài báo dùng chữ ký suy luận của Claude Opus 4.8 phát lại vào Claude Haiku 4.5.

Log công khai đã có dữ liệu nhạy cảm

Nhóm thu thập 6.708 trajectory agent công khai từ GitHub và Hugging Face, vẫn chứa khối suy luận mã hóa do Claude, GPT và Gemini tạo ra. Pipeline giải mã tái dựng 315.320 khối reasoning.

Sau khi lọc còn các phiên người dùng thật, trang dự án báo cáo 704 dấu vết riêng tư khác nhau, gồm 62 API key, 33 mật khẩu, 24 access token và 30 email cá nhân. Phần tóm tắt arXiv dùng một cách nhóm khác: 367 PII artifact và 182 credential.

Log agent cần được làm sạch lại

Tác giả cho biết đã disclosure cho các nhà cung cấp API bị ảnh hưởng, Microsoft và Hugging Face trước khi công bố. Việc cần làm với đội kỹ thuật khá rõ: loại reasoning signature, encrypted_content và thinking block trước khi chia sẻ trace; quét log agent ngoài phần hội thoại nhìn thấy; kiểm tra trace cũ có cần xóa hoặc xoay khóa hay không.

Nguồn: arXiv:2608.09867, trang nghiên cứu Stolen Thoughts, The Decoder, CocoLoop, Hugging Face Papers; kiểm chứng thời điểm nộp bài, thời điểm xuất bản, phạm vi API OpenAI/Anthropic/Google, 315.320 khối tái dựng, 6.708 trajectory công khai, 704 dấu vết riêng tư, 367 PII và 182 credential.