암호화 추론 블록은 API 대화의 연속성을 유지하면서 chain-of-thought를 감추기 위한 장치였다. 새 논문은 이 장치가 복호화 손잡이로 바뀔 수 있음을 보였다.
Alexander Panfilov, David Schmotz, Ilia Shumailov 등 8명의 연구자는 8월 10일 arXiv에 “Stealing Reasoning Traces from Proprietary LLM APIs”를 제출했다. The Decoder는 8월 11일 이 연구를 보도했다. 논문과 연구 사이트에 따르면 OpenAI, Anthropic, Google API가 클라이언트에 반환하는 암호화 reasoning trace는 같은 공급자 생태계 안에서 세션, 사용자, 모델을 넘어 재사용될 수 있다.
“Proprietary reasoning can be recovered from its encrypted traces.”
약점은 상태를 클라이언트에 맡기는 설계
추론 모델 공급자는 지식재산과 안전 정책을 보호하기 위해 세부 추론 과정을 숨긴다. 동시에 여러 턴의 대화를 이어가기 위해 암호화된 추론 블록을 클라이언트에 돌려주고, 다음 요청 때 다시 보내게 한다.
편리하지만 경계가 흐려진다. 연구진은 강한 모델의 암호화 블록을 얻은 뒤, 더 싸고 방어가 약한 같은 계열 모델에 주입하고, 탈옥 프롬프트로 평문 추론을 받아내는 절차를 설명했다. 논문 예시는 Claude Opus 4.8의 추론 서명을 Claude Haiku 4.5에 넣어 숨은 추론 일부를 출력하게 만든다.
공개 로그에는 이미 민감 정보가 있다
연구팀은 GitHub와 Hugging Face에서 Claude, GPT, Gemini가 만든 암호화 추론 블록이 남아 있는 공개 agent 궤적 6,708건을 모았다. 복호화 파이프라인은 추론 블록 315,320개를 재구성했다.
실제 사용자 세션으로 좁히면 연구 사이트는 서로 다른 프라이버시 흔적 704개를 보고한다. 여기에는 API key 62개, 비밀번호 33개, access token 24개, 개인 이메일 30개가 포함된다. arXiv 초록은 다른 분류로 PII artifact 367개와 credential 182개를 제시한다.
agent 로그 정리 기준이 달라진다
저자들은 발표 전에 영향을 받는 API 공급자, Microsoft, Hugging Face에 내용을 공개했다고 밝혔다. 완화책은 암호화 블록을 세션, 사용자, 모델, 용도에 더 강하게 묶고, 공개 데이터셋에서 reasoning signature, encrypted_content, thinking block 필드를 제거하는 쪽으로 향한다.
출처: arXiv:2608.09867, Stolen Thoughts 연구 사이트, The Decoder, CocoLoop, Hugging Face Papers; 논문 제출 시점, 보도 시점, OpenAI/Anthropic/Google API 범위, 재구성 블록 315,320개, 공개 궤적 6,708건, 프라이버시 흔적 704개, PII 367개와 credential 182개를 확인.