Trazas cifradas de razonamiento filtran borradores

Los bloques cifrados de razonamiento sirven para mantener continuidad en conversaciones de API sin mostrar chain-of-thought. Un nuevo trabajo muestra que esa misma comodidad puede convertirse en una vía de decodificación.

El 10 de agosto, Alexander Panfilov, David Schmotz, Ilia Shumailov y otros cinco autores enviaron “Stealing Reasoning Traces from Proprietary LLM APIs” a arXiv. The Decoder lo cubrió el 11 de agosto. El paper y el sitio del proyecto dicen que los reasoning traces cifrados devueltos por APIs de OpenAI, Anthropic y Google pueden reutilizarse entre sesiones, usuarios y modelos hermanos dentro del mismo proveedor.

“Proprietary reasoning can be recovered from its encrypted traces.”

El punto débil está en el contexto sin estado

Los proveedores de modelos de razonamiento ocultan chain-of-thought para proteger propiedad intelectual y controles de seguridad. Para sostener conversaciones de varios turnos, devuelven bloques cifrados al cliente y esperan que el cliente los envíe de nuevo en llamadas posteriores.

El ataque tiene dos pasos: obtener un bloque cifrado de un modelo frontier, inyectarlo en un modelo hermano más barato y menos protegido, y hacer jailbreak para que transcriba el trace oculto. El ejemplo del paper reproduce una firma de Claude Opus 4.8 en Claude Haiku 4.5.

Los logs públicos ya contienen secretos

El equipo reunió 6.708 trayectorias públicas de agentes en GitHub y Hugging Face que contenían bloques cifrados de Claude, GPT y Gemini. Su pipeline reconstruyó 315.320 bloques de razonamiento.

Tras filtrar sesiones reales de usuarios, el sitio del proyecto informa 704 artefactos de privacidad distintos: 62 API keys, 33 contraseñas, 24 tokens de acceso y 30 correos personales. El resumen de arXiv agrupa los hallazgos como 367 artefactos de PII y 182 credenciales.

Los logs de agentes necesitan otra higiene

Los autores dicen que avisaron a los proveedores afectados, Microsoft y Hugging Face antes de publicar. La lección práctica es retirar reasoning signatures, encrypted_content y thinking blocks antes de compartir traces, escanear logs más allá de los mensajes visibles y revisar si traces antiguos requieren borrado o rotación de claves.

Fuentes: arXiv:2608.09867, sitio de investigación Stolen Thoughts, The Decoder, CocoLoop, Hugging Face Papers; verificados envío, publicación, alcance de APIs OpenAI/Anthropic/Google, 315.320 bloques reconstruidos, 6.708 trayectorias públicas, 704 artefactos de privacidad, 367 PII y 182 credenciales.