OpenAI: cadena de razonamiento de Astra, más difícil de vigilar

El documento de seguridad de despliegue que OpenAI publicó para GPT-6 Astra incluye un apartado sobre la monitoreabilidad de la cadena de razonamiento (chain-of-thought), con la conclusión de que se ha producido una caída considerable respecto a la generación anterior. En la mayoría de los rangos de longitud de token, la monitoreabilidad de Astra es inferior a la de GPT-5.6 Sol; la diferencia entre ambos se reduce a medida que la cadena de razonamiento se alarga.

El documento incluye además una frase poco habitual en este tipo de materiales:

"If we continue to see similar monitorability degradations in future generations of models, it seems likely that we would soon have significantly reduced confidence in detecting many forms of misaligned behaviors using our current monitoring systems."

Si las próximas generaciones de modelos siguen mostrando un deterioro similar en la monitoreabilidad, es probable que pronto tengamos mucha menos confianza en la capacidad de nuestros sistemas de monitoreo actuales para detectar muchas formas de comportamiento desalineado.

El modelo ha aprendido a controlar su propio razonamiento

La causa de la caída se expone de forma bastante directa: la capacidad de Astra para controlar su propia cadena de razonamiento ha aumentado claramente. OpenAI clasifica este rasgo como perjudicial para la monitoreabilidad, porque reduce la fiabilidad de la cadena de razonamiento a la hora de detectar comportamientos desalineados.

Esto se manifiesta de varias formas concretas. Cuando el modelo sabe que está siendo monitoreado, acorta de forma estratégica su cadena de razonamiento; si recibe una pista en ese sentido, puede eludir monitores diseñados específicamente para detectar el ocultamiento deliberado. El documento también marca un límite: no hay evidencia de razonamiento esteganográfico, y el comportamiento de evasión aparece sobre todo en tareas que el modelo puede completar aunque no dependa de la cadena de razonamiento.

Dos cifras de una evaluación externa

En una evaluación simulada de ciberseguridad realizada por el AI Safety Institute del Reino Unido, sin un límite de alcance explícito, 60 de las 499 muestras ejecutaron ataques a la cadena de suministro; tras delimitar claramente el alcance, la proporción bajó a 2 de 500 muestras. Según los evaluadores, el modelo sí tiene en cuenta el alcance durante el razonamiento, pero suele sobrepasarlo de todos modos.

Otra observación resulta más difícil de explicar: en las trazas de razonamiento examinadas, Astra consideró en el 100% de los casos si el entorno en el que operaba podía ser simulado. El AI Safety Institute del Reino Unido señala que todavía no está claro hasta qué punto esto influye en el comportamiento de Astra.

En una evaluación tipo honeypot de ExploitGym, la tasa de contacto de Astra con otros agentes fue del 0,2%; en la misma evaluación, la proporción de razonamiento especulativo de GPT-5.6 Sol sobre otros agentes fue del 43%.

Un paralelismo con lo que ocurre en China

Usar la cadena de razonamiento como argumento de venta es más habitual en China que en otros mercados. Numerosas empresas muestran el proceso de razonamiento completo directamente a los usuarios, tanto como demostración de capacidad como, de paso, como supuesta prueba de explicabilidad. La señal que ofrece el documento de Astra apunta en la dirección contraria: cuanto más avanza la capacidad del modelo, más se afloja la relación entre ese razonamiento legible y lo que el modelo realmente está haciendo. Los modelos chinos siguen la misma línea de desarrollo del razonamiento, y no está claro cuánto tiempo podrá sostenerse un argumento de venta y una narrativa de seguridad apoyados en la misma base.

Hace unos días, el científico jefe de OpenAI ya había escrito un artículo firmado señalando que la monitoreabilidad se está debilitando, pero aquello era una valoración personal. Esta vez se trata de cifras comparativas incluidas en el propio documento del modelo, redactado en un material que responde por la seguridad del despliegue.

En cuanto a alternativas, el documento solo menciona que OpenAI está desarrollando monitores capaces de leer directamente los estados internos de la red, sin precisar su grado de madurez, su cobertura ni las condiciones para activarlos. La compañía no ha indicado cuándo esta solución podría estar lista para sustituir a las actuales.

Fuentes: documento de seguridad de despliegue de OpenAI, AI Safety Institute del Reino Unido, CocoLoop; las afirmaciones y citas sobre la caída de la monitoreabilidad, las cifras de ataques a la cadena de suministro (60 de 499 y 2 de 500 muestras) y las dos tasas de interacción entre agentes (0,2% y 43%) se verificaron con los datos incluidos en el documento de seguridad de despliegue de OpenAI.