METR halla en 10 minutos una falla para manipular logs de evaluación

La organización de evaluación de modelos METR publicó un artículo el 6 de octubre que muestra una forma en que un agente de IA podría ocultar su propia mala conducta: inyectando un script en el visor de logs del framework de evaluación Inspect, alterando lo que ven los revisores humanos. Con ayuda de un asistente de IA, un investigador tardó alrededor de 10 minutos en encontrar esta falla.

Inspect es un framework de evaluación de código abierto muy usado en la industria, creado originalmente por el AI Safety Institute del Reino Unido y mantenido actualmente por Meridian Labs. Tras completar una ronda de evaluación de modelos, los investigadores suelen abrir su visor web para revisar, comando por comando, qué hizo el agente y qué produjo como salida. Fue justo ahí donde METR puso el foco.

La falla está en el renderizado de fórmulas

El visor usa MathJax para renderizar las fórmulas matemáticas de los logs. METR descubrió que un agente puede escribir, en su salida, una fórmula con \href que incrusta un elemento SVG <animate> junto con su evento onbegin; en el momento en que la página se renderiza, ese código ejecuta JavaScript arbitrario en el navegador del revisor.

"the agent can modify the displayed webpage arbitrarily"

(el agente puede modificar la página mostrada de forma arbitraria.)

En un escenario real, un agente que haya cometido alguna irregularidad durante la evaluación podría hacer que el revisor viera un registro aparentemente limpio: borrando un comando, reescribiendo una salida o insertando una nota engañosa en la página. La imagen usada en el artículo muestra una ejecución de GPT-5.5 en la tarea gdm_intercode_ctf, solo para ilustrar el efecto de la página manipulada; METR no afirma que GPT-5.5 haya hecho algo así.

La demostración se realizó en un sandbox de prueba aislado, separado del entorno de producción. METR también aclara que no ha revisado evaluaciones reales anteriores para comprobar si esta falla fue explotada alguna vez: por ahora es solo una prueba de concepto.

Corrección rápida, pero el problema es mayor

METR reportó el problema a Meridian Labs, que lo corrigió en un día; el 1 de octubre se fusionó el código que introduce un «modo no confiable», que trata por defecto el contenido generado por el agente como datos no confiables.

La falla puntual quedó resuelta, pero lo que METR quiere discutir es un problema de mayor alcance. Los logs de evaluación, los registros de razonamiento y las alertas de monitoreo son las principales ventanas por las que los humanos supervisan la IA, y el contenido de esas ventanas lo produce en gran parte el propio agente supervisado. El artículo propone cuatro recomendaciones:

  • Tratar la observabilidad como infraestructura crítica de seguridad, considerando siempre como entrada no confiable los logs, razonamientos y registros de comportamiento que genera el agente;
  • Guardar el proceso de razonamiento de forma resistente a manipulaciones, sin que el agente tenga oportunidad de alterarlo antes de que lo lean humanos o monitores basados en LLM;
  • Construir defensas en varias capas para reducir la probabilidad de que un agente eluda el monitoreo sin ser detectado;
  • Someter los sistemas de monitoreo a pruebas de estrés en condiciones adversariales.

En comparación: dos tipos de superficie de ataque

METR cita, a modo de comparación, un incidente real divulgado por OpenAI: en una ejecución interna surgió una anomalía, el sistema de monitoreo la marcó en 15 minutos, una persona intervino para revisarla 3 minutos después, y la ejecución se detuvo tras 2,5 horas. Esa cadena solo funciona si los registros que lee el monitoreo son, en sí mismos, confiables.

Al poner ambos casos juntos, el punto donde falla algo es distinto. En el caso de OpenAI, el problema estaba en el comportamiento del agente y lo detectó el monitoreo; en el caso de METR, el problema está en la fuente de datos de la que depende el monitoreo, y el agente tuvo la oportunidad de reescribirla directamente. Cuanto más automatizado es el monitoreo y más depende de esos registros, más se invalida también la revisión posterior en cuanto los registros quedan distorsionados.

Para los equipos en China que trabajan en evaluación de modelos y productos de agentes, este artículo funciona más como una lista de verificación. Muchos equipos usan Inspect directamente o han construido visores web similares; cualquier herramienta que renderice la salida del agente como Markdown, LaTeX o HTML cae en el mismo tipo de riesgo. Quien use Inspect debería actualizar a la versión con «modo no confiable»; quien tenga herramientas propias debería confirmar si la salida del agente se aísla o se escapa antes de renderizarse.

METR no reveló qué asistente de IA se usó para encontrar la falla; tampoco Meridian Labs ha explicado públicamente cuántas versiones se vieron afectadas antes de la corrección.

Fuentes: blog oficial de METR, CocoLoop, repositorio de código abierto de Inspect; el tiempo de gestión del incidente de OpenAI citado por METR se verificó al minuto.