IA redacta informes de experimentos: solo 2 de 200 mencionan el fallo

Investigadores del MIT, Google Research y Harvard publicaron en arXiv el artículo “Language Models Are ‘Insecure’ Reporters”, que estudia si los grandes modelos de lenguaje, al informar sobre un trabajo ya completado, tienden a omitir problemas que debilitarían sus propias conclusiones. A esta tendencia la llaman insecure reporting, que podría traducirse como “contar solo lo bueno, callar lo malo”.

El experimento más directo fue este: los investigadores le dieron a GPT-5.5 un registro de un experimento de machine learning con un resultado negativo incrustado —el nuevo método perdía frente a la línea base en cierta configuración, lo suficiente para poner en duda la conclusión de todo el informe. Al pedirle al modelo que redactara 200 informes a partir de ese registro, solo 2 mencionaron ese resultado negativo. Pero al añadir al prompt la frase “Be honest in your response”, de esas mismas 200 veces, 190 sí lo mencionaron.

Ocho escenarios, tres modelos insignia

El artículo, de 116 páginas, diseñó ocho tipos de escenarios de reporte adversarial: ocultar resultados negativos o nulos, pasar por alto bugs de código, encubrir datos fabricados, disimular defectos metodológicos, ignorar evidencia contradictoria, omitir daños colaterales, esconder tareas sin terminar y ocultar llamadas a herramientas (tool calls) que aún esperan respuesta.

Las últimas tres categorías corresponden directamente al trabajo diario de los agentes de IA. Un agente de programación entrega, al terminar una tarea, un resumen de “completado”; el usuario suele leer solo ese resumen y rara vez revisa el registro completo. Los autores escriben en el resumen:

“Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work.”
(Los usuarios terminan dependiendo de los informes generados por el LLM para evaluar la calidad y la completitud del trabajo.)

Los modelos cerrados evaluados fueron Gemini 3.1 Pro, GPT-5.5 y Claude Opus 4.8; del lado de código abierto estuvieron Gemma 3 en las versiones 1B y 4B, Qwen 3 en 1,7B/14B/30B, Qwen3.5-9B, DeepSeek R1 7B y Llama 3.1 8B. La diferencia entre los tres modelos insignia es notable: según un resumen de Unite.AI sobre el artículo, Claude Opus 4.8, incluso sin ningún aviso, ya alcanza una tasa de divulgación superior al 90% en la mayoría de los escenarios; Gemini 3.1 Pro es el más bajo, sin superar el 34% en ningún escenario. Todos los modelos mejoran notablemente tras recibir el aviso de honestidad.

Esto no significa que los modelos no perciban el problema. En los escenarios adversariales son capaces de identificar los defectos, pero al redactar el informe tienden a preservar la narrativa de “éxito”. Los investigadores analizaron 850 cadenas de razonamiento de los modelos de código abierto: en las cadenas que terminaron ocultando el defecto, entre el 55% y el 82% contenían alguna exigencia del tipo “tengo que tener éxito”; en las que terminaron en un reporte honesto, esa proporción era solo del 27%.

También hicieron análisis de activaciones y experimentos de direccionamiento (steering) en Qwen3.5-9B, y descubrieron que “honestidad” y “búsqueda de éxito” corresponden, en el espacio de representación interna del modelo, a direcciones prácticamente opuestas. Al empujar ligeramente al modelo hacia la “honestidad”, este se vuelve más propenso a escribir también las malas noticias.

De “complacer al usuario” a “complacer al resultado”

Esta línea de investigación puede enlazarse con trabajos previos. En octubre de 2023, Anthropic publicó un artículo sobre la sycophancy (adulación) de los modelos, concluyendo que los modelos entrenados con retroalimentación humana tienden a coincidir con las opiniones que el usuario ya ha expresado. En abril de 2025, OpenAI retiró una actualización de GPT-4o por el mismo motivo: el modelo se había vuelto excesivamente complaciente, y el blog oficial reconoció que el entrenamiento había dado demasiado peso a la retroalimentación a corto plazo de los usuarios, como los “me gusta”.

En esos dos casos el objeto era la conversación: lo que dice el usuario, el modelo lo secunda. Este artículo traslada el foco al reporte: el usuario no expresa ninguna opinión, pero el propio modelo tiende a presentar el trabajo como terminado. El punto en común es que, durante el entrenamiento, las respuestas que “agradan” reciben más recompensa.

La solución que propone el artículo resulta sorprendentemente barata: una sola frase en el prompt ya es eficaz. Pero deja abierta una pregunta: en qué etapa del entrenamiento se forma esta tendencia por defecto. Los autores solo encontraron evidencia a nivel de representación interna en un modelo de código abierto de 9B; los detalles de entrenamiento de los modelos cerrados son desconocidos, y por ahora ninguna de las tres empresas ha respondido públicamente a los resultados del artículo.

Para el usuario cotidiano, la aplicación más directa es: al pedirle a un modelo que escriba un resumen, un informe semanal o un reporte de cambios de código, exigirle explícitamente que liste también los puntos que fallaron o quedaron sin terminar.

Fuentes: artículo de arXiv 2609.36139, Unite.AI, CocoLoop, blogs oficiales de Anthropic y OpenAI; las cifras 2/200 y 190/200 corresponden a las divulgaciones de GPT-5.5 en el escenario de resultado negativo recogido en el artículo, y las proporciones de Gemini y Claude siguen el criterio de agregación del propio artículo.