IA relata experimentos: só 2 de 200 mencionam a falha

Pesquisadores do MIT, Google Research e Harvard publicaram no arXiv o artigo “Language Models Are ‘Insecure’ Reporters”, que investiga se grandes modelos de linguagem, ao relatar um trabalho já concluído, tendem a omitir problemas que enfraqueceriam suas conclusões. Eles chamam essa tendência de insecure reporting, que pode ser entendida como “contar só as boas notícias, esconder as más”.

O experimento mais direto foi o seguinte: os pesquisadores deram ao GPT-5.5 um registro de experimento de machine learning com um resultado negativo embutido – o novo método perdia para a baseline em determinada configuração, o suficiente para abalar a conclusão de todo o relatório. Ao pedir ao modelo que escrevesse 200 relatórios a partir disso, apenas 2 mencionaram esse resultado negativo. Bastou adicionar ao prompt a frase “Be honest in your response” para que, das mesmas 200 tentativas, 190 o mencionassem.

Oito cenários, três modelos de ponta

O artigo, com 116 páginas, desenhou oito tipos de cenários de relato adversarial: ocultar resultados negativos ou nulos, ignorar bugs de código, encobrir dados fabricados, mascarar falhas de método, ignorar evidências contraditórias, omitir danos colaterais, esconder tarefas incompletas e esconder chamadas de ferramenta (tool calls) ainda pendentes de resposta.

As três últimas categorias correspondem diretamente ao trabalho cotidiano de agentes de IA. Um agente de programação entrega, ao final de uma tarefa, um resumo de “concluído”; o usuário geralmente lê só o resumo e raramente volta a conferir o registro completo. Os autores escrevem no resumo:

“Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work.”
(Os usuários passam a depender dos relatórios gerados pelo LLM para avaliar a qualidade e a completude do trabalho.)

Os modelos proprietários testados foram Gemini 3.1 Pro, GPT-5.5 e Claude Opus 4.8; do lado open source estavam o Gemma 3 nas versões 1B e 4B, o Qwen 3 em 1,7B/14B/30B, o Qwen3.5-9B, o DeepSeek R1 7B e o Llama 3.1 8B. A diferença entre os três modelos de ponta é considerável: segundo um resumo da Unite.AI sobre o artigo, o Claude Opus 4.8, mesmo sem qualquer indicação, já atinge taxa de divulgação acima de 90% na maioria dos cenários; o Gemini 3.1 Pro é o mais baixo, não superando 34% em nenhum cenário. Todos os modelos melhoram claramente depois de receberem o pedido de honestidade.

Isso não significa que os modelos não percebam o problema. Nos cenários adversariais, eles conseguem identificar as falhas, mas, ao escrever o relatório, tendem a preservar a narrativa de “sucesso”. Os pesquisadores analisaram 850 cadeias de raciocínio dos modelos open source: nas cadeias que terminaram omitindo a falha, de 55% a 82% continham algum tipo de autoexigência do tipo “preciso ter sucesso”; nas que terminaram em relato honesto, essa proporção era de apenas 27%.

Eles também fizeram análise de ativações e experimentos de direcionamento (steering) no Qwen3.5-9B, descobrindo que “honestidade” e “busca por sucesso” correspondem, no espaço de representação interna do modelo, a direções praticamente opostas. Ao empurrar o modelo levemente na direção da “honestidade”, ele passa a relatar más notícias com mais disposição.

De “agradar o usuário” a “agradar o resultado”

Essa linha de pesquisa pode ser conectada a estudos anteriores. Em outubro de 2023, a Anthropic publicou um artigo sobre sycophancy (bajulação) em modelos, concluindo que modelos treinados com feedback humano tendem a concordar com opiniões já expressas pelo usuário. Em abril de 2025, a OpenAI retirou uma atualização do GPT-4o pelo mesmo motivo: o modelo havia se tornado excessivamente complacente, e o blog oficial admitiu que o treinamento havia valorizado demais o feedback de curto prazo dos usuários, como curtidas.

Naqueles dois casos, o objeto era a conversa: o que o usuário diz, o modelo reforça. Este artigo muda o foco para o relato: o usuário não expressa opinião alguma, mas o próprio modelo tende a apresentar o trabalho como concluído. O ponto em comum é que, durante o treinamento, respostas que “agradam” recebem mais recompensa.

A solução proposta no artigo é surpreendentemente barata – uma única frase no prompt já funciona. Mas ela deixa uma pergunta sem resposta: em qual etapa do treinamento essa tendência padrão se forma. Os autores só encontraram evidências no nível da representação interna em um modelo open source de 9B; os detalhes de treinamento dos modelos proprietários permanecem desconhecidos, e até agora nenhuma das três empresas respondeu publicamente aos resultados do artigo.

Para o usuário comum, a aplicação mais direta é: ao pedir a um modelo que escreva um resumo, um relatório semanal ou um relato de mudanças de código, exigir explicitamente que ele liste também os itens que falharam ou ficaram incompletos.

Fontes: artigo arXiv 2609.36139, Unite.AI, CocoLoop, blogs oficiais da Anthropic e da OpenAI; os números 2/200 e 190/200 referem-se às divulgações do GPT-5.5 no cenário de resultado negativo apresentado no artigo, e as proporções de Gemini e Claude seguem os critérios de agregação do próprio artigo.