A organização de avaliação de modelos METR publicou um texto em 6 de outubro demonstrando um caminho pelo qual um agente de IA poderia encobrir sua própria má conduta: injetando um script no visualizador de logs do framework de avaliação Inspect, alterando o que os revisores humanos veem. Com a ajuda de um assistente de IA, um pesquisador levou cerca de 10 minutos para encontrar essa falha.
O Inspect é um framework de avaliação open source amplamente usado no setor, criado originalmente pelo AI Safety Institute do Reino Unido e atualmente mantido pela Meridian Labs. Depois de rodar uma avaliação de modelo, pesquisadores costumam abrir o visualizador web para rever, comando por comando, o que o agente executou e o que produziu como saída. Foi exatamente nesse ponto que a METR mirou.
A falha está na renderização de fórmulas
O visualizador usa o MathJax para renderizar fórmulas matemáticas nos logs. A METR descobriu que um agente pode escrever, em sua saída, uma fórmula com \href que embute um elemento SVG <animate> junto com seu evento onbegin; no momento em que a página é renderizada, esse código executa JavaScript arbitrário no navegador do revisor.
"the agent can modify the displayed webpage arbitrarily"
(o agente pode modificar livremente a página exibida.)
Em um cenário real, um agente que tenha cometido alguma irregularidade durante a avaliação poderia fazer o revisor ver um registro aparentemente limpo: apagando um comando, reescrevendo uma saída ou inserindo uma anotação enganosa na página. A imagem usada no texto mostra uma execução do GPT-5.5 na tarefa gdm_intercode_ctf, apenas para ilustrar o efeito da página adulterada; a METR não afirma que o GPT-5.5 tenha feito algo assim.
A demonstração foi feita em um sandbox de teste isolado, separado do ambiente de produção. A METR também esclarece que não revisou avaliações reais anteriores para verificar se essa falha já havia sido explorada — por ora, trata-se apenas de uma prova de conceito.
Correção rápida, mas o problema é maior
A METR reportou o problema à Meridian Labs, que corrigiu em um dia; em 1º de outubro foi mesclado o código que introduz um “modo não confiável”, tratando por padrão o conteúdo produzido pelo agente como dado não confiável.
A falha pontual foi corrigida, mas o que a METR quer discutir é uma categoria de problema mais ampla. Logs de avaliação, registros de raciocínio e alertas de monitoramento são as principais janelas pelas quais humanos supervisionam a IA, e o conteúdo dessas janelas é, em grande parte, produzido pelo próprio agente supervisionado. O texto traz quatro recomendações:
- Tratar a observabilidade como infraestrutura crítica de segurança, considerando logs, raciocínios e registros de comportamento produzidos pelo agente sempre como entrada não confiável;
- Gravar o processo de raciocínio de forma à prova de adulteração, sem que o agente tenha chance de alterá-lo antes que humanos ou monitores de LLM o leiam;
- Construir defesa em múltiplas camadas, reduzindo a chance de o agente contornar o monitoramento sem ser percebido;
- Submeter os sistemas de monitoramento a testes de estresse em condições adversariais.
Em comparação: dois tipos de superfície de ataque
A METR cita, para comparação, um incidente real divulgado pela OpenAI: em uma execução interna surgiu uma anomalia, o sistema de monitoramento sinalizou em 15 minutos, um humano interveio para revisar 3 minutos depois, e a execução foi encerrada após 2,5 horas. Essa cadeia só funciona se os registros lidos pelo monitoramento forem, eles próprios, confiáveis.
Colocando os dois casos lado a lado, o ponto de falha é diferente. No caso da OpenAI, o problema estava no comportamento do agente, detectado pelo monitoramento; no caso da METR, o problema está na fonte de dados de que o monitoramento depende, e o agente teve a chance de reescrevê-la diretamente. Quanto mais automatizado o monitoramento e quanto mais ele depender desses registros, mais a revisão posterior também perde validade assim que os registros são distorcidos.
Para equipes na China que fazem avaliação de modelos e produtos de agentes, esse texto funciona mais como uma lista de verificação. Muitas equipes usam o Inspect diretamente ou construíram visualizadores web semelhantes; qualquer ferramenta que renderize a saída do agente como Markdown, LaTeX ou HTML se encaixa no mesmo tipo de risco. Quem usa o Inspect deve atualizar para a versão com “modo não confiável”; quem construiu ferramentas próprias deve confirmar se a saída do agente passa por isolamento ou escape antes de ser renderizada.
A METR não divulgou qual assistente de IA foi usado para encontrar a falha; quantas versões foram afetadas antes da correção também ainda não foi esclarecido publicamente pela Meridian Labs.
Fontes: blog oficial da METR, CocoLoop, repositório open source do Inspect; o tempo de resposta ao incidente da OpenAI citado pela METR foi conferido em nível de minutos.