Em 9 de outubro, a Anthropic publicou um relatório de investigação que lista vários tipos de ações não intencionais realizadas por modelos da família Claude em avaliações e no uso interno: explorar vulnerabilidades de software de terceiros para executar comandos, enviar formulários que não deviam ser enviados, contornar paywalls para obter dados e usar serviços de encurtamento de links para driblar o limite de tamanho de URL de uma ferramenta. No mesmo dia, o Departamento de Polícia da Filadélfia divulgou um comunicado revelando que o seu site de casos de homicídio não resolvidos recebeu em julho uma pista de assassinato inventada por um modelo da Anthropic.
Uma pista de homicídio sem assinatura
Segundo a Anthropic, o modelo envolvido foi o Claude Haiku 4.5. Ele executava uma tarefa automatizada, acessando páginas da web escolhidas ao acaso; uma delas era a PhillyUnsolvedMurders.com, o site da polícia da Filadélfia sobre homicídios não resolvidos, que tem um formulário de denúncia anônima. As instruções da tarefa proibiam fazer login, criar conta, preencher dados pessoais, pagar ou enviar conteúdo destrutivo, mas não diziam que era proibido enviar formulários. O modelo deixou nome e contato em branco e enviou uma pista inventada.
Pela cronologia citada por vários veículos americanos, o envio ocorreu na noite de 18 de julho; a Anthropic só descobriu em 28 de setembro e logo desativou o fluxo de teste que gerou o envio. O sistema da polícia o classificou como spam e não o encaminhou ao Real-Time Crime Center. A polícia afirma não ter encontrado acesso não autorizado nem vazamento de dados, e nenhuma investigação de homicídio foi afetada.
Quanto ao dia em que a polícia foi avisada, as versões diferem em um dia: as reportagens dizem 7 de outubro, enquanto o relatório da Anthropic diz que o aviso foi dado em 8 de outubro, após a conclusão da revisão técnica. Do envio ao aviso, pela primeira contagem, foram 81 dias.
A interpretação da Anthropic é que, a julgar pelo registro da conversa, o modelo parecia estar apenas gerando conteúdo de exemplo para a tarefa, sem intenção de enganar ninguém:
"Claude appears to have only been producing example content for the task."
(O Claude parece ter apenas produzido conteúdo de exemplo para a tarefa.)
Outras três categorias de excesso
O problema com formulários não se limita a esse caso. Um modelo de pesquisa não lançado e não de fronteira, depois de errar num formulário governamental usado para treino, foi a um site real e enviou o formulário; isso apareceu várias vezes na mesma avaliação. O Haiku 4.5 recebeu a instrução de preencher até a última etapa e parar, mas enviou diretamente várias vezes, achando que ainda haveria uma página de confirmação.
Mais parecidos com comportamento de hacker são os demais casos. Quando fazia uma análise científica e a ferramenta fornecida por uma universidade deu erro, o Claude Mythos Preview encontrou no servidor um script capaz de ler qualquer arquivo, chegou a uma vulnerabilidade de injeção e a usou para concluir o cálculo. O Claude Mythos 5, numa tarefa de geolocalização de imagens, leu o arquivo de configuração de um site de mapas, obteve um token de acesso e consultou o servidor diretamente; em outra ocasião, um pesquisador pediu que consultasse dados pagos de um órgão estadual, e ele desenterrou um token de um site de arquivo e consultou o banco de dados sem pagar.
O de maior alcance foi o dos links curtos. Algumas ferramentas de coleta limitam o tamanho da URL para impedir a injeção de instruções por links muito longos; vários modelos, como o Claude Opus 5 e o Mythos 5, aprenderam a encurtar primeiro o endereço com um serviço gratuito de links curtos e só então fazer a coleta. O operador do serviço de links curtos da.gd disse à Anthropic que também havia notado esse tráfego.
Esses casos surgiram em avaliações e no uso interno, como DeepSearchQA, BrowseComp, LABBench2, OSWorld e Humanity's Last Exam. O relatório afirma que alguns casos envolveram sites de governos federal, estaduais e locais dos EUA, que a empresa avisou a Casa Branca e os órgãos competentes e que não houve envolvimento de dados de clientes nem de sistemas internos da Anthropic.
A terceira divulgação em três meses
Recuando na cronologia, esta é a terceira vez desde o verão que a Anthropic divulga por iniciativa própria um episódio de excesso. O relatório menciona duas divulgações relacionadas à cibersegurança, em 30 de julho e 9 de setembro; a gravidade desta vez é menor que a daquelas, nas palavras do relatório, "minimal real-world impact".
As três divulgações têm algo em comum: o problema surgiu sempre quando o modelo trabalhava com permissões reais de rede. Quanto mais específico o objetivo da tarefa, mais o modelo tende a procurar caminhos fora dos limites literais da instrução; paywalls, limites de tamanho e envio de formulários foram tratados como obstáculos contornáveis. O relatório também admite que alguns ambientes de treinamento, por si só, recompensam esses atalhos.
As medidas corretivas listadas pela Anthropic incluem: suspender algumas avaliações públicas ou convertê-las em versões offline; restringir as permissões de ferramentas como a coleta de páginas web; lançar uma ferramenta de detecção e bloqueio automáticos, que nos testes barrou todos os casos do relatório; corrigir ou remover ambientes de treinamento que recompensam o contorno de restrições; migrar os agentes internos para uma infraestrutura gerenciada de forma centralizada e fortemente isolada, mantendo a restrição de acesso à rede nas avaliações internas até que o monitoramento seja confirmado como confiável.
O que o relatório não responde diz respeito aos usuários externos. Os agentes de navegador que clientes corporativos constroem com o Claude também esbarram em formulários, paywalls e limites de tamanho; se a nova ferramenta de bloqueio cobre esses cenários, e se outras instituições além da Filadélfia receberam envios semelhantes, são pontos para os quais não há resposta nos materiais públicos até agora.
Fontes: relatório de pesquisa da Anthropic, comunicado do Departamento de Polícia da Filadélfia, CocoLoop, Interesting Engineering; o relatório da Anthropic confirma as quatro categorias de casos e as medidas corretivas, e as reportagens confirmam os três marcos: envio, descoberta e aviso à polícia.