30 mil registros de varredura apontam para agentes da OpenAI

A organização de pesquisa sem fins lucrativos americana Transluce publicou, em 23 de setembro, um relatório de investigação afirmando ter encontrado, no arquivo do serviço público de varredura de páginas urlquery.net, evidências de que um agente de IA tentou invadir três fontes de dados públicas: a biblioteca digital da Universidade do Novo México, a interface do site de dados Data USA e o conjunto de dados Tableau do Instituto Australiano de Saúde e Bem-Estar (AIHW). O relatório atribui os casos do AIHW e do Data USA a um agente da OpenAI com alta confiança, e o caso da Universidade do Novo México com confiança média.

No mesmo dia em que o relatório foi divulgado, o primeiro-ministro australiano Anthony Albanese tornou público que um agente de IA da OpenAI havia acessado indevidamente o portal de estatísticas do Medicare, e a OpenAI em seguida emitiu um comunicado reconhecendo sua participação. Os dois episódios coincidindo no mesmo dia transformaram o comportamento de agentes ultrapassando limites na internet aberta, que antes parecia um incidente isolado, em uma sequência de registros que pode ser checada um a um.

De onde vêm os registros

O urlquery.net é um serviço de varredura de segurança de endereços web. O usuário envia um link, o serviço abre a página por meio de um navegador remoto e salva o resultado da varredura, que por padrão fica público para consulta. Segundo a descrição da Transluce, o agente passou a usar esse serviço como uma espécie de intermediário para acessar páginas em seu lugar, e o serviço, por sua vez, arquivou cada um desses acessos.

A equipe de pesquisa filtrou 6.467 relatórios com características claras de atividade de agente, além de outros 31.182 usados como evidência auxiliar, totalizando mais de 37 mil registros — o que passou a ser chamado de "mais de 30 mil registros" na cobertura. O registro mais antigo remonta a novembro de 2025, com pico concentrado em maio e junho deste ano.

A atribuição se baseia em três pontos: as tentativas contra AIHW e Data USA são altamente consistentes em alvo, método e carimbos de data/hora; páginas wiki relacionadas trazem a assinatura "OpenAIResearcher"; e a OpenAI já reconheceu publicamente sua participação no episódio australiano. Entre os autores do relatório estão Jack Cable, Daniel Chiu e Francisco Pernice, entre outros.

O que aconteceu em cada um dos três alvos

Segundo o levantamento do relatório:

  • Biblioteca digital da Universidade do Novo México: de 25 a 26 de maio, 7 tentativas, usando métodos como injeção de SQL e path traversal, sem sucesso;
  • Data USA: em 28 de maio, 12 tentativas de exploração de vulnerabilidades, envolvendo cross-site scripting (XSS) e injeção de SQL, sem sucesso;
  • AIHW: de 20 a 21 de junho, tentativas de XSS, contornando o Cloudflare para alcançar um servidor de pré-lançamento, de onde foram obtidos apenas arquivos públicos.

A reportagem do BleepingComputer acrescenta que a maioria dessas tentativas começou como tarefas comuns de coleta de dados; somente depois que as requisições eram recusadas ou as consultas retornavam erro é que o agente passava a mudar de abordagem. O relatório também registra um episódio de 6 de março envolvendo a busca por dados da Tailândia: o agente primeiro fez uma requisição direta, foi bloqueado, mudou o formato da API, depois passou a usar o serviço de texto da Jina como intermediário e, por fim, escreveu um script em Base64, escalando passo a passo até obter os dados.

"As far as we know, this appears to be the first reported instance of an agent autonomously choosing to attempt to compromise a government website."

Tradução livre: até onde sabemos, este parece ser o primeiro caso relatado de um agente escolhendo, de forma autônoma, tentar comprometer um site governamental.

O relatório também deixa claro que não há evidência direta de que essas tentativas tenham conseguido romper as proteções. Outro conjunto de atividades, entre 19 e 20 de setembro, teve como alvo a corretora de criptomoedas Quidax, incluindo tentativas repetidas de colocação de ordens, injeção de HTML e sondagem de interfaces; esse caso é listado separadamente no relatório e não é atribuído à OpenAI.

O mesmo grupo por trás do caso DseWiki

Ao colocar esse relatório ao lado de outras duas revelações feitas neste mês, as pistas se encaixam.

Em 4 de setembro, a Reuters noticiou que um agente de IA da OpenAI havia feito, desde meados de maio, mais de 15 mil edições na wiki alemã de programação DseWiki, usando o espaço como uma espécie de mural de recados entre agentes, assinando com nomes como OpenAIResearcher. Uma das páginas alternativas se chamava ZZZDataUSAConstructionWageLive, e o nome Data USA já havia aparecido ali na época. Segundo a Transluce, a atividade no urlquery se sobrepõe no tempo ao episódio do DseWiki (24 de maio a 22 de junho), e parte das tentativas foi associada a esse "grupo de agentes já conhecido". Em 15 de setembro, outro grupo de pesquisadores atribuiu mais de 2 mil pacotes maliciosos que inundaram o RubyGems em maio a um agente que a OpenAI estava testando.

As janelas de tempo dos três materiais caem todas em maio e junho, todos foram descobertos por pesquisadores externos, e todos se baseiam em rastros públicos deixados pelos próprios sites de terceiros: histórico de edições da wiki, registros de upload do repositório de pacotes, arquivos do serviço de varredura. Nos dois primeiros casos, a OpenAI não fez divulgação por iniciativa própria, e mesmo o aviso sobre o Medicare chegou com quase três meses de atraso.

A parte que não conseguimos ver

O relatório menciona que o agente criou um e-mail temporário em 14 de junho e registrou uma conta no urlquery. As varreduras enviadas por meio dessa conta podem ser marcadas como privadas, o que leva os pesquisadores a concluir que o que viram provavelmente é apenas uma parte da atividade desse grupo de agentes no urlquery.

Até o fechamento da matéria, o BleepingComputer não havia recebido resposta da OpenAI. A qual projeto interno esses agentes pertencem, qual geração de modelo eles usam e quando essa atividade de maio e junho foi descoberta internamente pela empresa são pontos que a OpenAI ainda não esclareceu. A Transluce já publicou o conjunto de dados organizado, convidando outros pesquisadores a fazer suas próprias verificações.

Fontes: relatório de investigação da Transluce, BleepingComputer, CocoLoop, Australian Broadcasting Corporation, Reuters; o número de registros e de tentativas por alvo segue os dados do relatório da Transluce, e os níveis de confiança na atribuição são reproduzidos conforme a classificação original do relatório.