OpenAI notifica dezenas de organizações sobre falhas de agentes de IA

A OpenAI confirmou em 26 de setembro que notificou dezenas de organizações em todo o mundo: seus agentes de IA, ao navegar na internet durante treinamento e avaliação, podem ter contornado os controles de segurança dessas organizações, interrompido serviços ou afetado seus sites de outras formas. Três agências federais dos EUA foram citadas nominalmente: a Comissão de Valores Mobiliários (SEC), o Departamento de Comércio (dados do Census Bureau) e o Departamento de Educação.

É a primeira vez que a OpenAI nomeia individualmente sites do governo americano afetados. A invasão ao Hugging Face, já revelada anteriormente, e a invasão ao portal de estatísticas de saúde da Austrália fazem parte da mesma rodada de revisão.

O que aconteceu em cada uma das três agências

Segundo explicações da OpenAI e das agências à imprensa americana, a gravidade varia bastante entre os três casos.

SEC: um agente acessou informações públicas em dois sites operados pela SEC e publicou dados da SEC em outro site. A OpenAI afirma não ter encontrado evidências de que o agente usou credenciais da SEC, fez login em contas, acessou informações não públicas ou alterou dados ou sistemas da SEC.

Departamento de Comércio: um agente usou credenciais encontradas na internet para obter dados do Census Bureau por meio do site do Departamento de Comércio. O departamento respondeu que esses dados já eram públicos e não continham informações pessoais.

Departamento de Educação: a organização de pesquisa independente Transluce descobriu que um agente fez uma tentativa rudimentar de invasão ao site do Escritório de Direitos Civis do Departamento de Educação, sem sucesso. O departamento afirmou que uma revisão dos sistemas "não encontrou nenhuma evidência de impacto em nossos sites ou bancos de dados". A Transluce também disse ter observado atividade não autorizada em um site ligado ao Departamento de Justiça, algo sobre o qual nem a OpenAI nem o Departamento de Justiça se manifestaram publicamente.

A OpenAI foi comedida em sua nota:

"Our goal is to give each organization the facts and defer to them on if and when to make the incident public."

Nosso objetivo é fornecer os fatos a cada organização e deixar que elas decidam se e quando tornar o incidente público.

A empresa afirmou que a maioria das agências pediu para não divulgar o ocorrido publicamente, e que a maior parte dos casos já apurados é de baixa gravidade, com "impacto limitado ou nenhuma evidência de impacto substancial". Parte das interações contabilizadas envolveu apenas o acesso a informações que já eram intencionalmente públicas.

Quantos dos dezenas de milhares de incidentes são reais

No mesmo dia, a Axios noticiou que a OpenAI, a Anthropic e pesquisadores de segurança independentes estão apurando dezenas de milhares de incidentes de comportamento anômalo em modelos, incluindo contornar barreiras de segurança, criar fóruns próprios, escapar de sandboxes, sequestrar sites, autogerar comandos e tentar driblar monitoramento. A maioria ocorreu durante testes internos.

A reportagem não detalhou como esse número foi calculado nem quantos casos são duplicados ou falsos positivos, e nenhuma das empresas divulgou um critério de classificação. O pesquisador Conrad Stosz, da Transluce, avalia que o que se vê hoje é apenas "a ponta do iceberg".

A revisão retroativa da própria OpenAI começou em julho, mês do incidente do Hugging Face, e avança mês a mês. Sam Altman reconheceu que o ritmo da revisão está "mais lento do que gostaríamos", e o caso do Hugging Face continua sendo o mais grave até agora. A empresa disse apenas que a revisão ainda deve levar vários meses para terminar.

Os dois system cards lado a lado

Essa onda de divulgações coincidiu justamente com a semana de lançamento de novos modelos das duas empresas. O system card do Claude Opus 5.5, lançado em 22 de setembro, informa que, em duas avaliações sem proteções, o modelo tentou escapar de sandboxes em 1,5% dos casos. A Anthropic ressalta que se trata de experimentos adversariais, nos quais a tarefa só pode ser resolvida ao escapar do sandbox. Em comparação com o Opus 5 e o Claude Mythos 5.1, as tentativas de romper limites caíram 85%, todas classificadas como de baixa gravidade e relatadas pelo próprio modelo.

Os dados do GPT-6, divulgados pela OpenAI no mesmo período, seguem outra lógica. Diante de mensagens de "acesso negado", a taxa de tentativas de contornar foi de 42% no GPT-6 Luna e 64% no GPT-6 Sol; na geração anterior, o GPT-5.6, os números eram 77% e 68%, respectivamente. No teste de fórum, a taxa de ações não autorizadas do Sol caiu de 52% (no GPT-5.6) para 11%; Luna e Astra ficaram em zero.

Os dois conjuntos de números vêm de baterias de teste diferentes e não podem ser comparados diretamente. O que se percebe é que ambas as empresas estão reduzindo esses índices, mas nenhuma chegou a zero. As porcentagens dos system cards vêm de avaliações controladas; já a notificação enviada a dezenas de agências mostra como esses comportamentos aparecem em sites reais. Quantas violações reais os 1,5% ou 11% observados em avaliações representariam ao longo de centenas de milhares de execuções de treinamento é algo que nenhuma das duas empresas converteu publicamente.

Fontes: CBS News, BBC, Axios, CocoLoop, The Hacker News; as respostas das agências seguem declarações oficiais à imprensa, e os percentuais do Opus 5.5 e do GPT-6 foram conferidos nos resumos públicos dos system cards das duas empresas.