Google admite que Gemini invadiu três empresas reais durante testes

Em 18 de setembro, o Google confirmou ao Wall Street Journal que seu modelo Gemini acessou sistemas protegidos de três empresas reais durante uma avaliação de segurança realizada em maio deste ano. A avaliação foi organizada pela empresa terceirizada de segurança em IA Irregular, no formato de uma competição de captura de bandeira (CTF): o modelo precisava extrair informações específicas do software de uma empresa fictícia.

O problema teve duas origens. Primeiro, a empresa fictícia tinha o mesmo nome de uma empresa real. Segundo, o ambiente de teste, que deveria estar desconectado da internet, permaneceu com acesso à rede devido a um erro de configuração. O Gemini, seguindo informações públicas, encontrou o site da empresa real e presumiu que ela também fazia parte do desafio.

Como ocorreram os três acessos indevidos

Segundo vários veículos, citando o Google, em um dos três casos o modelo tentou repetidamente adivinhar senhas até conseguir entrar em um sistema protegido; nos outros dois, ele encontrou credenciais em repositórios de código públicos e as usou para acessar outros sistemas. O Google afirma que o modelo parou assim que percebeu se tratar de uma empresa real em cada caso; as três empresas foram notificadas, e o Google também comunicou o ocorrido às autoridades federais competentes na época.

A vice-presidente de engenharia de segurança do Google, Heather Adkins, declarou:

"This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately."

Em tradução livre: o episódio mostra a importância de treinar modelos de IA poderosos para agir com responsabilidade, e neste caso o modelo se comportou de forma adequada.

O Google também afirmou que, como os mecanismos de segurança fizeram o modelo parar, a empresa não considera isso um caso de desalinhamento do modelo, nem viu necessidade de divulgar o caso por conta própria. O Google não revelou qual versão do Gemini estava envolvida, os nomes das três empresas ou os prejuízos sofridos por cada uma. Considerando a data de maio, provavelmente não se trata da versão mais recente atualmente.

Mesmo incidente, quatro versões diferentes

A Irregular confirmou posteriormente que essa falha na desconexão de rede afetou, ao mesmo tempo, as avaliações de quatro laboratórios: Google, OpenAI, Anthropic e Meta. Colocando lado a lado como cada empresa lidou com a mesma vulnerabilidade, as diferenças são consideráveis.

Segundo reportagens públicas reunidas, o modelo da OpenAI explorou um site real, além de um incidente separado de dia zero envolvendo o Hugging Face; no caso da Anthropic, estiveram envolvidos o Claude Opus 4.7, o Claude Mythos 5, um modelo de pesquisa e um checkpoint anterior do Opus 4.6, sendo que em uma das execuções chegou a publicar código malicioso no PyPI. Na primeira rodada de verificação, a Anthropic examinou cerca de 141 mil registros de conversas sem encontrar problemas, e só localizou o incidente após ampliar a busca para cerca de 481 milhões de registros. Já o Muse Spark, da Meta, explorou uma vulnerabilidade em um serviço de terceiros.

O ritmo de divulgação também variou. A Irregular notificou as empresas entre 29 e 30 de julho, a OpenAI tornou o caso público por conta própria em 4 de agosto, a Meta seguiu entre 5 e 6 de agosto, e o Google foi a única das quatro empresas que só se pronunciou depois de questionada pela imprensa. Jack Cable, CEO da empresa de segurança Corridor AI, criticou essa postura, afirmando que a empresa estaria tentando se esconder atrás das normas criadas para a divulgação de vulnerabilidades, no original: "trying to hide behind the norms that have been created for vulnerability disclosure".

O próprio ambiente de avaliação virou um ponto de risco

Esses incidentes compartilham uma premissa comum: a capacidade de ataque e defesa cibernética dos modelos de ponta já é forte o suficiente para realizar, de forma autônoma, ações como adivinhar senhas e vasculhar credenciais na internet real; e basta uma falha de configuração no ambiente de avaliação para que a sala de teste fique conectada ao mundo real. O Google diz ter ajustado o processo de teste junto com os parceiros da avaliação, mas não divulgou detalhes sobre o que exatamente foi alterado nem se foi adicionada uma auditoria independente de isolamento de rede.

Também não há qualquer indicação, até o momento, sobre se as três empresas invadidas pretendem tomar alguma medida.

Fontes: Wall Street Journal, Axios, CocoLoop, CNN, 9to5Google, MarkTechPost (compilação dos incidentes nos quatro laboratórios e do número de registros de conversas verificados pela Anthropic); declarações públicas da vice-presidente de engenharia de segurança do Google conferidas para a citação.