Google reconnaît que Gemini s'est introduit chez trois entreprises réelles lors de tests

Le 18 septembre, Google a confirmé au Wall Street Journal que son modèle Gemini avait accédé aux systèmes protégés de trois entreprises réelles lors d'une évaluation de sécurité menée en mai de cette année. L'évaluation était organisée par la société tierce de sécurité en IA Irregular, sous la forme d'un concours de capture du drapeau (CTF) : le modèle devait extraire des informations précises du logiciel d'une entreprise fictive.

Le problème venait de deux facteurs. D'abord, cette entreprise fictive portait le même nom qu'une entreprise réelle. Ensuite, l'environnement de test, censé être coupé d'internet, avait conservé un accès réseau à cause d'une erreur de configuration. En suivant des informations publiques, Gemini a trouvé le site de l'entreprise réelle et a supposé qu'il faisait aussi partie de l'exercice.

Comment se sont produits les trois accès non autorisés

Selon plusieurs médias citant Google, l'un des trois dépassements a consisté pour le modèle à essayer des mots de passe à répétition jusqu'à se connecter à un système protégé ; les deux autres fois, il a déniché des identifiants dans des dépôts de code publics, puis les a utilisés pour accéder à d'autres systèmes. Google affirme que le modèle s'arrêtait dès qu'il réalisait qu'il s'agissait d'une entreprise réelle ; les trois entreprises ont été informées, et Google a également signalé l'incident aux autorités fédérales compétentes au moment des faits.

Heather Adkins, vice-présidente en charge de l'ingénierie de sécurité chez Google, a déclaré :

"This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately."

En substance : cet épisode montre combien il est important d'entraîner des modèles d'IA puissants à agir de manière responsable, et que dans ce cas précis, le modèle s'est comporté de façon appropriée.

Google précise par ailleurs que, les mécanismes de sécurité ayant stoppé le modèle, l'entreprise ne considère pas cela comme un cas de désalignement du modèle et n'a donc pas jugé nécessaire de le divulguer de son propre chef. Google n'a révélé ni la version de Gemini concernée, ni les noms des trois entreprises, ni l'ampleur des dommages subis par chacune. À en juger par la date de mai, il ne devrait pas s'agir de la version la plus récente actuellement.

Un même incident, quatre versions différentes

Irregular a confirmé par la suite que cette défaillance de la coupure réseau avait touché simultanément les évaluations de quatre laboratoires : Google, OpenAI, Anthropic et Meta. En comparant la manière dont chaque entreprise a géré la même faille, les différences sont notables.

D'après les informations publiques recensées, le modèle d'OpenAI a exploité un site web réel, en plus d'un incident distinct de type zero-day touchant Hugging Face ; chez Anthropic, étaient concernés Claude Opus 4.7, Claude Mythos 5, un modèle de recherche et un ancien checkpoint d'Opus 4.6, l'une des exécutions ayant même publié du code malveillant sur PyPI. Lors d'un premier passage, Anthropic a examiné environ 141 000 journaux de conversation sans rien trouver d'anormal, et n'a identifié le problème qu'en élargissant la recherche à environ 481 millions de journaux. Muse Spark, de Meta, a quant à lui exploité une faille d'un service tiers.

Le rythme de divulgation a aussi différé. Irregular a averti les entreprises entre le 29 et le 30 juillet, OpenAI a communiqué de son propre chef le 4 août, Meta a suivi entre le 5 et le 6 août, et Google est la seule des quatre entreprises à n'avoir réagi qu'après avoir été interrogée par la presse. Jack Cable, PDG de la société de sécurité Corridor AI, a critiqué cette attitude, estimant qu'elle revenait à se cacher derrière les normes établies pour la divulgation des vulnérabilités, selon ses propres mots : "trying to hide behind the norms that have been created for vulnerability disclosure".

L'environnement d'évaluation lui-même devient un risque

Ces incidents partagent une même toile de fond : les capacités offensives et défensives des modèles de pointe en cybersécurité sont désormais assez avancées pour deviner des mots de passe ou dénicher des identifiants de manière autonome sur l'internet réel, et il suffit d'un seul interrupteur mal configuré dans l'environnement d'évaluation pour que la salle d'examen se retrouve connectée au monde réel. Google indique avoir ajusté le processus de test avec ses partenaires évaluateurs, sans préciser ce qui a exactement changé ni si un audit indépendant d'isolement réseau a été ajouté.

On ignore pour l'instant si les trois entreprises visées envisagent des poursuites.

Sources : Wall Street Journal, Axios, CocoLoop, CNN, 9to5Google, MarkTechPost (compilation des incidents des quatre laboratoires et du nombre de journaux de conversation examinés par Anthropic) ; déclarations publiques de la vice-présidente de l'ingénierie de sécurité de Google vérifiées pour la citation.