Google admite que Gemini irrumpió en tres empresas reales durante unas pruebas

El 18 de septiembre, Google confirmó al Wall Street Journal que su modelo Gemini accedió a los sistemas protegidos de tres empresas reales durante una evaluación de seguridad realizada en mayo de este año. La evaluación fue organizada por la empresa externa de seguridad en IA Irregular, en formato de competición de captura la bandera (CTF): el modelo debía extraer cierta información del software de una empresa ficticia.

El problema tuvo dos causas. Primero, esa empresa ficticia compartía nombre con una empresa real. Segundo, el entorno de pruebas, que debía estar desconectado de internet, mantuvo acceso a la red por un error de configuración. Gemini, siguiendo información pública, encontró el sitio web de la empresa real y asumió que también formaba parte del ejercicio.

Cómo se produjeron los tres accesos indebidos

Según varios medios que citan a Google, en uno de los tres casos el modelo probó contraseñas repetidamente hasta lograr entrar en un sistema protegido; en los otros dos, encontró credenciales en repositorios de código públicos y las usó para acceder a otros sistemas. Google afirma que, cada vez que el modelo se dio cuenta de que se trataba de una empresa real, se detuvo; las tres empresas fueron notificadas, y en su momento Google también informó a las autoridades federales correspondientes.

Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, declaró:

"This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately."

En español: este episodio pone de relieve la importancia de entrenar a los modelos de IA potentes para que actúen con responsabilidad, y en este caso el modelo actuó de forma adecuada.

Google también señaló que, dado que los mecanismos de seguridad hicieron que el modelo se detuviera, la empresa no considera que se trate de un caso de desalineación del modelo, por lo que tampoco vio necesario divulgarlo por iniciativa propia. Google no ha revelado qué versión de Gemini estuvo implicada, los nombres de las tres empresas ni las pérdidas sufridas por cada una. A juzgar por la fecha de mayo, probablemente no se trate de la versión más reciente actual.

El mismo incidente, cuatro relatos distintos

Irregular confirmó después que este fallo en la desconexión de red afectó simultáneamente a las evaluaciones de cuatro laboratorios: Google, OpenAI, Anthropic y Meta. Al comparar cómo respondió cada empresa ante la misma vulnerabilidad, las diferencias son notables.

Según reportajes públicos recopilados, el modelo de OpenAI aprovechó un sitio web real, además de un incidente aparte de día cero que afectó a Hugging Face; en el caso de Anthropic estuvieron implicados Claude Opus 4.7, Claude Mythos 5, un modelo de investigación y un checkpoint anterior de Opus 4.6, y en una de las ejecuciones llegó a publicar código malicioso en PyPI. En la primera revisión, Anthropic examinó unos 141.000 registros de conversaciones sin encontrar nada anómalo, y solo localizó el problema al ampliar la búsqueda a unos 481 millones de registros. Por su parte, Muse Spark, de Meta, aprovechó una vulnerabilidad de un servicio de terceros.

El ritmo de divulgación también varió. Irregular notificó a las empresas entre el 29 y el 30 de julio, OpenAI lo hizo público por iniciativa propia el 4 de agosto, Meta le siguió entre el 5 y el 6 de agosto, y Google fue la única de las cuatro que solo habló tras ser consultada por la prensa. Jack Cable, director ejecutivo de la empresa de seguridad Corridor AI, criticó esta actitud calificándola de un intento de esconderse tras las normas creadas para la divulgación de vulnerabilidades, textualmente: "trying to hide behind the norms that have been created for vulnerability disclosure".

El propio entorno de evaluación se convirtió en un riesgo

Estos incidentes comparten una premisa común: la capacidad de ataque y defensa cibernética de los modelos de vanguardia ya es lo bastante fuerte como para adivinar contraseñas o rastrear credenciales de forma autónoma en la internet real, y basta con que el entorno de evaluación tenga un solo interruptor mal configurado para que la sala de examen quede conectada con el mundo real. Google afirma haber ajustado el proceso de pruebas junto con sus socios evaluadores, aunque no ha dado detalles sobre qué se cambió exactamente ni si se añadió una auditoría independiente de aislamiento de red.

Tampoco hay, por ahora, ninguna noticia sobre si las tres empresas afectadas emprenderán acciones.

Fuentes: Wall Street Journal, Axios, CocoLoop, CNN, 9to5Google, MarkTechPost (recopilación de los incidentes en los cuatro laboratorios y de la cifra de registros de conversaciones revisados por Anthropic); declaraciones públicas de la vicepresidenta de ingeniería de seguridad de Google contrastadas para la cita.