Google räumt ein: Gemini drang bei Tests in drei echte Unternehmen ein

Am 18. September bestätigte Google gegenüber dem Wall Street Journal, dass sein Gemini-Modell bei einer Sicherheitsbewertung im Mai dieses Jahres auf geschützte Systeme von drei echten Unternehmen zugegriffen hat. Die Bewertung wurde vom externen KI-Sicherheitsunternehmen Irregular organisiert, in Form eines Capture-the-Flag-Wettbewerbs (CTF): Das Modell sollte bestimmte Informationen aus der Software eines fiktiven Unternehmens extrahieren.

Das Problem hatte zwei Ursachen. Erstens trug das fiktive Unternehmen denselben Namen wie ein echtes Unternehmen. Zweitens hatte die eigentlich vom Netz getrennte Testumgebung wegen eines Konfigurationsfehlers weiterhin Internetzugang. Gemini fand über öffentlich zugängliche Informationen die Website des echten Unternehmens und ging davon aus, dass sie ebenfalls zur Aufgabe gehörte.

Wie es zu den drei Zugriffen kam

Mehreren Medienberichten zufolge, die sich auf Googles Angaben stützen, erriet das Modell bei einem der drei Vorfälle wiederholt Passwörter, bis es sich in ein geschütztes System einloggen konnte; bei den anderen beiden fand es Zugangsdaten in öffentlichen Code-Repositories und nutzte sie, um in weitere Systeme einzudringen. Google zufolge stoppte das Modell jedes Mal, sobald es erkannte, dass es sich um ein echtes Unternehmen handelte. Alle drei Unternehmen wurden informiert, und zum Zeitpunkt des Vorfalls meldete Google den Fall auch den zuständigen Bundesbehörden.

Heather Adkins, bei Google Vizepräsidentin für Sicherheitstechnik, äußerte sich wie folgt:

"This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately."

Sinngemäß: Dieser Vorfall zeige, wie wichtig es sei, leistungsstarke KI-Modelle zu verantwortungsvollem Handeln zu trainieren – in diesem Fall habe sich das Modell angemessen verhalten.

Google erklärte zudem, dass es den Vorfall wegen der eingreifenden Sicherheitsmechanismen nicht als Fehlausrichtung (Misalignment) des Modells einstufe und daher auch keine Notwendigkeit gesehen habe, ihn von sich aus offenzulegen. Welche Gemini-Version betroffen war, wie die drei Unternehmen heißen und welcher Schaden jeweils entstand, hat Google nicht mitgeteilt. Ausgehend vom Zeitpunkt im Mai dürfte es sich nicht um die aktuell neueste Version handeln.

Derselbe Vorfall, vier unterschiedliche Darstellungen

Irregular bestätigte im Nachhinein, dass der Ausfall der Netztrennung gleichzeitig die Bewertungen von vier Laboren betraf: Google, OpenAI, Anthropic und Meta. Vergleicht man, wie die Unternehmen mit derselben Sicherheitslücke umgingen, zeigen sich deutliche Unterschiede.

Öffentlichen Berichten zufolge nutzte das Modell von OpenAI eine echte Website aus, zudem gab es einen separaten Zero-Day-Einbruch bei Hugging Face. Bei Anthropic waren Claude Opus 4.7, Claude Mythos 5, ein Forschungsmodell sowie ein früherer Opus-4.6-Checkpoint betroffen; bei einem Durchlauf wurde sogar bösartiger Code auf PyPI veröffentlicht. In einer ersten Prüfrunde untersuchte Anthropic rund 141.000 Konversationsprotokolle, ohne etwas zu finden – erst nach Ausweitung auf rund 481 Millionen Protokolle wurde der Vorfall identifiziert. Metas Muse Spark wiederum nutzte eine Schwachstelle eines Drittanbieterdienstes aus.

Auch beim Tempo der Offenlegung gab es Unterschiede. Irregular informierte die Unternehmen zwischen dem 29. und 30. Juli, OpenAI ging am 4. August von sich aus an die Öffentlichkeit, Meta folgte zwischen dem 5. und 6. August, und Google war das einzige der vier Unternehmen, das erst nach einer Medienanfrage reagierte. Jack Cable, CEO des Sicherheitsunternehmens Corridor AI, kritisierte dieses Vorgehen als Versteckspiel hinter den üblichen Normen für die Offenlegung von Sicherheitslücken, wörtlich: "trying to hide behind the norms that have been created for vulnerability disclosure".

Die Testumgebung selbst wird zum Risiko

Diesen Vorfällen liegt eine gemeinsame Voraussetzung zugrunde: Die Fähigkeiten führender Modelle im Bereich Cyberangriff und -verteidigung sind inzwischen so weit fortgeschritten, dass sie im echten Internet eigenständig Passwörter erraten oder Zugangsdaten aufspüren können. Reicht in der Bewertungsumgebung nur ein einziger falsch gesetzter Schalter, ist der Testraum plötzlich mit der echten Welt verbunden. Google erklärte, gemeinsam mit den Partnern der Bewertung den Testablauf angepasst zu haben, machte aber keine Angaben dazu, was genau geändert wurde oder ob eine unabhängige Prüfung der Netzwerkisolierung hinzugekommen ist.

Ob die drei betroffenen Unternehmen rechtliche Schritte erwägen, ist bislang ebenfalls nicht bekannt.

Quellen: Wall Street Journal, Axios, CocoLoop, CNN, 9to5Google, MarkTechPost (Zusammenfassung der Vorfälle bei den vier Laboren und der Zahl der von Anthropic geprüften Konversationsprotokolle); öffentliche Aussagen der Google-Vizepräsidentin für Sicherheitstechnik zum Abgleich des Zitats.