Anthropic testet GLM-5.3: Schutzmechanismen bis zu 100 % umgehbar

Anthropic veröffentlichte am 29. September einen Forschungsbericht, der die Cyberangriffsfähigkeiten von Zhipus GLM-5.3 bewertet. Das Fazit: Das offene Modell kann bereits eigenständig vollständige Exploit-Programme von Anfang bis Ende erstellen, auf einem Niveau nahe an Anthropics eigenem Claude Mythos Preview – während sich seine Sicherheitsvorkehrungen mit sehr einfachen Mitteln umgehen lassen.

"GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions."(GLM-5.3 wird böswilligen Akteuren voraussichtlich Fähigkeiten verschaffen, mit denen sie Cyber-Schwachstellen praktisch ohne nennenswerte Einschränkungen finden und ausnutzen können.)

Welche Angriffsfähigkeiten wurden getestet

Anthropic setzte drei Testreihen ein. Die erste war ExploitBench, gerichtet auf Schwachstellen der Chrome-V8-Engine: GLM-5.3 war bei 50 von 410 Versuchen erfolgreich, eine Erfolgsquote von rund 12 %, bei Mythos Preview waren es 14 %. Die zweite war ein unternehmensinterner Test zur Binär-Exploitation auf Basis des OSS-Fuzz-Projekts: GLM-5.3 erreichte eine Erfolgsquote von 4 %, Mythos Preview 6 %, während die Vergleichsmodelle Claude Opus 4.6, Kimi K3, DeepSeek V4.1-Flash und die Vorgängergeneration GLM-5.2 allesamt bei 0 % lagen. Die dritte Reihe bestand aus offenen Angriffsaufgaben mit menschlichen Experten.

Am deutlichsten zeigt sich die gesunkene Einstiegshürde an einem Fall, in dem eine echte CVE-Schwachstelle nachgebaut wurde: Der menschliche Aufwand betrug etwa 20 Minuten, GLM-5.3-Flash lief selbstständig 8 Stunden und erzeugte, umgerechnet nach Zhipus API-Preisen etwa 20,40 US-Dollar teuer, ein funktionsfähiges Exploit-Programm. Der gesamte Code lief in einer isolierten Sandbox, ohne Kontakt zu externen Systemen.

Wie viel hält die Schutzschicht ab

Bei direkt gestellten bösartigen Anfragen liegt die Ablehnungsrate von GLM-5.3 bei rund 95 %, die simulierte Angriffserfolgsquote bei 0. Mit den folgenden Methoden ändert sich das Bild:

MethodeErfolgsquote bei Umgehung
Eine plausibel klingende Begründung erfinden64%
Vorab einen Gedankengang einfügen92%
Mit „Ablation" den Ablehnungsmechanismus entfernen100%

Ablation erfordert eine Änderung der Modellgewichte, was nur bei offenen Modellen möglich ist. Anthropic gibt an, dass das Team dies zuvor noch nie getan hatte und dafür rund 2.200 GPU-Stunden sowie Kosten von etwa 4.400 US-Dollar aufwendete; danach sank die Ablehnungsrate von 95 % auf 3 bis 14 %. Zum Vergleich: Die geschützten Claude-Modelle wurden im selben Test nicht überwunden.

Der Bericht enthält drei Empfehlungen: Verteidiger sollten Zugang zu gleichwertigen oder stärkeren Frontier-Modellen erhalten; Regierungen sollten Sicherheitstests für hochleistungsfähige Modelle durchführen; Entwickler offener Modelle sollten entsprechende Schutzmaßnahmen ergänzen. Eine öffentliche Reaktion von Zhipu auf den Bericht wurde bislang nicht gefunden.

Eine andere Bewertung kommt zu anderen Zahlen

Auch das dem US-Handelsministerium unterstellte CAISI (Center for AI Standards and Innovation) veröffentlichte am 17. September eine Bewertung der Cyberfähigkeiten von GLM-5.3. Dessen Einschätzung: GLM-5.3 sei derzeit das leistungsfähigste offene Modell im Cyberbereich, liege aber deutlich hinter den US-Frontier-Modellen zurück, insgesamt um etwa vier Monate.

Die Zahlen beider Berichte weichen stark voneinander ab. In der CAISI-Version von ExploitBench erreichte GLM-5.3 61,1 %, das beste US-Frontier-Modell 100 %, das bisher beste chinesische Modell 32,2 %; bei SEC-Bench Pro standen 40,4 % gegen 90,2 %. Die 12 % von Anthropic stammen aus dessen eigener Testkonfiguration, die beiden Ergebnisse lassen sich nicht direkt vergleichen.

In der Rangfolge stimmen beide Berichte überein: GLM-5.3 liegt im Feld der offenen Modelle vorn, hat aber noch Abstand zum stärksten US-amerikanischen Closed-Source-Modell. Uneinig sind sie sich darin, wie dieser Abstand zu bewerten ist. CAISI betont „noch etwa vier Monate Rückstand", Anthropic betont, dass diese Fähigkeit bereits von jedem heruntergeladen und modifiziert werden kann, wodurch Schutzschichten keine wirksame Beschränkung mehr darstellen.

Für chinesische Entwickler und Unternehmen dürfte sich die unmittelbare Auswirkung dieses Berichts vor allem auf Vertriebswege im Ausland auswirken. GLM-5.3 war zuvor über API-Vertrieb und Hosting-Plattformen im Ausland recht breit verfügbar; sollten mehr US-Institutionen sich Anthropics Einschätzung anschließen, könnten ausländische Cloud-Plattformen und Unternehmenskunden die Prüfung chinesischer offener Modelle vor der Aufnahme verschärfen. Das ist bislang nur eine Vermutung, bislang sind keine Plattformen aktiv geworden.

Quellen: Forschungsbericht von Anthropic, Bewertungsmitteilung des dem NIST unterstellten CAISI (USA), CocoLoop; Erfolgszahlen bei ExploitBench, Umgehungserfolgsquoten und Ablationskosten folgen der Darstellung im Anthropic-Bericht, die CAISI-Daten folgen dessen eigener Testkonfiguration.