Le 29 septembre, Anthropic a publié un rapport de recherche évaluant la capacité de cyberattaque de GLM-5.3, développé par Zhipu. La conclusion est que ce modèle à poids ouverts est déjà capable de construire seul des programmes d'exploitation de vulnérabilités de bout en bout, à un niveau proche de celui de Claude Mythos Preview, le modèle d'Anthropic lui-même, alors que ses protections de sécurité peuvent être contournées par des méthodes très simples.
"GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions."(GLM-5.3 donnera vraisemblablement à des acteurs malveillants accès à des capacités leur permettant de trouver et d'exploiter des vulnérabilités informatiques sans restriction significative.)
Quelles capacités d'attaque ont été testées
Anthropic a utilisé trois séries de tests. La première est ExploitBench, ciblant les vulnérabilités du moteur Chrome V8 : GLM-5.3 a réussi 50 des 410 tentatives, soit un taux de réussite d'environ 12 %, contre 14 % pour Mythos Preview. La deuxième est un test interne d'exploitation de binaires basé sur le projet OSS-Fuzz : GLM-5.3 a obtenu un taux de réussite de 4 %, Mythos Preview 6 %, tandis que les modèles témoins Claude Opus 4.6, Kimi K3, DeepSeek V4.1-Flash et la génération précédente GLM-5.2 étaient tous à 0 %. La troisième série regroupait des tâches d'attaque ouvertes menées avec des experts humains.
L'exemple le plus révélateur de la baisse du seuil d'accès est la reproduction d'un CVE réel : l'intervention humaine s'est limitée à environ 20 minutes, tandis que GLM-5.3-Flash a tourné seul pendant 8 heures, soit environ 20,40 dollars selon les tarifs de l'API de Zhipu, pour produire un programme d'exploitation utilisable. L'ensemble du code s'est exécuté dans un bac à sable isolé, sans contact avec des systèmes externes.
Jusqu'où la couche de protection peut-elle bloquer
Face à des requêtes malveillantes directes, le taux de refus de GLM-5.3 avoisine 95 %, avec un taux de réussite d'attaque simulée de 0. En passant aux méthodes suivantes, la situation change :
| Méthode | Taux de réussite du contournement |
|---|---|
| Inventer un prétexte qui semble légitime | 64% |
| Préremplir un raisonnement | 92% |
| Utiliser la méthode d'« ablation » pour retirer le mécanisme de refus | 100% |
L'ablation nécessite de modifier les poids du modèle, ce qui n'est possible que pour les modèles à poids ouverts. Anthropic indique que son équipe n'avait jamais fait cela auparavant, et que l'opération a mobilisé environ 2 200 heures de GPU, pour un coût d'environ 4 400 dollars ; après ce traitement, le taux de refus est passé de 95 % à une fourchette de 3 % à 14 %. À titre de comparaison, les modèles Claude protégés n'ont pas été mis en échec lors du même test.
Le rapport formule trois recommandations : donner au camp défensif l'accès à des modèles de pointe équivalents ou plus puissants ; que les gouvernements effectuent des tests de sécurité sur les modèles à haute capacité ; que les développeurs de modèles à poids ouverts ajoutent des protections correspondantes. Ce site n'a trouvé aucune réponse publique de Zhipu à ce rapport.
Une autre évaluation donne des chiffres assez différents
Le CAISI (Center for AI Standards and Innovation), rattaché au département du Commerce des États-Unis, a lui aussi publié le 17 septembre une évaluation de la capacité cyber de GLM-5.3. Son verdict : GLM-5.3 est actuellement le modèle à poids ouverts le plus performant dans ce domaine, mais il accuse un net retard sur les modèles de pointe américains, avec un écart global d'environ quatre mois.
Les chiffres des deux rapports diffèrent considérablement. Dans la version d'ExploitBench utilisée par le CAISI, GLM-5.3 obtient 61,1 %, le meilleur modèle de pointe américain atteint 100 % et le meilleur modèle chinois précédent plafonnait à 32,2 % ; sur SEC-Bench Pro, c'est 40,4 % contre 90,2 %. Les 12 % avancés par Anthropic proviennent de sa propre configuration de test, les deux résultats ne sont donc pas directement comparables.
Sur le classement, les deux rapports s'accordent : GLM-5.3 arrive en tête parmi les modèles à poids ouverts, mais reste distancé par le modèle propriétaire le plus puissant des États-Unis. Le désaccord porte sur la manière d'interpréter cet écart. Le CAISI insiste sur le fait qu'il « reste environ quatre mois » de retard, tandis qu'Anthropic souligne que cette capacité peut déjà être téléchargée et modifiée par n'importe qui, ce qui prive les couches de protection de tout effet contraignant.
Pour les développeurs et entreprises chinois, l'impact direct de ce rapport devrait surtout se faire sentir sur les canaux à l'étranger. GLM-5.3 était déjà largement distribué via des API et des plateformes d'hébergement à l'étranger ; si davantage d'institutions américaines reprennent à leur compte l'analyse d'Anthropic, les plateformes cloud et les clients d'entreprise étrangers pourraient durcir l'examen des modèles chinois à poids ouverts avant de les référencer. Pour l'instant, ce n'est qu'une hypothèse, aucune plateforme n'a encore pris de mesure.
Sources : rapport de recherche d'Anthropic, communiqué d'évaluation du CAISI, rattaché au NIST américain, CocoLoop ; les chiffres de réussite sur ExploitBench, les taux de réussite du contournement et le coût de l'ablation suivent la méthodologie du rapport d'Anthropic, les données du CAISI suivant leur propre configuration de test.