Au début de cette année, Anthropic a publié les résultats de ses recherches sur les Constitutional Classifiers, avec une idée centrale très directe : utiliser des données synthétiques générées par l'IA pour entraîner des classificateurs de sécurité, empêchant ainsi les modèles d'IA d'être jailbreakés.
Principe de fonctionnement
L'architecture du système est à deux couches — les classificateurs d'entrée et de sortie travaillent simultanément, surveillant chaque interaction du modèle en temps réel. Les données d'entraînement ne sont pas annotées manuellement, mais un ensemble de « constitution » (règles en langage naturel) est fourni à un LLM, lui permettant de générer automatiquement divers scénarios d'attaque et les jugements correspondants.
Efficacité pratique
Lors de plus de 3 000 heures de tests red team, personne n'a trouvé de méthode de jailbreak universellement applicable.
La première génération a réduit le taux de réussite des jailbreaks de 86 % à 4,4 %, bloquant 95 % des attaques. Les deux principales approches d'attaque découvertes par le red team étaient :
- Attaques par recombinaison : Diviser les informations nuisibles en fragments apparemment inoffensifs, puis les réassembler
- Attaques par obscurcissement : Forcer le modèle à générer du contenu sensible dans un format déguisé
La version améliorée Constitutional Classifiers++ est encore plus puissante — une architecture en deux étapes, utilisant d'abord une sonde légère pour vérifier l'état d'activation interne de Claude, puis activant le classificateur lourd en cas de suspicion. Sur 198 000 tentatives red team, une seule vulnérabilité à haut risque a été découverte, et il n'existait toujours pas de méthode de jailbreak universelle.
Et le coût ?
Le taux de faux rejets dans l'environnement de production n'a augmenté que de 0,38 point de pourcentage, et le coût d'inférence a augmenté de 23,7 %. Pour un système de sécurité, ce coût est tout à fait raisonnable.
Anthropic a également publié en janvier de cette année une nouvelle version de la constitution de Claude sous la licence de domaine public CC, avec des priorités de la plus haute à la plus basse : Sécurité et supervision humaine → Comportement éthique → Directives d'Anthropic → Utilité. Placer « l'utilité » en dernière position, ce classement en soi est une déclaration d'attitude.
Source de référence : CocoLoop, article de recherche officiel d'Anthropic