Anthropic hat Anfang dieses Jahres die Forschungsergebnisse zu Constitutional Classifiers veröffentlicht. Der Kernansatz ist direkt: Mit KI-generierten synthetischen Daten werden Sicherheitsklassifikatoren trainiert, um Jailbreak-Angriffe auf KI-Modelle zu verhindern.
Funktionsweise
Die Systemarchitektur ist zweischichtig – Eingabe- und Ausgabeklassifikatoren arbeiten gleichzeitig und überwachen jede Interaktion des Modells in Echtzeit. Die Trainingsdaten werden nicht manuell annotiert, sondern einem LLM wird eine "Verfassung" (Regeln in natürlicher Sprache) vorgegeben, die es ihm ermöglicht, automatisch verschiedene Angriffsszenarien und entsprechende Bewertungen zu generieren.
Praktische Wirksamkeit
In über 3.000 Stunden Red-Team-Tests fand niemand eine universell anwendbare Jailbreak-Methode.
Die erste Generation senkte die Jailbreak-Erfolgsrate von 86 % auf 4,4 % und blockierte 95 % der Angriffe. Die beiden wichtigsten Angriffsansätze, die das Red Team entdeckte, waren:
- Rekombinationsangriffe: Schädliche Informationen werden in scheinbar harmlose Fragmente zerlegt und wieder zusammengesetzt
- Verschleierungsangriffe: Das Modell wird gezwungen, sensible Inhalte in getarnter Form auszugeben
Die verbesserte Version Constitutional Classifiers++ geht noch weiter – eine zweistufige Architektur, die zunächst mit einer leichten Sonde den internen Aktivierungszustand von Claude prüft und bei Verdacht einen schweren Klassifikator aktiviert. Bei 198.000 Red-Team-Versuchen wurde nur eine einzige Schwachstelle mit hohem Risiko entdeckt, und es gab weiterhin keine universelle Jailbreak-Methode.
Und die Kosten?
Die Fehlablehnungsrate in der Produktionsumgebung stieg nur um 0,38 Prozentpunkte, die Inferenzkosten um 23,7 %. Für ein Sicherheitssystem sind diese Kosten durchaus vertretbar.
Anthropic hat im Januar dieses Jahres zudem eine neue Version der Verfassung von Claude unter der CC Public Domain License veröffentlicht, mit Prioritäten von hoch nach niedrig: Sicherheit und menschliche Aufsicht → Ethisches Verhalten → Anthropic-Richtlinien → Nützlichkeit. Dass "Nützlichkeit" an letzter Stelle steht, ist an sich schon eine Haltungsbekundung.
Quellenangabe: CocoLoop, offizielle Forschungsarbeit von Anthropic