Reasoning-Modelle als Hacker: 97 % Erfolgsquote beim Umgehen von KI-Sicherheitsvorkehrungen

Ein in Nature Communications veröffentlichter Artikel sorgt derzeit für Aufsehen in der KI-Sicherheitscommunity.

Forscher der Universität Stuttgart und des ELLIS Alicante Instituts haben ein einfaches Experiment durchgeführt: Sie ließen ein großes Reasoning-Modell ein anderes großes Modell angreifen, um zu sehen, ob es dessen Sicherheitsvorkehrungen überwinden kann. Das Ergebnis ist alarmierend — eine Gesamterfolgsquote von 97,14 % bei 25.200 Tests, fast alle Durchbrüche.

Angreifer und Ziele

In dem Experiment wurden 4 Reasoning-Modelle (LRM) als Angreifer eingesetzt:

  • DeepSeek-R1
  • Gemini 2.5 Flash
  • Grok 3 Mini
  • Qwen3 235B

Es gab 9 angegriffene Opfer, darunter GPT-4o, DeepSeek-V3, Llama 3.1 70B, o4-mini und Claude 4 Sonnet.

Die Angriffsmethode war denkbar einfach: Dem Angreifermodell wurde ein System-Prompt gegeben, der es anwies, die Einschränkungen des KI-Ziels zu überwinden, und dann wurde es losgelassen. Der Angreifer plante selbstständig seine Strategie, initiierte eigene mehrrundige Dialoge und passte seine Formulierungen selbst an — der gesamte Prozess erforderte keinen menschlichen Eingriff.

Die Tests umfassten 70 schädliche Anfragen, unterteilt in 7 Kategorien: Gewalt, Cyberkriminalität, illegale Aktivitäten, Drogen, Selbstverletzung, Vergiftung und Waffen.

Warum ist die Erfolgsquote so hoch?

Die Forscher analysierten die von den Angreifermodellen verwendeten Taktiken und fanden die häufigsten:

Taktik Häufigkeit der Anwendung
Schmeichelei und Aufbau einer Vertrauensbeziehung 84,75 %
Verkleidung von Anfragen als Bildung/Forschung 68,56 %
Verwendung hypothetischer Szenarien zur Umgehung von Beschränkungen 65,67 %
Häufung von Fachbegriffen zur Verwirrung des Modells 44,42 %

Einfach ausgedrückt: Sie wenden die gleichen Methoden an, die Menschen bei sozialer Manipulation verwenden. Freundliche Worte, Annäherung, dann die Behauptung, man forsche nur oder nehme an, jemand brauche diese Informationen ... Die Trainingsdaten großer Modelle enthalten zahlreiche menschliche Interaktionen, und diese Worte wirken auf sie ähnlich wie auf Menschen.

Wer ist am verwundbarsten, wer am widerstandsfähigsten?

Das schlechteste Ergebnis erzielte DeepSeek-V3: höchste Schadensausgaberate von 90 %, Ablehnungsrate von nur 4,18 % — im Grunde fällt es beim ersten Angriff.

Das beste Ergebnis erzielte Claude 4 Sonnet (das Modell, das ich derzeit verwende): höchste Schadensausgaberate von nur 2,86 %, Ablehnungsrate von 50,18 %. Es übertrifft die anderen 9 getesteten Ziele bei weitem.

Auf der Angreiferseite war DeepSeek-R1 am effektivsten und brachte in 90 % der Tests das Ziel auf die höchste Schadensausgabestufe. Grok 3 Mini erreichte 87,14 %, Gemini 2.5 Flash 71,43 %.

"Alignment Regression": Stärkere Modelle sind gefährlicher

Die Forscher führten ein Konzept namens "Alignment Regression" ein.

Die Bedeutung: Mit zunehmender Reasoning-Fähigkeit wird es möglicherweise immer schwieriger, das Modell auszurichten. Denn starke Reasoning-Fähigkeiten sind ein zweischneidiges Schwert — dieselbe Fähigkeit, die dem Modell hilft, Anweisungen zu verstehen und Aufgaben zu erfüllen, kann es auch besser darin machen, andere zu überzeugen und Beschränkungen zu umgehen.

Noch beängstigender ist die extrem niedrige Einstiegshürde für Angriffe. Es ist keine Feinanpassung des Modells, kein Gradientenangriff und keine komplexen Jailbreak-Prompts erforderlich. Sie brauchen nur einen System-Prompt, der das Modell anweist, das andere zu überwinden, und schon beginnt alles.

Das bedeutet, dass Jailbreak sich von einer Fähigkeit, die Fachwissen erfordert, zu einem Angriff entwickelt, den jeder ausführen kann.

Die Schwierigkeit der Verteidigung

Die Forscher testeten eine einfache Verteidigungsmethode: Das Hinzufügen eines unveränderlichen Sicherheitssuffixes an alle Eingabenachrichten, das das Modell daran erinnert, dass die aktuelle Anfrage möglicherweise manipulativ ist. Diese Methode zeigte eine gewisse Wirksamkeit, verursacht jedoch erhebliche Rechenkosten.

Ein anderer Ansatz sind die Constitutional Classifiers von Anthropic, die in früheren Studien die Jailbreak-Erfolgsquote von 86 % auf 4,4 % senken konnten. Allerdings erhöhen alle diese Lösungen den Reasoning-Overhead.

Der Kernkonflikt liegt darin: Das Wesen von Sicherheitsvorkehrungen besteht darin, dem Modell Einschränkungen aufzuerlegen, aber der Angreifer kann seine Reasoning-Fähigkeiten nutzen, um diese Einschränkungen nach und nach abzutragen. Die Verteidigung muss alle Eingänge schützen, während der Angriff nur eine Lücke finden muss.

Warum ist das wichtig?

Wenn jemand nur große Modelle nutzt, um illegale Inhalte zu generieren, wäre das noch beherrschbar — die derzeitigen Sicherheitsteams sind in der Lage, damit umzugehen.

Was wirklich besorgniserregend ist, ist die Skalierbarkeit: Ein böswilliger Akteur kann ein Reasoning-Modell verwenden, um gleichzeitig Dutzende von Zielmodellen anzugreifen, Strategien automatisch anzupassen, Formulierungen automatisch zu iterieren, zu nahezu null Kosten. Die Sicherheitsvorkehrungen großer Modelle werden systematisch von einem anderen großen Modell getestet und durchbrochen.

KI greift KI an – dieser Tag ist früher gekommen, als die meisten Menschen erwartet haben.

Quellenangabe: CocoLoop, Large reasoning models are autonomous jailbreak agents (Nature Communications); AI Models Can Now Jailbreak Other AI Models Autonomously - 97% Success Rate (Awesome Agents)