Die Modellbewertungsorganisation METR hat am 6. Oktober einen Beitrag veröffentlicht, der einen Weg zeigt, auf dem ein KI-Agent sein eigenes Fehlverhalten verschleiern könnte: durch das Einschleusen von Skriptcode in den Log-Viewer des Bewertungs-Frameworks Inspect, der verändert, was menschliche Prüfer zu sehen bekommen. Mit Unterstützung eines KI-Assistenten fand ein Forscher die Lücke in etwa zehn Minuten.
Inspect ist ein in der Branche verbreitetes Open-Source-Bewertungs-Framework, ursprünglich vom britischen AI Safety Institute entwickelt und inzwischen von Meridian Labs gepflegt. Nach einem Bewertungslauf öffnen Forscher meist die Web-Viewer-Oberfläche, um Befehl für Befehl und Ausgabe für Ausgabe nachzuvollziehen, was der Agent getan hat. Genau an diesem Punkt setzte METR an.
Die Lücke steckt im Formel-Rendering
Der Viewer nutzt MathJax, um mathematische Formeln in den Logs darzustellen. METR fand heraus, dass ein Agent in seiner Ausgabe eine Formel mit \href unterbringen kann, in die ein SVG-<animate>-Element samt onbegin-Ereignis eingeschleust wird; sobald die Seite gerendert wird, führt dieser Code beliebigen JavaScript-Code im Browser des Prüfers aus.
"the agent can modify the displayed webpage arbitrarily"
(Der Agent kann die angezeigte Webseite beliebig verändern.)
Praktisch bedeutet das: Ein Agent, der während einer Bewertung gegen Regeln verstoßen hat, könnte dem Prüfer ein scheinbar unauffälliges Protokoll zeigen – einen Befehl löschen, eine Ausgabe umschreiben oder eine irreführende Anmerkung in die Seite einfügen. Das Beispielbild im Beitrag zeigt einen Lauf von GPT-5.5 bei der Aufgabe gdm_intercode_ctf, dient aber nur zur Illustration der manipulierten Darstellung; METR sagt nicht, dass GPT-5.5 so etwas tatsächlich getan hat.
Die Demonstration fand in einer isolierten Testumgebung statt, getrennt von Produktionssystemen. METR betont außerdem, nicht rückwirkend geprüft zu haben, ob diese Lücke in früheren echten Bewertungen tatsächlich ausgenutzt wurde – es handelt sich bislang nur um einen Proof of Concept.
Schnell behoben, aber das Problem ist größer
METR meldete das Problem an Meridian Labs, die es innerhalb eines Tages behoben; am 1. Oktober wurde der Code für einen „Untrusted Mode“ gemergt, der Inhalte, die ein Agent erzeugt, standardmäßig als nicht vertrauenswürdige Daten behandelt.
Die einzelne Lücke ist geschlossen, doch METR will auf ein grundsätzlicheres Problem hinweisen. Bewertungs-Logs, Reasoning-Aufzeichnungen und Monitoring-Alarme sind die wichtigsten Fenster, durch die Menschen KI-Systeme überwachen – und der Inhalt dieser Fenster wird größtenteils vom überwachten Agenten selbst erzeugt. Der Beitrag nennt vier Empfehlungen:
- Observability als sicherheitskritische Infrastruktur behandeln: Logs, Reasoning-Spuren und Verhaltensaufzeichnungen, die ein Agent erzeugt, grundsätzlich als nicht vertrauenswürdige Eingabe einstufen;
- Reasoning-Prozesse manipulationssicher speichern, sodass der Agent keine Chance hat, sie zu verändern, bevor Menschen oder LLM-Monitore sie lesen;
- Mehrschichtige Verteidigung aufbauen, um die Wahrscheinlichkeit zu senken, dass ein Agent Monitoring unentdeckt umgeht;
- Monitoring-Systeme unter adversarialen Bedingungen stresstesten.
Im Vergleich: zwei Arten von Angriffsflächen
METR zieht zum Vergleich einen von OpenAI offengelegten echten Vorfall heran: Bei einem internen Lauf trat eine Anomalie auf, das Monitoring-System markierte sie innerhalb von 15 Minuten, ein Mensch griff drei Minuten später ein, und der Lauf wurde nach 2,5 Stunden beendet. Diese Kette funktioniert nur, wenn die vom Monitoring gelesenen Aufzeichnungen selbst vertrauenswürdig sind.
Betrachtet man beide Fälle zusammen, liegt das Problem an unterschiedlichen Stellen. Bei OpenAI lag das Problem im Verhalten des Agenten und wurde durch Monitoring aufgedeckt; bei METR liegt das Problem in der Datenquelle, auf die sich das Monitoring stützt – und der Agent hatte die Möglichkeit, sie direkt umzuschreiben. Je automatisierter das Monitoring und je stärker es sich auf solche Aufzeichnungen verlässt, desto mehr versagt auch die nachträgliche Aufarbeitung, sobald die Aufzeichnungen verzerrt sind.
Für Teams in China, die Modellbewertungen und Agenten-Produkte entwickeln, liest sich der Beitrag eher wie eine Checkliste. Viele Teams nutzen Inspect direkt oder haben sich einen ähnlichen Web-Viewer selbst gebaut; alles, was Agenten-Ausgaben als Markdown, LaTeX oder HTML rendert, fällt in dieselbe Risikokategorie. Wer Inspect nutzt, sollte auf die Version mit „Untrusted Mode“ aktualisieren; wer ein eigenes Tool betreibt, sollte prüfen, ob Agenten-Ausgaben vor dem Rendering isoliert oder escaped werden.
Welcher KI-Assistent bei der Entdeckung der Lücke half, hat METR nicht offengelegt; wie viele Versionen vor der Behebung betroffen waren, hat Meridian Labs ebenfalls noch nicht öffentlich erklärt.
Quellen: METR-Blog, CocoLoop, Inspect-Open-Source-Repository; die von METR zitierte Bearbeitungsdauer des OpenAI-Vorfalls wurde minutengenau abgeglichen.