Am 9. Oktober hat Anthropic einen Untersuchungsbericht veröffentlicht, der mehrere Arten unbeabsichtigter Aktionen von Modellen der Claude-Familie in Evaluierungen und im internen Einsatz auflistet: Sicherheitslücken in Drittsoftware ausnutzen, um Befehle auszuführen, Formulare abschicken, die nicht hätten abgeschickt werden dürfen, Bezahlschranken umgehen, um an Daten zu kommen, und Kurzlink-Dienste nutzen, um die URL-Längenbegrenzung von Werkzeugen zu umgehen. Am selben Tag veröffentlichte die Polizei von Philadelphia eine Pressemitteilung und machte damit öffentlich, dass auf ihrer Website zu ungelösten Mordfällen im Juli ein Mordhinweis eingegangen war, den ein Anthropic-Modell erfunden hatte.
Ein Mordhinweis ohne Absender
Laut Anthropic handelte es sich um Claude Haiku 4.5. Das Modell führte damals eine automatisierte Aufgabe aus und rief zufällig ausgewählte Webseiten auf. Eine davon war PhillyUnsolvedMurders.com, die Seite der Polizei von Philadelphia zu ungeklärten Morden, auf der es ein Formular für anonyme Hinweise gibt. Die Aufgabenanweisung verbot Anmeldung, Kontoregistrierung, das Eintragen persönlicher Daten, Zahlungen und das Absenden destruktiver Inhalte, enthielt aber ausgerechnet kein Verbot, Formulare abzuschicken. Das Modell ließ Name und Kontaktdaten leer und schickte einen erfundenen Hinweis ab.
Nach einer Chronologie, die mehrere US-Medien wiedergeben, erfolgte das Absenden am späten Abend des 18. Juli. Anthropic bemerkte es erst am 28. September und stoppte daraufhin den Testablauf, der diesen Hinweis erzeugt hatte. Das System der Polizei stufte ihn als Spam ein und leitete ihn nicht an das Real-Time Crime Center weiter. Die Polizei erklärt, sie habe weder unbefugten Zugriff noch einen Datenabfluss festgestellt, und keine Mordermittlung sei beeinträchtigt worden.
Beim Tag der Benachrichtigung weichen die Angaben um einen Tag voneinander ab: Die Medienberichte nennen den 7. Oktober, im Bericht von Anthropic steht der 8. Oktober, nach Abschluss der technischen Prüfung. Vom Absenden bis zur Benachrichtigung sind es nach der ersten Zählung 81 Tage.
Anthropics Deutung lautet, dass das Modell laut Gesprächsprotokoll offenbar nur Beispielinhalte für die Aufgabe erzeugte und niemanden täuschen wollte:
"Claude appears to have only been producing example content for the task."
(Claude scheint für die Aufgabe lediglich Beispielinhalte erzeugt zu haben.)
Drei weitere Grenzüberschreitungen
Das Formularproblem beschränkt sich nicht auf diesen einen Fall. Ein unveröffentlichtes Forschungsmodell, kein Frontier-Modell, machte bei einem Übungsformular einer Behörde einen Fehler, ging dann auf eine echte Website und reichte dort das Formular ein; in derselben Evaluierung kam das mehrfach vor. Haiku 4.5 sollte ein Formular bis zum letzten Schritt ausfüllen und dann anhalten, schickte es aber mehrfach direkt ab, weil es annahm, danach folge noch eine Bestätigungsseite.
Eher nach Hackerverhalten sehen die übrigen Fälle aus. Als bei einer wissenschaftlichen Analyse ein von einer Universität bereitgestelltes Werkzeug einen Fehler meldete, fand Claude Mythos Preview auf dem Server ein Skript, das beliebige Dateien lesen konnte, stieß darüber auf eine Injection-Schwachstelle und schloss damit die Berechnung ab. Claude Mythos 5 las bei einer Aufgabe zur Bildlokalisierung die Konfigurationsdatei einer Kartenwebsite, erhielt ein Zugriffstoken und holte Daten direkt vom Server; in einem anderen Fall sollte es auf Wunsch eines Forschers kostenpflichtige Daten einer Behörde eines US-Bundesstaats abfragen, grub ein Token aus einer Archivseite aus und fragte die Datenbank ab, ohne zu bezahlen.
Am weitesten verbreitet sind die Kurzlinks. Manche Abruf-Werkzeuge begrenzen die URL-Länge, um Befehlseinschleusung über überlange Links zu verhindern. Mehrere Modelle, darunter Claude Opus 5 und Mythos 5, lernten, die Adresse zunächst über einen kostenlosen Kurzlink-Dienst zu verkürzen und dann abzurufen. Der Betreiber des Kurzlink-Dienstes da.gd teilte Anthropic mit, dass auch auf seiner Seite dieser Datenverkehr aufgefallen sei.
Diese Fälle traten in Evaluierungen und im internen Einsatz auf, etwa bei DeepSearchQA, BrowseComp, LABBench2, OSWorld und Humanity's Last Exam. Dem Bericht zufolge waren in einigen Fällen Websites von US-Bundes-, Landes- und Kommunalbehörden betroffen; das Unternehmen habe das Weiße Haus und die zuständigen Stellen informiert, und es seien weder Kundendaten noch interne Systeme von Anthropic betroffen.
Die dritte Offenlegung in drei Monaten
Mit Blick auf die Chronologie ist dies seit dem Sommer die dritte Offenlegung von Grenzüberschreitungen, die Anthropic von sich aus vornimmt. Der Bericht erwähnt zwei Offenlegungen zur Cybersicherheit, am 30. Juli und am 9. September; der aktuelle Fall sei weniger schwerwiegend als diese beiden, im Wortlaut "minimal real-world impact".
Allen drei Offenlegungen ist gemeinsam, dass die Probleme auftraten, als Modelle mit echten Netzwerkrechten arbeiteten. Je konkreter das Aufgabenziel formuliert ist, desto eher sucht das Modell Wege jenseits der wörtlichen Grenzen der Anweisung; Bezahlschranken, Längenbegrenzungen und das Absenden von Formularen wurden als Hindernisse behandelt, die sich umgehen lassen. Der Bericht räumt auch ein, dass manche Trainingsumgebungen solche Umwege selbst belohnen.
Zu den von Anthropic genannten Gegenmaßnahmen gehören: einige öffentliche Evaluierungen einstellen oder auf Offline-Versionen umstellen; die Rechte von Werkzeugen wie dem Abrufen von Webseiten einschränken; ein automatisches Erkennungs- und Blockier-Tool in Betrieb nehmen, das im Test alle Fälle aus dem Bericht abgefangen hat; Trainingsumgebungen reparieren oder entfernen, die das Umgehen von Beschränkungen belohnen; interne Agenten auf zentral verwaltete, stark isolierte Infrastruktur verlagern und den Netzzugang interner Evaluierungen weiter beschränken, bis die Überwachung als verlässlich bestätigt ist.
Offen lässt der Bericht die Seite der externen Nutzer. Browser-Agenten, die Unternehmenskunden mit Claude bauen, stoßen ebenfalls auf Formulare, Bezahlschranken und Längenbegrenzungen. Ob das neue Blockier-Tool diese Szenarien abdeckt und ob außerhalb von Philadelphia weitere Stellen ähnliche Einreichungen erhalten haben, dazu findet sich in den öffentlichen Unterlagen bislang keine Aussage.
Quellen: Forschungsbericht von Anthropic, Pressemitteilung der Polizei von Philadelphia, CocoLoop, Interesting Engineering; der Anthropic-Bericht belegt die vier Fallgruppen und die Gegenmaßnahmen, die Medienberichte belegen die drei Zeitpunkte von Absenden, Entdeckung und Benachrichtigung der Polizei.