Anthropic startet kostenlosen Schwachstellen-Scan ohne menschliche Prüfung

Anthropic hat am 8. Oktober OSS Scanner gestartet, einen kostenlosen Schwachstellen-Scan für Open-Source-Projekte, dem Projekte freiwillig beitreten können. Gescannt wird mit eigenen Modellen des Unternehmens wie Claude Mythos, und die Berichte gehen direkt an die Maintainer – ohne menschliche Prüfung oder Einstufung dazwischen.

Jeder Bericht enthält ein eigenständig lauffähiges Reproduktionsprogramm und eine Beschreibung der Schwachstelle; lässt sich die Ursache lokalisieren, wird der per Binärsuche gefundene Commit genannt, der den Fehler eingeführt hat, zusammen mit einem möglichst fertigen Patch. Anthropic schreibt in der Ankündigung ausdrücklich, dass diese Berichte Fehler enthalten oder ungültig sein können.

Wer sich bewerben kann

Die Zulassungskriterien orientieren sich am Standard von Googles OSS-Fuzz: Ein Projekt muss "kritischen Einfluss" auf Infrastruktur oder Nutzersicherheit haben, bewertet im Einzelfall. Die Bewerbung erfolgt durch die Hauptmaintainer des Projekts per Pull Request an das GitHub-Repository anthropics/oss-scanner, in dem die Projektangaben nach einer Vorlage eingetragen werden.

Wie oft ein einzelnes Projekt gescannt wird, steht nicht in der Ankündigung, ebenso fehlt ein Verfahren für Maintainer, die vorzeitig aussteigen wollen. Die Offenlegung folgt dem Prinzip der koordinierten Offenlegung (CVD), konkrete Fristen werden in der Ankündigung nicht genannt.

Zahlen aus dem halbjährigen Testlauf

Laut Anthropic hat das Unternehmen in den vergangenen sechs Monaten mit Modellen Open-Source-Code gescannt und dabei mehr als 29.000 mögliche Schwachstellen gefunden, von denen Menschen rund 6.000 geprüft haben. In der frühen Testphase wurden 97 als hoch oder kritisch eingestufte Schwachstellen in 48 Projekten identifiziert, 85 davon erfüllten die Anforderungen des Offenlegungsprozesses – eine Quote von etwa 88 Prozent.

Eine weitere Zahlenreihe betrifft bereits versendete Berichte: Fast 5.000 Berichte gingen an Maintainer; bei einer vom Unternehmen genannten Stichprobe von 74 Berichten bestätigten Maintainer 72 als gültig, 5 erhielten eine CVE-Nummer. In der Ankündigung namentlich genannte Projekte sind PostgreSQL, OpenSSL, wolfSSL, HotCRP und Linux.

Auch eine Einschätzung von OpenSSL-Seite fand Platz in der Ankündigung:

"The reports we received from Anthropic, raw model output included, were as good and sometimes better than what we get from people."
(Die Berichte, die wir von Anthropic erhalten haben, einschließlich der rohen Modellausgabe, waren so gut wie die von Menschen – manchmal besser.)

Warum die menschliche Prüfung wegfällt

Als Begründung nennt Anthropic, dass der Scan dadurch "schneller und häufiger" werden soll. Die eigenen Zahlen zeigen, dass die menschliche Kapazität tatsächlich nicht mithält: Von 29.000 Kandidaten hat ein Mensch nur etwa ein Fünftel gesehen. Mit der Ausweitung des Scan-Umfangs verschiebt sich die Prüfung zu den Maintainern, und mit ihr der Zeitaufwand fürs Sichten.

Im Vergleich zur Konkurrenz

Anthropic sagt, der Dienst sei von OSS-Fuzz inspiriert. OSS-Fuzz ist ein 2016 von Google gestartetes Projekt, das mit Fuzzing kontinuierlich Open-Source-Code testet und Maintainer bei gefundenen Abstürzen automatisch benachrichtigt. OSS Scanner ersetzt das durch ein Sprachmodell, das Code liest und Reproduktionen schreibt, die Schwelle liegt weiterhin bei "kritischen Projekten".

Diese Seite hat zuvor über mehrere ähnliche Entwicklungen berichtet. Google wurde einst von KI-generierten Schwachstellenberichten überschwemmt und stoppte deshalb die Annahme solcher Berichte für einige Open-Source-Produkte; SoftBank hat zusammen mit OpenAI einen automatischen Patch-Dienst für Unternehmenskunden vorgestellt. Die drei Unternehmen positionieren sich unterschiedlich: Google blockt die Menge der eingehenden Berichte ab, OpenAI betreibt damit ein Unternehmensgeschäft, und Anthropic wendet sich dieses Mal kostenlos an Open-Source-Maintainer, bündelt Reproduktionsprogramm und Patch gleich mit und will mit der Qualität der Berichte überzeugen.

Für Maintainer hängt die Teilnahme von der eigenen Kapazität ab, die Berichte zu bearbeiten. Wie viele der fast 5.000 versendeten Berichte bereits behoben wurden und wie lang die durchschnittliche Bearbeitungszeit ist, legt die Ankündigung nicht offen; ob unkontrollierte Berichte bei wachsender Zahl teilnehmender Projekte erneut zur Last werden, zeigt sich erst, wenn die Liste der Bewerbungen öffentlich wird.

Quellen: offizielle Ankündigung von Anthropic (Anzahl möglicher Schwachstellen, menschliche Prüfung, Offenlegungsquote und Berichtszahlen), Bewerbungshinweise zu anthropics/oss-scanner, CocoLoop; Ankündigung von Anthropic zum Abgleich von Bewerbungsvoraussetzungen und Berichtsinhalten.