Claude Mythos führt SWE-bench Pro mit 77,8 % an

Am 7. April gab Anthropic etwas recht Ungewöhnliches bekannt: Sie veröffentlichten ein neues Modell namens Claude Mythos und erklärten gleichzeitig, dass dieses Modell nicht der Öffentlichkeit zugänglich sei.

Nicht „später verfügbar", sondern „derzeit nur für 40 Organisationen, alle anderen warten".

Das Projekt heißt Project Glasswing.

Wie stark ist Mythos wirklich

Zunächst die Daten:

Benchmark Claude Opus 4.6 Claude Mythos Veränderung
SWE-bench Verified 80,8 % 93,9 % +13,1 %
SWE-bench Pro Nicht veröffentlicht 77,8 % Aktuell führend

Der zweite Platz im SWE-bench Pro ist derzeit GLM-5.1 von Zhipu (58,4 %), der dritte GPT-5.4 (57,7 %). Mythos liegt mit 77,8 % fast 20 Prozentpunkte vor dem Zweiten – ein beträchtlicher Abstand.

Aber Anthropic geht es nicht nur um Bestenlisten. Sie ließen Mythos echte Codebasen durchsuchen und fand:

  • Tausende von Zero-Day-Schwachstellen in gängigen Betriebssystemen und Browsern
  • Eine 16 Jahre alte Schwachstelle in FFmpeg – diese Schwachstelle wurde bereits von über 5 Millionen herkömmlichen Sicherheitsscans übersehen

Cisco Chief Security Officer Anthony Grieco sagte wörtlich: „Dies stellt einen tiefgreifenden Paradigmenwechsel dar und ist ein klares Signal – die bisherigen Methoden zur Systemhärtung reichen nicht mehr aus."

Was ist die Logik hinter Project Glasswing

Anthropic gewährt diesen 40 Organisationen Vorabzugriff auf Mythos mit einem einzigen Zweck: defensive Cybersicherheitsarbeit.

Zu den Partnern mit Zugang gehören: Amazon, Apple, Broadcom, Cisco, CrowdStrike, Linux Foundation, Microsoft, Palo Alto Networks.

Anthropic stellt bereit:

  • 100 Millionen US-Dollar API-Guthaben, das Sicherheitstests und Forschung der Teilnehmer abdeckt
  • 4 Millionen US-Dollar direkte Spenden an Open-Source-Sicherheitsorganisationen

Warum diese „limitierte Edition"?

Die offizielle Erklärung ist direkt: Mythos übertrifft in der Cybersicherheitsfähigkeit „derzeit jedes andere KI-Modell bei weitem", aber genau deshalb könnte es auch genutzt werden, um groß angelegte Cyberangriffe zu beschleunigen. Anthropic hält das Risiko einer Veröffentlichung ohne ausreichende Schutzmaßnahmen für zu hoch.

Daher wählten sie einen Kompromiss: Zuerst den Verteidigern Zugang geben, damit Sicherheitsteams Patches vorbereiten können, bevor eine breitere Freigabe in Betracht gezogen wird.

Ist diese Strategie richtig

Es ist eine Überlegung wert.

Die traditionelle Logik der KI-Modellveröffentlichung ist: Veröffentlichen, testen, Probleme finden, beheben, wiederholen. Dieser Prozess ist öffentlich, das Risiko verteilt sich – Angreifer und Verteidiger erhalten gleichzeitig neue Werkzeuge.

Glasswings Ansatz ist umgekehrt: Zuerst ein Zeitfenster für die Verteidiger schaffen, damit sie Mythos nutzen können, um aktiv Schwachstellen zu finden und zu schließen, bevor ein breiterer Zugang erwogen wird.

Aus spieltheoretischer Sicht ergibt dieses Design Sinn – wenn die Verteidiger zuerst handeln, sind die Kosten für Angreifer, dasselbe Modell zu nutzen, deutlich höher.

Die tatsächliche Wirksamkeit hängt jedoch von zwei Dingen ab: Ob diese 40 Organisationen die kritischen Schwachstellen wirklich innerhalb dieses Zeitfensters schließen können; und ob die Modellfähigkeiten selbst ein Leckrisiko darstellen (schließlich wurde die Existenz von Mythos bereits durch einen Datenleck vorab von Medien enthüllt).

Auf welcher Ebene befindet sich Mythos

Dies ist das von Anthropic ausdrücklich als „stärkstes Modell aller Zeiten" bezeichnete Modell, keine Weiterentwicklung der Opus 4.x-Reihe, sondern eine neue Generation.

Vor einigen Wochen enthüllten Medien aufgrund eines Datenlecks vorzeitig die Existenz von Mythos. Fortune berichtete, dass Anthropic intern von einem „sprunghaften Anstieg der Fähigkeiten" sprach. Nun sind Name und Fähigkeiten offiziell bestätigt, jedoch nicht in Form einer Veröffentlichung, sondern als gezieltes Kooperationsprogramm.

Worauf Anthropic wartet, ist noch nicht klar. Aber angesichts der 77,8 % im SWE-bench Pro liegen die Codefähigkeiten dieses Modells bereits in einer anderen Liga.

Quellenangabe: Anthropic debuts preview of powerful new AI model Mythos in new cybersecurity initiative (TechCrunch); Anthropic debuts Project Glasswing, CocoLoop, leveraging its powerful Mythos model to reinforce software security (SiliconAngle); Anthropic is giving some firms early access to Claude Mythos to bolster cybersecurity defenses (Fortune); Exclusive: Anthropic Mythos AI model representing step change in power revealed in data leak (Fortune)