Claude entdeckt neues Enzymsystem ART in Bakteriophagen

Anthropic gab am 23. September bekannt, dass eine Gruppe von Claude-Agenten in öffentlichen DNA-Sequenzdatenbanken eine bislang nicht beschriebene Klasse von Enzymsystemen entdeckt hat, die das Unternehmen ART nennt (Array-Associated Reverse Transcriptases, dt. etwa „array-assoziierte Reverse Transkriptasen“). Diese Systeme kommen vor allem in Bakteriophagen-Genomen vor und ähneln in ihrer Struktur CRISPR. Anthropic veröffentlichte gleichzeitig einen Preprint zur Begutachtung durch Fachkollegen.

Gesichert ist bislang nur die Struktur, nicht die Funktion. Wofür ART eigentlich dient, ist noch unbekannt – Anthropic bezeichnet die entsprechende Forschung wörtlich als „ongoing“ (laufend).

950 Agenten, 21 Stunden

Nach Anthropics Darstellung erhielten die Forscher lediglich einen Ausgangs-Prompt; die anschließende Datenbanksuche, die Vorauswahl der Kandidaten und die Formulierung von Hypothesen übernahmen die Claude-Agenten eigenständig.

"After 21 hours spent searching this data by roughly 950 agents using 210 million tokens, one of the agents spotted something remarkable."

Sinngemäß: Rund 950 Agenten durchsuchten die Daten 21 Stunden lang mit 210 Millionen Tokens, bis einer von ihnen auf etwas Bemerkenswertes stieß.

Der Trichter verengte sich in mehreren Schritten: Die Agenten sammelten zunächst mehr als 200.000 Sequenzen von Reversen Transkriptasen, wählten daraus rund 3500 neue Kandidatensysteme aus und verdichteten diese schließlich auf 20 besonders überzeugende Kandidaten, die in einem Bericht an die Forscher übergeben wurden.

Die ausgewählten Systeme bestehen aus drei Teilen: einer Reversen Transkriptase, einem direkt benachbarten Begleitgen sowie einer langen Reihe gleichmäßig verteilter DNA-Wiederholungen. Anthropic zufolge war Claude offenbar der Erste, der diese beiden charakteristischen Merkmale zusammen erkannte – das nicht-codierende Wiederholungsarray und das zusätzliche Hilfsprotein.

Erste Experimente zeigen, dass die ART-Arrays zu einer Gruppe unterschiedlicher kurzer RNAs exprimiert werden. Das ähnelt dem Verhalten von CRISPR-Arrays, doch wofür diese kurzen RNAs in der Zelle tatsächlich gebraucht werden, lässt das Unternehmen offen.

Die Experimente führten ausschließlich Menschen aus

Der Labor-Teil dieser Entdeckung fand in einem gewöhnlichen molekularbiologischen Labor in der Bay Area statt. Sämtliche Experimente führten menschliche Wissenschaftler aus, Claude übernahm lediglich die vorgelagerte Recherche, die Hypothesenbildung und die Dateninterpretation. Das Labor arbeitete ausschließlich mit Proben der Sicherheitsstufen BSL-1 und BSL-2 und kam nicht mit humanpathogenen Erregern in Kontakt.

Das ist etwas anderes als das Feuchtlabor, über das Anfang des Monats berichtet wurde: Dort ging es darum, dass Claude Roboter zur Durchführung von Experimenten anleitet. Im jetzt vorgestellten Ablauf gibt es keine automatisierte Ausführung – die Menschen standen am Labortisch, das Modell arbeitete in der Datenbank.

Feng Zhang (MIT und Broad Institute), einer der Mitbegründer der CRISPR-Genom-Editierung, kommentierte die Arbeit so:

"This is an exciting example of how AI agents can contribute to biological discovery." (Ein spannendes Beispiel dafür, wie KI-Agenten zur biologischen Forschung beitragen können.)

Im Vergleich zum „KI-designten Bakteriophagen“

Im September vergangenen Jahres hatten das Arc Institute und ein Stanford-Team mit dem genomischen Sprachmodell Evo eine Reihe von Bakteriophagen-Genomen erzeugt, von denen 16 im Labor tatsächlich E. coli infizieren und lysieren konnten. Diese Arbeit war ein „Schreiben“ – das Modell erzeugte in der Natur nicht vorkommende Sequenzen, die anschließend im Labor auf Lebensfähigkeit geprüft wurden.

ART geht den umgekehrten Weg, das „Lesen“. Die Sequenzen lagen längst in öffentlichen Datenbanken, es fehlte nur jemand, der mehr als 200.000 Reverse Transkriptasen einzeln durchging und bemerkte, dass neben einer kleinen Untergruppe davon stets ein Wiederholungsarray hing. Diesmal übernahm das eine Maschine – in 21 Stunden.

Die Schwierigkeiten beider Ansätze unterscheiden sich: Beim generativen Design liegt der Engpass in der experimentellen Validierung, da die meisten vom Modell erzeugten Sequenzen nicht funktionsfähig sind. Beim Data-Mining liegt der Engpass darin, zu entscheiden, welcher Spur man zuerst folgt – 950 Agenten liefen parallel, am Ende blieben trotzdem nur 20 Berichte übrig, aus denen Menschen auswählten, welche Experimente durchgeführt werden.

Ein Blick auf die Geschichte von CRISPR liefert einen Maßstab: 1987 bemerkte ein japanisches Team im Genom von E. coli erstmals jene merkwürdige Wiederholungssequenz – bis daraus ein Werkzeug zur Genom-Editierung wurde, vergingen mehr als zwei Jahrzehnte. ART befindet sich derzeit in einer vergleichbaren Phase des „Bemerkens einer Wiederholungssequenz“; ob sich daraus Anwendungen entwickeln, hängt von weiterer Funktionsforschung und unabhängiger Reproduktion durch andere Labore ab.

Der Preprint ist bereits öffentlich zugänglich. Ob andere Labore die kurze RNA-Expression von ART unabhängig reproduzieren können, ist der erste Schritt, mit dem die Außenwelt das Ergebnis überprüfen kann.

Quellen: Anthropic-Unternehmensblog, CocoLoop, zugehöriger ART-Preprint; Angaben zur Agentenzahl, zum Token-Verbrauch und zu den einzelnen Stufen des Kandidaten-Trichters stammen von Anthropic, die Zahl der von Evo entworfenen Phagen stammt aus der veröffentlichten Studie des Arc Institute.