DeepMind versieht KI-designte Proteine mit Wasserzeichen

Google DeepMind hat am 30. September SynthID Bio vorgestellt, ein Verfahren, das Wasserzeichen direkt in die Aminosäuresequenzen KI-designter Proteine einschreibt. Das zugehörige Methodenpapier erschien gleichzeitig in Nature; Code, In-vitro-Daten und Modellgewichte stehen der Forschungsgemeinschaft offen zur Verfügung.

Die Frage, die das Werkzeug beantworten soll, ist konkret: Lässt sich bei einer vorliegenden Proteinsequenz nachweisen, dass sie aus einem vertrauenswürdigen KI-Designprozess stammt? DeepMind versteht es ausdrücklich als Herkunftsnachweis - nicht als Bewertung, ob ein Protein gefährlich ist.

Wie das Wasserzeichen eingebracht wird

SynthID Bio setzt auf dem Protein-Design-Werkzeug ProteinMPNN auf. ProteinMPNN platziert Aminosäuren Position für Position entlang des Proteinrückgrats, wobei an vielen Stellen mehrere chemisch ähnliche Kandidaten zur Wahl stehen - Leucin, Isoleucin und Valin etwa lassen sich an zahlreichen Positionen gegenseitig ersetzen.

Genau hier greift SynthID Bio ein: Basierend auf einem Wasserzeichen-Schlüssel und den bereits gewählten Aminosäuren schlägt es eine Option vor. Der Designprozess übernimmt diesen Vorschlag nur, wenn die Proteinfunktion dadurch nicht beeinträchtigt wird. An einer einzelnen Position fällt nichts auf, aber über die gesamte Sequenz hinweg treten Aminosäuren, die der Vorliebe des Schlüssels entsprechen, häufiger auf, als der Zufall erwarten ließe.

Auch der Nachweis beruht auf Statistik: Wer den Schlüssel besitzt, scannt die gesamte Sequenz, zählt, an wie vielen Positionen sie dem Schlüsselvorschlag entspricht, und vergleicht das Ergebnis mit einem Schwellenwert. Ars Technica weist darauf hin, dass die Wahl dieses Schwellenwerts direkt über das Verhältnis von Falsch-positiv- und Falsch-negativ-Ergebnissen entscheidet - das Resultat bleibt also eine Wahrscheinlichkeitsaussage.

Versuchsergebnisse

Das Team entwarf mit dem wasserzeichenversehenen Verfahren Bindungsproteine für drei Zielstrukturen: den Gefäßwachstumsfaktor VEGF-A, die Rezeptorbindungsdomäne (RBD) des Coronavirus-Spike-Proteins und das Immun-Checkpoint-Protein PD-L1. In-vitro-Tests zeigten, dass die wasserzeichenversehenen Designs bei Trefferquote und Bindungsaffinität mit der Version ohne Wasserzeichen gleichzogen, auch die Sequenzvielfalt nahm nicht ab. DeepMind bezeichnet dies als die ersten wasserzeichenversehenen und zugleich biologisch funktionalen Proteinbinder.

Denselben Ansatz wandte das Team auch auf die Strukturvorhersagen von AlphaFold 3 an: Die Nachweisrate lag nahe bei Perfektion und erwies sich robust gegenüber digitalem Rauschen und kleinen Koordinatenänderungen.

"AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly." (KI erweitert, was Wissenschaftler gestalten können, und DNA-Synthese-Unternehmen spielen eine wichtige Rolle dabei, diese Innovation verantwortungsvoll skalieren zu lassen.)

So bewertet es James Diggans, Vice President für Policy und Biosicherheit beim DNA-Synthese-Unternehmen Twist Bioscience.

Im Vergleich zu Text-Wasserzeichen

SynthID kam ursprünglich bei Bildern zum Einsatz, wurde später auf Text, Audio und Video ausgeweitet; das Text-Wasserzeichen wurde 2024 als Open Source veröffentlicht. An dieser Stelle wurde bereits berichtet, wie OpenAI Googles Wasserzeichen in ChatGPT integrierte und wie Anthropic Claude-Ausgaben mit einem unsichtbaren Wasserzeichen versieht. Die gemeinsame Schwachstelle all dieser Ansätze ist das Umschreiben: Formuliert man einen Text um, verdünnt sich das statistische Signal.

Auch bei Proteinen gibt es ein Gegenstück zum "Umschreiben". Berichten zufolge bieten sehr kurze Proteine nicht genug Stellen für ausreichend viele Wasserzeichen-Positionen; hängt man an eine wasserzeichenversehene Sequenz eine natürliche Sequenz an - etwa durch Fusion mit einem Fluoreszenzprotein -, wird das Signal verwässert; und viele Protein-Design-Werkzeuge basieren gar nicht auf ProteinMPNN oder platzieren Aminosäuren nicht Position für Position, sodass sich dort gar kein Wasserzeichen einbringen lässt. DeepMind selbst räumt ein, dass die Robustheit gegenüber gezielter Manipulation weiterhin eine Schwachstelle bleibt.

Hinzu kommt die Frage der Schlüsselverwaltung: Die Glaubwürdigkeit des gesamten Systems hängt davon ab, wer den Schlüssel besitzt, wie er verteilt wird und was im Fall eines Lecks passiert - dafür gibt es bislang keine ausgereifte Branchenregelung.

Welche Rolle das im Biosicherheits-Gefüge spielt

Die bestehenden Biosicherheitsvorkehrungen setzen vor allem bei der DNA-Synthese an: Synthese-Unternehmen vergleichen bestellte Sequenzen mit Datenbanken bekannter gefährlicher Sequenzen. KI-designte neue Proteine ähneln jedoch möglicherweise keiner bekannten Sequenz, sodass dieser Abgleich ins Leere läuft. Das Wasserzeichen liefert einen zusätzlichen Hinweis: Es zeigt dem Synthese-Unternehmen, dass die Sequenz aus einem registrierten Designprozess stammt.

Es schließt also eine Lücke bei der Herkunftsprüfung, hilft aber nicht bei der Gefahrenbewertung. Eine Sequenz ohne Wasserzeichen könnte schlicht mit einem anderen Werkzeug entstanden sein; eine Sequenz mit Wasserzeichen ist deshalb nicht automatisch harmlos. DeepMind betont in seiner Ankündigung ausdrücklich, dass keine einzelne Biosicherheitsmaßnahme das Problem allein lösen kann. Derzeit nimmt DeepMind über synthidbio@google.com Kontakt zu Partnern auf; wie viele Synthese-Unternehmen und Design-Werkzeuge sich letztlich anschließen, bleibt abzuwarten.

Quellen: offizieller Blog von Google DeepMind, Methodenpapier in Nature, CocoLoop, Ars Technica; Angaben zu Zielproteinen, Trefferquote und Bindungsaffinität folgen dem Paper und dem offiziellen Blog, der Abschnitt zu den Grenzen stützt sich auf die Einordnung von Ars Technica.