AlphaFold-Datenbank erfasst Proteinkomplexe von über 2800 Virusarten

Das European Bioinformatics Institute (EMBL-EBI), Teil des European Molecular Biology Laboratory (EMBL), hat am 24. September bekanntgegeben, dass die AlphaFold-Datenbank um eine neue Reihe dreidimensionaler Strukturvorhersagen viraler Proteinkomplexe erweitert wurde. Sie deckt mehr als 2800 Virenarten ab und ist über das neu eingerichtete Pandemie-Vorsorgeportal der Datenbank kostenlos abrufbar und herunterladbar.

Das Projekt ist das Ergebnis einer breiten Zusammenarbeit. Neben EMBL-EBI, Google DeepMind und Nvidia sind die Coalition for Epidemic Preparedness Innovations (CEPI), die Seoul National University, die Sungkyunkwan University, das Swiss Institute of Bioinformatics (SIB) und die University of Glasgow beteiligt. Für die Strukturvorhersage kam DeepMinds AlphaFold2 zum Einsatz, beschleunigt durch Nvidias BioNeMo-Inferenz-Runtime; die gesamte Vorhersage-Pipeline wurde zudem als Open Source auf GitHub veröffentlicht.

Was in diesem Datensatz steckt

Bei der Auswahl der Viren galt als Leitprinzip, vorrangig Virusfamilien zu berücksichtigen, die bekanntermaßen Menschen infizieren. Die EMBL-Mitteilung nennt zwei Kategorien konkret: Rhinoviren, die häufigste Ursache der Erkältung, sowie neu auftretende Bedrohungen wie das Mpox-Virus (vormals als Affenpocken bekannt).

Anders als frühere Vorhersagen einzelner Proteine liegt der Schwerpunkt dieses Datensatzes auf Komplexen – also darauf, wie mehrere Proteine zusammenwirken. Wie ein Virus in eine Zelle eindringt und sich darin vermehrt, hängt in vielen Schritten von Protein-Protein-Interaktionen ab. Laut Nvidias Blogbeitrag sind rund 30 Prozent der neu aufgenommenen Proteininteraktionen vollständig neu – bislang gab es dafür weder experimentelle Belege noch Literaturhinweise.

"This dataset is an engine for hypothesis generation."

(Dieser Datensatz ist ein Motor zur Erzeugung von Hypothesen.)

Von März bis September

Zeitlich betrachtet ist diese Veröffentlichung der zweite Schritt desselben Teams in diesem Jahr. Am 16. März hatten EMBL-EBI, DeepMind, Nvidia und die Seoul National University erstmals Komplexe in die AlphaFold-Datenbank aufgenommen: Insgesamt wurden rund 30 Millionen Komplexe vorhergesagt, von denen 1,7 Millionen hochsichere Homodimere direkt in die Datenbank übernommen wurden; weitere rund 18 Millionen Vorhersagen mit geringerer Konfidenz standen zusätzlich zum Download bereit. Der Artenumfang deckte damals 20 Schlüsselarten, darunter den Menschen, sowie die WHO-Liste prioritärer Erreger ab.

Ein halbes Jahr später kamen mit CEPI und mehreren auf Virologie und Bioinformatik spezialisierten Hochschulen neue Partner hinzu, und der Fokus verengte sich von "Schlüsselarten" auf "Viren" – mit einem klareren Zweck: Impfstoff- und Medikamentenentwicklung. Auch der Zeitpunkt der Veröffentlichung war bewusst gewählt: Laut EMBL-Mitteilung findet am 25. September eine hochrangige Sitzung der UN-Generalversammlung zu Pandemieprävention, -vorsorge und -reaktion statt, und die Daten gingen einen Tag zuvor online.

Nvidias Blogbeitrag zitiert zudem eine Schätzung des Center for Global Development: Bis 2050 liege die Wahrscheinlichkeit, dass die Welt erneut eine Pandemie vom Ausmaß von COVID-19 erlebt, bei rund 50 Prozent.

Grenzen, die man vor der Nutzung kennen sollte

EMBL zieht in der Mitteilung klare Grenzen. Die Strukturvorhersagen lassen keine Rückschlüsse auf die Folgen genetischer Mutationen zu, sie erlauben keine Aussagen darüber, wie Wirt und Erreger interagieren, und schon gar nicht, ob sich Virulenz oder Übertragbarkeit eines Virus verändern – jede Schlussfolgerung muss im Labor überprüft werden. Joe Grove, Professor für molekulare Virologie an der University of Glasgow, bringt es unmissverständlich auf den Punkt:

"A protein complex structure alone doesn't tell us what happens when a virus mutates."

(Allein die Struktur eines Proteinkomplexes sagt uns nicht, was passiert, wenn sich ein Virus verändert.)

Ob die Veröffentlichung viraler Strukturdaten biosicherheitsrelevante Risiken birgt, wird in keiner der Mitteilungen direkt angesprochen; ebenso wenig wird erklärt, ob bei der Auswahl bewusst bestimmte hochriskante Erreger ausgeschlossen wurden. Auch die Lizenzbedingungen für die Daten nennt EMBL in dieser Mitteilung nicht.

Für Teams aus der Strukturbiologie und Impfstoffforschung lässt sich der Datensatz direkt herunterladen und nutzen, die Einstiegshürde ist niedrig. Die eigentliche Schwierigkeit liegt im anschließenden Nasslabor-Nachweis – ein Schritt, bei dem KI bislang kaum weiterhilft.

Quellen: offizielle Mitteilung von EMBL-EBI, offizieller Nvidia-Blog, CocoLoop, Nature News; Anzahl der Virenarten, der Anteil von 30 Prozent neuer Interaktionen sowie die Gesamtzahl von 260 Millionen Vorhersagen folgen den Angaben von EMBL und Nvidia.