AlphaFold intègre les complexes protéiques de plus de 2800 virus

Le European Bioinformatics Institute (EMBL-EBI), rattaché au European Molecular Biology Laboratory (EMBL), a annoncé le 24 septembre l'ajout d'un nouveau lot de prédictions structurelles tridimensionnelles de complexes protéiques viraux à la base de données AlphaFold, couvrant plus de 2800 espèces de virus. Les données sont consultables et téléchargeables gratuitement via le nouveau "portail de préparation aux pandémies" de la base.

Ce projet est le fruit d'une large collaboration. Outre EMBL-EBI, Google DeepMind et Nvidia, y participent la Coalition for Epidemic Preparedness Innovations (CEPI), l'université nationale de Séoul, l'université Sungkyunkwan, l'Institut suisse de bioinformatique (SIB) et l'université de Glasgow. Les prédictions structurelles ont été réalisées avec AlphaFold2 de DeepMind, accélérées par le runtime d'inférence BioNeMo de Nvidia, et l'ensemble du pipeline de prédiction a été publié en open source sur GitHub.

Ce que contient ce jeu de données

Le principe retenu pour choisir les virus a été de privilégier les familles virales déjà connues pour infecter l'humain. Le communiqué de l'EMBL cite deux catégories : les rhinovirus, cause courante du rhume, et des menaces émergentes comme le virus mpox (anciennement variole du singe).

Contrairement aux prédictions précédentes centrées sur des protéines isolées, ce lot met l'accent sur les complexes, c'est-à-dire sur la manière dont plusieurs protéines s'assemblent pour fonctionner ensemble. L'invasion des cellules par un virus, puis sa réplication à l'intérieur, reposent à de nombreuses étapes sur des interactions entre protéines. Selon le blog de Nvidia, environ 30% des nouvelles interactions protéiques intégrées sont totalement inédites, sans aucune trace expérimentale ou bibliographique antérieure.

"This dataset is an engine for hypothesis generation."

(Ce jeu de données est un moteur pour générer des hypothèses.)

De mars à septembre

En remontant la chronologie, cette publication constitue la deuxième étape de l'année pour cette même équipe. Le 16 mars, EMBL-EBI, DeepMind, Nvidia et l'université nationale de Séoul avaient ajouté des complexes à la base AlphaFold pour la première fois : environ 30 millions de complexes avaient été prédits au total, dont 1,7 million d'homodimères à haute confiance intégrés directement à la base, ainsi qu'environ 18 millions de prédictions à confiance plus faible mises à disposition en téléchargement, couvrant 20 espèces clés, dont l'humain, en plus de la liste des agents pathogènes prioritaires de l'OMS.

Six mois plus tard, la liste des partenaires s'est élargie à des organisations de riposte aux pandémies comme la CEPI et plusieurs universités spécialisées en virologie et bioinformatique, tandis que le périmètre des données se resserrait des "espèces clés" aux "virus", avec un objectif énoncé plus clairement : la recherche vaccinale et pharmaceutique. Le moment choisi pour la publication n'est pas anodin non plus : le communiqué de l'EMBL rappelle que l'Assemblée générale des Nations unies tiendra le 25 septembre une réunion de haut niveau sur la prévention, la préparation et la riposte aux pandémies, et que les données ont été mises en ligne la veille de cette rencontre.

Le blog de Nvidia cite par ailleurs une estimation du Center for Global Development : d'ici 2050, la probabilité que le monde connaisse à nouveau une pandémie de l'ampleur du COVID-19 est d'environ 50%.

Les limites à connaître avant utilisation

L'EMBL a clairement posé les limites de ces données dans son communiqué. Les prédictions structurelles ne permettent pas de déduire les conséquences de mutations génétiques, ni de déterminer comment l'hôte et l'agent pathogène interagissent, encore moins de conclure à une évolution de la virulence ou de la transmissibilité d'un virus : toute conclusion doit encore être validée en laboratoire. Joe Grove, professeur de virologie moléculaire à l'université de Glasgow, l'a résumé sans détour :

"A protein complex structure alone doesn't tell us what happens when a virus mutates."

(La structure d'un complexe protéique, à elle seule, ne nous dit pas ce qui se passe quand un virus mute.)

Aucun de ces communiqués n'aborde directement la question de savoir si la publication de ces données structurelles sur les virus comporte des risques de biosécurité, ni ne précise si la sélection a délibérément exclu certains agents pathogènes à haut risque. Les conditions de licence des données ne sont pas non plus précisées par l'EMBL dans cette annonce.

Pour les équipes de biologie structurale et de développement vaccinal, ce jeu de données peut être téléchargé et utilisé directement, avec une barrière d'entrée faible ; la difficulté se situe à l'étape suivante, celle de la validation expérimentale en laboratoire humide, où l'IA n'apporte encore que peu d'aide.

Sources : communiqué officiel de l'EMBL-EBI, blog officiel de Nvidia, CocoLoop, Nature News ; le nombre d'espèces de virus, la part de 30% de nouvelles interactions et le total de 260 millions de prédictions reprennent les chiffres communiqués par l'EMBL et Nvidia.