El Instituto Europeo de Bioinformática (EMBL-EBI), dependiente del Laboratorio Europeo de Biología Molecular (EMBL), anunció el 24 de septiembre la incorporación de un nuevo conjunto de predicciones estructurales tridimensionales de complejos proteicos virales a la base de datos AlphaFold, que cubre más de 2800 especies de virus. Los datos pueden consultarse y descargarse gratis a través del recién estrenado "Portal de Preparación ante Pandemias" de la base de datos.
El proyecto es fruto de una colaboración amplia. Además de EMBL-EBI, Google DeepMind y Nvidia, participan la Coalición para la Innovación en Preparación ante Epidemias (CEPI), la Universidad Nacional de Seúl, la Universidad Sungkyunkwan, el Instituto Suizo de Bioinformática (SIB) y la Universidad de Glasgow. Las predicciones estructurales se generaron con AlphaFold2 de DeepMind, aceleradas por el runtime de inferencia BioNeMo de Nvidia, y todo el proceso de predicción se publicó como código abierto en GitHub.
Qué contiene este conjunto de datos
El criterio para elegir los virus fue priorizar familias virales ya conocidas por infectar a humanos. El comunicado del EMBL menciona dos grupos concretos: los rinovirus, causa habitual del resfriado común, y amenazas emergentes como el virus de la mpox (antes conocida como viruela del mono).
A diferencia de las predicciones anteriores centradas en proteínas individuales, este lote pone el foco en los complejos, es decir, en cómo varias proteínas se ensamblan para funcionar juntas. La invasión de las células por parte del virus y su replicación en su interior dependen, en muchos pasos, de interacciones entre proteínas. Según el blog de Nvidia, alrededor del 30% de las nuevas interacciones proteicas incorporadas son completamente inéditas, sin registro experimental ni bibliográfico previo.
"This dataset is an engine for hypothesis generation."
(Este conjunto de datos es un motor para generar hipótesis.)
De marzo a septiembre
Visto en perspectiva temporal, esta publicación es el segundo paso del mismo equipo colaborador en lo que va de año. El 16 de marzo, EMBL-EBI, DeepMind, Nvidia y la Universidad Nacional de Seúl incorporaron complejos a la base de datos AlphaFold por primera vez: se predijeron en total unos 30 millones de complejos, de los cuales 1,7 millones de homodímeros de alta confianza se añadieron directamente a la base de datos, junto con unos 18 millones de predicciones de menor confianza disponibles para descarga, cubriendo 20 especies clave, incluida la humana, además de la lista de patógenos prioritarios de la OMS.
Medio año después, la lista de socios sumó organizaciones de respuesta a pandemias como CEPI y varias universidades especializadas en virología y bioinformática, y el alcance de los datos se redujo de "especies clave" a "virus", con un propósito declarado de forma más explícita: investigación de vacunas y fármacos. El momento de la publicación tampoco fue casual: el comunicado del EMBL señala que el 25 de septiembre la Asamblea General de la ONU celebrará una reunión de alto nivel sobre prevención, preparación y respuesta ante pandemias, y los datos se publicaron un día antes de esa cita.
El blog de Nvidia también cita una estimación del Center for Global Development: para 2050, la probabilidad de que el mundo vuelva a enfrentar una pandemia de la magnitud del COVID-19 ronda el 50%.
Limitaciones que conviene conocer antes de usarlo
El EMBL dejó claros los límites de estos datos en su comunicado. Las predicciones estructurales no pueden usarse para inferir las consecuencias de mutaciones genéticas, ni para determinar cómo interactúan huésped y patógeno, y mucho menos para concluir si cambiará la virulencia o la transmisibilidad de un virus: cualquier conclusión debe validarse todavía en el laboratorio. Joe Grove, profesor de virología molecular en la Universidad de Glasgow, lo resumió sin rodeos:
"A protein complex structure alone doesn't tell us what happens when a virus mutates."
(La estructura de un complejo proteico, por sí sola, no nos dice qué ocurre cuando un virus muta.)
Ninguno de los comunicados aborda directamente si hacer públicos estos datos estructurales de virus conlleva riesgos de bioseguridad, ni aclara si la selección excluyó deliberadamente patógenos de alto riesgo. Las condiciones de licencia de los datos tampoco quedaron especificadas por el EMBL en este anuncio.
Para los equipos de biología estructural y desarrollo de vacunas, este conjunto de datos puede descargarse y usarse de inmediato, con una barrera de entrada baja; la dificultad está en el paso siguiente, la validación experimental en laboratorio húmedo, donde la IA todavía ayuda poco.
Fuentes: comunicado oficial de EMBL-EBI, blog oficial de Nvidia, CocoLoop, Nature News; el número de especies de virus, la proporción del 30% de nuevas interacciones y el total de 260 millones de predicciones siguen las cifras publicadas por EMBL y Nvidia.