O European Bioinformatics Institute (EMBL-EBI), ligado ao European Molecular Biology Laboratory (EMBL), anunciou em 24 de setembro a adição de um novo conjunto de previsões estruturais tridimensionais de complexos proteicos virais ao banco de dados AlphaFold, cobrindo mais de 2.800 espécies de vírus. Os dados podem ser consultados e baixados gratuitamente através do recém-lançado "Portal de Preparação para Pandemias" do banco de dados.
O projeto é fruto de uma colaboração ampla. Além do EMBL-EBI, Google DeepMind e Nvidia, também participaram a Coalition for Epidemic Preparedness Innovations (CEPI), a Seoul National University, a Sungkyunkwan University, o Swiss Institute of Bioinformatics (SIB) e a University of Glasgow. As previsões estruturais foram geradas com o AlphaFold2 da DeepMind, aceleradas pelo runtime de inferência BioNeMo da Nvidia, e todo o pipeline de previsão foi disponibilizado como código aberto no GitHub.
O que há neste conjunto de dados
O princípio usado para escolher os vírus foi priorizar famílias virais já conhecidas por infectar humanos. O comunicado do EMBL cita dois grupos: os rinovírus, causa comum do resfriado, e ameaças emergentes como o vírus mpox (antiga varíola dos macacos).
Ao contrário das previsões anteriores de proteínas isoladas, o foco deste lote está nos complexos — ou seja, em como várias proteínas se encaixam para funcionar juntas. A invasão de células pelo vírus e sua replicação dentro delas dependem, em muitas etapas, de interações entre proteínas. Segundo o blog da Nvidia, cerca de 30% das novas interações proteicas incluídas são completamente inéditas, sem registro experimental ou bibliográfico anterior.
"This dataset is an engine for hypothesis generation."
(Este conjunto de dados é um motor para a geração de hipóteses.)
De março a setembro
Olhando a linha do tempo, este lançamento é o segundo passo do mesmo grupo de colaboradores neste ano. Em 16 de março, EMBL-EBI, DeepMind, Nvidia e Seoul National University adicionaram complexos ao banco de dados AlphaFold pela primeira vez: foram previstos cerca de 30 milhões de complexos no total, dos quais 1,7 milhão de homodímeros de alta confiança foram incorporados diretamente ao banco, além de cerca de 18 milhões de previsões de confiança mais baixa disponibilizadas para download, cobrindo 20 espécies-chave, incluindo humanos, e a lista de patógenos prioritários da OMS.
Seis meses depois, a lista de parceiros ganhou organizações de resposta a pandemias como a CEPI e várias universidades especializadas em virologia e bioinformática, e o escopo dos dados foi reduzido de "espécies-chave" para "vírus", com um propósito declarado de forma mais explícita: pesquisa de vacinas e medicamentos. O momento da divulgação também foi estratégico — o comunicado do EMBL menciona que, em 25 de setembro, a Assembleia Geral da ONU realizará uma reunião de alto nível sobre prevenção, preparação e resposta a pandemias, e os dados foram publicados um dia antes desse encontro.
O blog da Nvidia também cita uma estimativa do Center for Global Development: até 2050, a probabilidade de o mundo enfrentar novamente uma pandemia da magnitude da COVID-19 é de cerca de 50%.
Limitações a conhecer antes de usar
O EMBL deixou claros os limites dos dados neste comunicado. As previsões estruturais não podem ser usadas para inferir as consequências de mutações genéticas, nem para determinar como hospedeiro e patógeno interagem, e muito menos para concluir se a virulência ou a transmissibilidade de um vírus vai mudar — qualquer conclusão ainda precisa ser validada em laboratório. Joe Grove, professor de virologia molecular na University of Glasgow, foi direto:
"A protein complex structure alone doesn't tell us what happens when a virus mutates."
(A estrutura de um complexo proteico, isoladamente, não nos diz o que acontece quando um vírus sofre mutação.)
Nenhum dos comunicados aborda diretamente se a divulgação pública de dados estruturais de vírus traz riscos de biossegurança, nem esclarece se a seleção excluiu deliberadamente patógenos de alto risco. As condições de licenciamento dos dados também não foram especificadas pelo EMBL neste anúncio.
Para equipes de biologia estrutural e desenvolvimento de vacinas, este conjunto de dados pode ser baixado e usado diretamente, com uma barreira de entrada baixa; a dificuldade está na etapa seguinte, a validação experimental em laboratório úmido, onde a IA ainda ajuda pouco.
Fontes: comunicado oficial do EMBL-EBI, blog oficial da Nvidia, CocoLoop, Nature News; o número de espécies de vírus, a proporção de 30% de novas interações e o total de 260 milhões de previsões seguem os números divulgados pelo EMBL e pela Nvidia.