AlphaFold 库收录 2800 多种病毒的蛋白复合物

欧洲分子生物学实验室下属的欧洲生物信息研究所(EMBL-EBI)9 月 24 日宣布,AlphaFold 数据库新增一批病毒蛋白复合物的三维结构预测,覆盖 2800 多种病毒,通过数据库新开的”大流行防范门户”免费查询和下载。

这次是多方合作的结果。参与机构除了 EMBL-EBI、Google DeepMind 和英伟达,还有流行病防范创新联盟(CEPI)、首尔大学、成均馆大学、瑞士生物信息研究所和格拉斯哥大学。结构预测用的是 DeepMind 的 AlphaFold2,英伟达提供 BioNeMo 推理运行时做加速,并把这套结构预测流程开源在 GitHub 上。

这批数据里有什么

选哪些病毒,合作方给的原则是优先看已知会感染人类的病毒科。EMBL 的公告点名了两类:一类是普通感冒常见的鼻病毒,另一类是猴痘这样的新发威胁。

和过去单条蛋白的预测不同,这批数据的重点是复合物,也就是几条蛋白怎么拼在一起工作。病毒入侵细胞、在细胞里复制,很多环节靠的都是蛋白之间的结合。按英伟达博客的说法,新加进去的蛋白相互作用里,约 30% 完全是新的,此前没有实验或文献记录。

英伟达在博客里引用的一句话概括了这批数据的定位:

“This dataset is an engine for hypothesis generation.” (这批数据是用来提出假设的引擎。)

从三月到九月

把时间线串起来看,这次发布是同一班人马年内的第二步。今年 3 月 16 日,EMBL-EBI、DeepMind、英伟达和首尔大学第一次往 AlphaFold 数据库里加复合物:一共预测了约 3000 万个,高置信度的 170 万个同源二聚体直接入库,另有约 1800 万个置信度较低的放出来供下载,物种范围是人类等 20 个重点物种,外加世卫组织重点病原体清单。

半年后,名单里多了 CEPI 这样的防疫组织和几所病毒学、生物信息学院校,对象也从”重点物种”收窄到”病毒”,用途写得更直白:疫苗和药物研发。发布时间也有讲究,EMBL 公告提到,9 月 25 日联合国大会将召开大流行防范、准备与应对问题的高级别会议,数据赶在会前一天上线。

英伟达博客还引用了全球发展中心的一项估算:到 2050 年,全世界再遇上一场 COVID-19 级别疫情的概率约为 50%。

用之前要知道的限制

EMBL 这次在公告里把边界写得很清楚。结构预测不能用来推断基因突变的后果,也不能判断宿主与病原体怎么相互作用,更不能据此判断病毒的毒力、传播力会不会变化,任何结论都还得回到实验室验证。格拉斯哥大学分子病毒学教授 Joe Grove 的说法很直接:

“A protein complex structure alone doesn’t tell us what happens when a virus mutates.” (光有蛋白复合物结构,并不能告诉我们病毒突变后会发生什么。)

病毒结构数据公开会不会带来生物安全风险,这几份公告都没有正面讨论,也没有说明筛选时是否刻意排除了某些高危病原体。数据许可条款,EMBL 这次的公告同样没有写明。

对国内的结构生物学和疫苗研发团队,这批数据可以直接下载使用,门槛不高;难点在后面的湿实验验证,那一步 AI 帮不上太多。

参考来源:EMBL-EBI 官方公告、英伟达官方博客、CocoLoop、Nature 新闻;病毒数量、30% 新相互作用比例与 2.6 亿条预测总量以 EMBL 与英伟达公告口径为准。