歐洲分子生物學實驗室(EMBL)旗下的歐洲生物資訊研究所(EMBL-EBI)9月24日宣布,AlphaFold資料庫新增一批病毒蛋白複合物的三維結構預測,涵蓋逾2800種病毒,可透過資料庫新開設的「大流行防範入口網站」免費查詢與下載。
這次是多方合作的成果。參與機構除了EMBL-EBI、Google DeepMind與輝達之外,還有流行病防範創新聯盟(CEPI)、首爾大學、成均館大學、瑞士生物資訊研究所與格拉斯哥大學。結構預測採用DeepMind的AlphaFold2,輝達提供BioNeMo推論運行環境加速運算,並將整套結構預測流程開源在GitHub上。
這批資料裡有什麼
在挑選病毒對象時,合作團隊優先考量已知會感染人類的病毒科。EMBL的公告點名了兩類:一類是造成普通感冒的鼻病毒,另一類則是猴痘這類新興威脅。
與過去單一蛋白質的預測不同,這批資料的重點放在複合物,也就是多條蛋白質如何組合在一起發揮作用。病毒入侵細胞、在細胞內複製,許多環節都仰賴蛋白質之間的結合。根據輝達部落格的說法,新增的蛋白質交互作用中,約三成完全是新發現,先前沒有任何實驗或文獻紀錄。
"This dataset is an engine for hypothesis generation."
從三月到九月
把時間軸串起來看,這次發布是同一批團隊今年的第二步。今年3月16日,EMBL-EBI、DeepMind、輝達與首爾大學首度將複合物納入AlphaFold資料庫:總計預測約3000萬個,其中高信心度的170萬個同源二聚體直接收錄進資料庫,另有約1800萬個信心度較低者釋出供下載,涵蓋範圍是人類等20個重點物種,外加世界衛生組織的重點病原體清單。
半年後,名單上多了CEPI這類防疫組織以及幾所病毒學、生物資訊學院校,鎖定對象也從「重點物種」收窄為「病毒」,用途也寫得更直白:疫苗與藥物研發。發布時間點同樣有考量,EMBL公告提到,9月25日聯合國大會將召開大流行防範、整備與應變問題高階會議,資料搶在會議前一天上線。
輝達部落格還引用了全球發展中心(Center for Global Development)的一項估算:到2050年,全球再度遭遇COVID-19等級疫情的機率約為50%。
使用前要知道的限制
EMBL這次在公告中把界線劃得很清楚。結構預測不能用來推斷基因突變的後果,也無法判斷宿主與病原體之間如何互動,更不能據此判斷病毒的毒性、傳播力是否會改變,任何結論都仍須回到實驗室驗證。格拉斯哥大學分子病毒學教授Joe Grove的說法很直接:
"A protein complex structure alone doesn't tell us what happens when a virus mutates."
病毒結構資料公開是否會帶來生物安全風險,這幾份公告都沒有正面討論,也沒說明篩選時是否刻意排除了某些高風險病原體。至於資料的授權條款,EMBL這次公告同樣沒有寫明。
對中國大陸的結構生物學與疫苗研發團隊來說,這批資料可以直接下載使用,門檻不高;難的是後續的濕實驗驗證,那一步AI幫不上太多忙。
參考來源:EMBL-EBI官方公告、輝達官方部落格、CocoLoop、Nature新聞;病毒數量、三成新交互作用比例與2.6億筆預測總量,以EMBL與輝達公告為準。