AlphaFold、ウイルス複合体2800種超を追加

欧州分子生物学研究所(EMBL)傘下の欧州バイオインフォマティクス研究所(EMBL-EBI)は9月24日、AlphaFoldデータベースに新たにウイルスタンパク質複合体の立体構造予測を追加したと発表した。対象は2800種を超えるウイルスで、データベースに新設された「パンデミック備え(Pandemic Preparedness)ポータル」を通じて無料で検索・ダウンロードできる。

今回は複数機関による共同の成果だ。EMBL-EBI、Google DeepMind、NVIDIAに加え、流行対策イノベーション連合(CEPI)、ソウル大学、成均館大学、スイス生命情報学研究所、グラスゴー大学が参加した。構造予測にはDeepMindのAlphaFold2を用い、NVIDIAが提供する推論ランタイム「BioNeMo」で高速化した。この構造予測パイプラインはGitHub上でオープンソース化されている。

今回のデータに含まれるもの

対象ウイルスの選定では、ヒトに感染することが分かっているウイルス科を優先した。EMBLの発表では、一般的な風邪の原因となるライノウイルスと、サル痘のような新興の脅威という2つのカテゴリーが名指しされている。

従来の単一タンパク質の予測とは異なり、今回の重点は複合体、つまり複数のタンパク質がどう組み合わさって機能するかにある。ウイルスが細胞に侵入し、細胞内で複製する過程の多くはタンパク質同士の結合に依存している。NVIDIAのブログによると、新たに加わったタンパク質相互作用のうち約3割は、実験や文献による記録が一切なかった完全に新規のものだという。

"This dataset is an engine for hypothesis generation."

3月から9月へ

時系列で見ると、今回の発表は同じ顔ぶれによる今年2度目の一歩だ。3月16日、EMBL-EBI、DeepMind、NVIDIA、ソウル大学は初めてAlphaFoldデータベースに複合体を追加した。このときは約3000万件を予測し、高信頼度のホモ二量体170万件をデータベースに直接収録、信頼度がやや低い約1800万件をダウンロード用として公開した。対象種はヒトを含む重点20種と、WHOの重点病原体リストだった。

半年後の今回、参加リストにはCEPIのような防疫組織やウイルス学・バイオインフォマティクス系の大学がいくつか加わり、対象も「重点種」から「ウイルス」へと絞り込まれた。用途もより明確になり、ワクチンと医薬品の開発が掲げられている。発表のタイミングにも意味がある。EMBLの発表によれば、9月25日に国連総会でパンデミックの予防・備え・対応に関するハイレベル会合が開かれる予定で、データはその前日に公開された。

NVIDIAのブログは、グローバル開発センター(Center for Global Development)による試算も引用している。それによると、2050年までに世界が新型コロナ級のパンデミックに再び見舞われる確率は約50%だという。

利用前に知っておくべき限界

EMBLは今回の発表で、データの限界について明確に線引きしている。構造予測は遺伝子変異の影響を推測する用途には使えず、宿主と病原体の相互作用の判断にも使えない。ウイルスの毒性や感染力が変化するかどうかの判断にはなおさら使えず、いかなる結論も実験室での検証に立ち返る必要があるという。グラスゴー大学の分子ウイルス学教授ジョー・グローブ氏の言葉は率直だ。

"A protein complex structure alone doesn't tell us what happens when a virus mutates."

ウイルス構造データの公開がバイオセキュリティ上のリスクをもたらすかどうかについては、いずれの発表も正面から論じていない。選定にあたって高リスクの病原体を意図的に除外したかどうかの説明もない。データのライセンス条件についても、EMBLの今回の発表には明記がなかった。

中国国内の構造生物学・ワクチン開発チームにとって、このデータは直接ダウンロードして使える上に敷居も低い。難しいのはその先のウェット実験による検証で、そこはAIがあまり力になれない部分だ。

参考資料:EMBL-EBI公式発表、NVIDIA公式ブログ、CocoLoop、Natureニュース。ウイルスの種類数、新規相互作用の割合3割、予測総数2億6000万件はEMBLおよびNVIDIAの発表に基づく。