Viện Tin sinh học châu Âu (EMBL-EBI), thuộc Phòng thí nghiệm Sinh học Phân tử châu Âu (EMBL), ngày 24/9 thông báo cơ sở dữ liệu AlphaFold vừa bổ sung một loạt dự đoán cấu trúc ba chiều của các phức hợp protein virus, bao phủ hơn 2.800 loại virus, có thể tra cứu và tải miễn phí qua Cổng phòng chống đại dịch (Pandemic Preparedness Portal) mới ra mắt trên cơ sở dữ liệu này.
Đây là kết quả hợp tác của nhiều bên. Ngoài EMBL-EBI, Google DeepMind và Nvidia, các đơn vị tham gia còn có Liên minh Đổi mới Sáng tạo Phòng chống Dịch bệnh (CEPI), Đại học Quốc gia Seoul, Đại học Sungkyunkwan, Viện Tin sinh học Thụy Sĩ (SIB) và Đại học Glasgow. Việc dự đoán cấu trúc dùng mô hình AlphaFold2 của DeepMind, được Nvidia tăng tốc bằng runtime suy luận BioNeMo, và toàn bộ quy trình dự đoán cấu trúc này đã được mã nguồn mở trên GitHub.
Bộ dữ liệu lần này có gì
Nguyên tắc chọn virus mà các bên hợp tác đưa ra là ưu tiên những họ virus đã biết lây nhiễm cho người. Thông cáo của EMBL nêu tên hai nhóm: rhinovirus, tác nhân phổ biến gây cảm lạnh thông thường, và các mối đe dọa mới nổi như virus gây bệnh đậu mùa khỉ (mpox).
Khác với các dự đoán protein đơn lẻ trước đây, trọng tâm của đợt dữ liệu này là các phức hợp — tức cách nhiều protein kết hợp với nhau để hoạt động. Việc virus xâm nhập tế bào và nhân lên bên trong tế bào phần lớn dựa vào các tương tác giữa protein. Theo blog của Nvidia, khoảng 30% các tương tác protein mới được đưa vào lần này hoàn toàn chưa từng có ghi nhận thực nghiệm hay tài liệu nào trước đó.
"This dataset is an engine for hypothesis generation."
(Bộ dữ liệu này là một cỗ máy để tạo ra các giả thuyết nghiên cứu.)
Từ tháng Ba đến tháng Chín
Nhìn theo dòng thời gian, đợt công bố lần này là bước thứ hai trong năm của cùng một nhóm hợp tác. Ngày 16/3, EMBL-EBI, DeepMind, Nvidia và Đại học Quốc gia Seoul lần đầu đưa các phức hợp vào cơ sở dữ liệu AlphaFold: tổng cộng khoảng 30 triệu phức hợp được dự đoán, trong đó 1,7 triệu homodimer có độ tin cậy cao được đưa thẳng vào cơ sở dữ liệu, cùng khoảng 18 triệu phức hợp có độ tin cậy thấp hơn được mở để tải về, phạm vi loài gồm 20 loài trọng điểm như con người, cộng thêm danh sách mầm bệnh ưu tiên của WHO.
Nửa năm sau, danh sách đối tác có thêm các tổ chức phòng chống dịch như CEPI cùng vài trường đại học chuyên về virus học và tin sinh học, đối tượng dữ liệu cũng thu hẹp từ "loài trọng điểm" xuống "virus", mục đích sử dụng được nêu rõ hơn: phục vụ nghiên cứu vắc-xin và thuốc. Thời điểm công bố cũng có chủ đích — thông cáo của EMBL nhắc rằng ngày 25/9, Đại hội đồng Liên Hợp Quốc sẽ tổ chức phiên họp cấp cao về phòng chống, chuẩn bị và ứng phó đại dịch, và dữ liệu được đưa lên trước phiên họp này một ngày.
Blog của Nvidia còn dẫn một ước tính từ Trung tâm Phát triển Toàn cầu (Center for Global Development): đến năm 2050, xác suất thế giới phải đối mặt với một đại dịch ở quy mô COVID-19 vào khoảng 50%.
Những giới hạn cần biết trước khi sử dụng
EMBL nêu rõ ranh giới của dữ liệu lần này trong thông cáo. Các dự đoán cấu trúc không thể dùng để suy ra hậu quả của đột biến gen, không thể dùng để phán đoán cách vật chủ và mầm bệnh tương tác, càng không thể dùng để kết luận độc lực hay khả năng lây truyền của virus có thay đổi hay không — mọi kết luận đều cần quay lại kiểm chứng trong phòng thí nghiệm. Giáo sư virus học phân tử Joe Grove của Đại học Glasgow nói thẳng:
"A protein complex structure alone doesn't tell us what happens when a virus mutates."
(Chỉ riêng cấu trúc phức hợp protein thì không thể cho chúng ta biết điều gì sẽ xảy ra khi virus đột biến.)
Việc công khai dữ liệu cấu trúc virus có kéo theo rủi ro an toàn sinh học hay không, các thông cáo này đều không đề cập trực tiếp, cũng không nói rõ khi chọn lọc có chủ động loại trừ một số mầm bệnh nguy hiểm cao hay không. Điều khoản cấp phép sử dụng dữ liệu cũng không được EMBL nêu rõ trong lần công bố này.
Với các nhóm nghiên cứu sinh học cấu trúc và phát triển vắc-xin, bộ dữ liệu này có thể tải về và sử dụng ngay, ngưỡng gia nhập không cao; điểm khó nằm ở bước xác thực thực nghiệm ướt (wet-lab) phía sau, bước mà AI chưa giúp được nhiều.
Nguồn tham khảo: Thông cáo chính thức của EMBL-EBI, blog chính thức của Nvidia, CocoLoop, tin tức Nature; số loại virus, tỷ lệ 30% tương tác mới và tổng số 260 triệu dự đoán theo số liệu công bố của EMBL và Nvidia.