Ngày 17 tháng 9, Anthropic công bố một báo cáo nghiên cứu: công ty cho Claude tối ưu suy luận cho hơn 30 mô hình sinh học phân tử mã nguồn mở, trong chưa đầy bốn tuần đã tăng tốc độ chạy trung bình khoảng 4 lần, tổn thất độ chính xác rất nhỏ. Nếu yêu cầu độ chính xác không giảm chút nào, mức tăng tốc trung bình khoảng 1,6 lần. Toàn bộ mã nguồn đã được đưa lên kho GitHub anthropics/uplifting-biomolecular-modeling.
Nhóm mô hình này trải rộng bốn loại: dự đoán cấu trúc, thiết kế protein, mô hình ngôn ngữ protein và mô hình gen học. Báo cáo nêu đích danh AlphaFold3, OpenFold3, Boltz-2 và ColabFold 1.6.3; phần thiết kế bao gồm thiết kế kiểu hallucination, sinh cấu trúc và inverse folding, dựa trên các kiến trúc nền như khuếch tán (diffusion), flow matching và mạng nơ-ron đồ thị. Các mô hình còn lại không được báo cáo liệt kê từng cái.
Hai người và một mô hình
Dự án do hai nhân viên kỹ thuật của Anthropic phụ trách theo dõi. Báo cáo đặc biệt nêu rõ nền tảng của họ: quen thuộc với mô hình hóa sinh học phân tử, nhưng trước đó chưa từng làm tối ưu suy luận, cũng chưa từng viết kernel GPU. Công việc cụ thể do Claude thực hiện trong môi trường Claude Science; các phiên bản mô hình được thử nghiệm gồm Mythos 5.1, Mythos 5 và Opus 5.
Cách tăng tốc chia làm hai tầng. Một tầng mang tính phổ quát: Claude viết một kernel tùy chỉnh có tên FlashPairformer, chuyên xử lý module Pairformer tốn tài nguyên tính toán nhất trong nhóm mô hình này, trong đó triangle attention tăng tốc 2,7 đến 2,9 lần, triangle multiplication tăng tốc 1,7 đến 3,2 lần. Tầng còn lại xử lý theo từng mô hình riêng lẻ, ví dụ như lưu đệm (cache) các phép tính lặp lại hoặc cắt bỏ những nhánh không dùng đến.
Về cách đo mức tổn thất chính xác rất nhỏ đó, báo cáo đưa ra tiêu chí: dự đoán giao diện (interface) xem điểm DockQ, trên 0,23 được coi là chấp nhận được; kết quả thiết kế xem ipSAE, một điểm số tính toán có tương quan với tỷ lệ thành công khi thử nghiệm thực tế trong phòng thí nghiệm.
Gấp được vật thể lớn đến mức nào
Ngoài tốc độ, điều nổi bật hơn là quy mô. Giới hạn trước đây của AlphaFold3 là 7663 token, sau khi tối ưu, trên một node NVIDIA B300 duy nhất đã đạt hơn 70 nghìn token, áp dụng cho toàn bộ vỏ virus (capsid) và các khoang protein — những tổ hợp có kích thước rất lớn.
These are among the largest structures ever folded accurately using structure prediction models.
Tạm dịch: đây là một trong những cấu trúc lớn nhất từng được gấp chính xác bằng các mô hình dự đoán cấu trúc.
Báo cáo cũng nêu rõ giới hạn: dự đoán vỏ virus vượt quá 70 nghìn token thì không còn chính xác. Rào cản phần cứng vẫn còn đó — hệ thống lớn cần node B300, còn tác vụ thông thường cũng cần card ở mức H200 trở lên.
Nhìn lại cùng đợt thiết kế tháng trước
Giữa tháng 8, Anthropic từng công bố một thử nghiệm để Claude thiết kế protein liên kết (binder) từ đầu — trong 15 mục tiêu, 14 mục tiêu cho ra thiết kế dùng được, việc này trang tin đã từng đưa tin. Đợt đó dùng nhiều sub-agent cùng lượng prompt lớn, chạy trên nền tảng đám mây Modal; theo báo cáo mới này, chi phí khoảng 10.000 USD cho mỗi mục tiêu.
Lần này, việc thiết kế protein được làm lại với bộ mô hình đã tối ưu: trong phép thử với 16 mục tiêu, chỉ cần một card H200 chạy 24 giờ đồng hồ thực, tổng chi phí GPU và token khoảng 150 USD — Anthropic cho biết chi phí đã giảm khoảng hai bậc độ lớn (hai lần lũy thừa 10). Do mục tiêu ở hai đợt không hoàn toàn trùng nhau, và báo cáo cũng không đưa ra dữ liệu xác thực trong phòng thí nghiệm thực tế cho kết quả thiết kế lần này, nên chỉ có thể so sánh trực tiếp về chi phí và thời gian; tỷ lệ thành công phải chờ kết quả tiếp theo.
Từ tháng 8 đến tháng 9, trình tự hành động của Anthropic trong lĩnh vực khoa học sự sống khá rõ ràng: trước tiên chứng minh mô hình có thể thiết kế ra phân tử được kiểm chứng hiệu quả trong phòng thí nghiệm, sau đó quay lại cải tiến chính công cụ dùng để thiết kế. Việc thứ hai có thể tác động trực tiếp hơn đến các phòng thí nghiệm học thuật — nhiều nhóm nghiên cứu chỉ có vài card, những hệ thống lớn trước đây không gấp nổi giờ đã có một phiên bản tăng tốc mã nguồn mở để thử trực tiếp.
Nguồn tham khảo: báo cáo nghiên cứu của Anthropic, CocoLoop, kho mã nguồn anthropics/uplifting-biomolecular-modeling; nên đối chiếu báo cáo gốc để kiểm chứng các mức tăng tốc trung bình, khoảng tăng tốc của FlashPairformer, giới hạn 7663 và hơn 70 nghìn token, cùng số liệu chi phí mỗi mục tiêu.