DeepMind gắn watermark vào protein do AI thiết kế

Ngày 30/9, Google DeepMind công bố SynthID Bio, công cụ gắn watermark trực tiếp vào trình tự axit amin của protein do AI thiết kế. Bài báo phương pháp được đăng đồng thời trên tạp chí Nature, còn mã nguồn, dữ liệu thử nghiệm in vitro và trọng số mô hình đều đã mở cho cộng đồng nghiên cứu.

Câu hỏi mà công cụ này muốn trả lời rất cụ thể: nhìn vào một trình tự protein, có thể xác minh nó có xuất phát từ một quy trình thiết kế AI đáng tin cậy hay không. DeepMind định vị đây là công cụ xác minh nguồn gốc, không phải công cụ đánh giá mức độ nguy hiểm của protein.

Watermark được gắn vào như thế nào

SynthID Bio được ghép vào công cụ thiết kế protein ProteinMPNN. ProteinMPNN hoạt động bằng cách đặt từng axit amin vào từng vị trí trên khung protein, và ở nhiều vị trí luôn có nhiều lựa chọn có tính chất hóa học gần giống nhau — ví dụ leucine, isoleucine và valine có thể thay thế lẫn nhau ở không ít vị trí.

SynthID Bio can thiệp đúng vào bước này: dựa trên một khóa watermark và các axit amin đã chọn trước đó, nó đưa ra một gợi ý. Quy trình thiết kế chỉ chấp nhận gợi ý này khi không ảnh hưởng đến chức năng của protein. Nhìn vào riêng từng vị trí sẽ không thấy gì khác lạ, nhưng xét toàn bộ trình tự, số axit amin khớp với thiên hướng của khóa sẽ nhiều hơn mức ngẫu nhiên.

Việc phát hiện cũng dựa trên thống kê. Bên nắm khóa quét toàn bộ trình tự, đếm số vị trí khớp với gợi ý của khóa rồi so với một ngưỡng. Ars Technica lưu ý rằng cách đặt ngưỡng sẽ trực tiếp thay đổi tỷ lệ báo sai và bỏ sót, nên kết quả cuối cùng chỉ là một phán đoán xác suất.

Kết quả thử nghiệm

Nhóm nghiên cứu dùng quy trình có watermark để thiết kế các protein gắn đích cho ba mục tiêu: yếu tố tăng trưởng nội mô mạch máu VEGF-A, vùng gắn thụ thể (RBD) của protein gai virus corona, và protein điểm kiểm soát miễn dịch PD-L1. Thử nghiệm in vitro cho thấy thiết kế có watermark đạt tỷ lệ trúng đích và độ gắn kết tương đương phiên bản không watermark, độ đa dạng trình tự cũng không giảm. DeepMind gọi đây là những protein gắn đích đầu tiên vừa có watermark vừa có chức năng sinh học thực sự.

Họ còn áp dụng cùng ý tưởng này cho đầu ra dự đoán cấu trúc của AlphaFold 3, hiệu quả phát hiện gần như hoàn hảo, đồng thời chịu được nhiễu số và những thay đổi nhỏ về tọa độ.

"AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly." (AI đang mở rộng những gì các nhà khoa học có thể thiết kế, và các công ty tổng hợp DNA đóng vai trò quan trọng trong việc giúp sự đổi mới đó mở rộng một cách có trách nhiệm.)

Đó là nhận định của James Diggans, Phó chủ tịch phụ trách chính sách và an toàn sinh học tại công ty tổng hợp DNA Twist Bioscience.

Đặt cạnh watermark văn bản

SynthID ban đầu chỉ dùng cho hình ảnh, sau đó mở rộng sang văn bản, âm thanh và video; watermark văn bản đã được mở nguồn từ năm 2024. Trang này từng viết về việc OpenAI đưa watermark của Google vào ChatGPT, và về việc Anthropic gắn watermark vô hình vào đầu ra của Claude. Điểm yếu chung của các giải pháp này là việc viết lại: chỉ cần diễn đạt lại một đoạn văn bản theo cách khác, tín hiệu thống kê sẽ bị pha loãng.

Ở protein cũng có kiểu "viết lại" tương ứng. Theo các báo cáo, một protein quá ngắn sẽ không chứa đủ vị trí để gắn watermark; nối thêm một đoạn trình tự tự nhiên vào sau đoạn có watermark (ví dụ ghép thêm một protein phát huỳnh quang) sẽ làm loãng tín hiệu; không ít công cụ thiết kế protein khác không dựa trên ProteinMPNN và không đặt axit amin theo từng vị trí, nên watermark không gắn được vào. DeepMind cũng tự nhận rằng khả năng chống chịu trước hành vi can thiệp có chủ ý vẫn là một thách thức.

Còn có vấn đề quản lý khóa. Độ tin cậy của toàn bộ hệ thống phụ thuộc vào việc ai nắm khóa, phân phối ra sao, và xử lý thế nào nếu khóa bị lộ — phần này hiện chưa có một quy chuẩn ngành nào hoàn chỉnh.

Vị trí của nó trong chuỗi an toàn sinh học

Các tuyến phòng vệ an toàn sinh học hiện nay chủ yếu đặt ở khâu tổng hợp DNA: công ty tổng hợp đối chiếu trình tự trong đơn hàng với các cơ sở dữ liệu trình tự nguy hiểm đã biết. Những protein mới do AI thiết kế có thể không giống bất kỳ trình tự đã biết nào, nên việc đối chiếu sẽ bỏ sót. Watermark cung cấp một manh mối khác: cho công ty tổng hợp biết trình tự này xuất phát từ một quy trình thiết kế đã đăng ký.

Nó bổ sung cho mảng xác minh nguồn gốc, chứ không giúp gì cho việc đánh giá mức độ nguy hại. Một trình tự không có watermark có thể chỉ là dùng công cụ khác; một trình tự có watermark cũng không có nghĩa là nó vô hại. DeepMind nêu rõ trong thông báo rằng không một biện pháp an toàn sinh học đơn lẻ nào có thể giải quyết được toàn bộ vấn đề. Hiện DeepMind liên hệ với các đối tác qua địa chỉ synthidbio@google.com, còn có bao nhiêu công ty tổng hợp và công cụ thiết kế sẽ tích hợp thì vẫn phải chờ diễn biến tiếp theo.

Nguồn tham khảo: Blog chính thức của Google DeepMind, bài báo phương pháp trên Nature, CocoLoop, Ars Technica; so sánh về đích tác động, tỷ lệ trúng đích và độ gắn kết theo bài báo và blog chính thức, phần hạn chế tham khảo cách diễn giải của Ars Technica.