Google DeepMind 9 月 30 日发布 SynthID Bio,把水印直接写进 AI 设计的蛋白质氨基酸序列里。方法论文同步刊登在《自然》上,代码、体外实验数据和模型权重都已开放给研究社区。
这套工具要回答的问题很具体:一段蛋白质序列摆在面前,能不能验证它出自某个可信的 AI 设计流程。DeepMind 把它定位成来源验证手段,它判断不了一个蛋白质危不危险。
水印怎么写进去
SynthID Bio 接在蛋白设计工具 ProteinMPNN 上。ProteinMPNN 的工作方式是沿着蛋白骨架一个位置一个位置地放氨基酸,每一步都有多个化学性质相近的候选,比如亮氨酸、异亮氨酸和缬氨酸在很多位置可以互换。
SynthID Bio 在这一步插手:它根据一把水印密钥和前面已选的氨基酸,给出一个建议。只有在不影响蛋白功能的前提下,设计流程才采纳这个建议。单看任何一个位置都看不出异样,整条序列读下来,符合密钥偏好的氨基酸会比随机情况多出一截。
检测也靠统计。持有密钥的一方扫描整条序列,数一数有多少位置落在密钥建议上,再跟阈值比较。Ars Technica 的报道提醒,阈值怎么定会直接改变误报和漏报的比例,结果是一个概率判断。
实验结果
团队用带水印的流程设计了针对三个靶点的结合蛋白:血管内皮生长因子 VEGF-A、新冠病毒刺突蛋白的受体结合域、免疫检查点蛋白 PD-L1。体外测试显示,带水印的设计在命中率和结合亲和力上与无水印版本持平,序列多样性也没有下降。DeepMind 称这是首批带水印、且有生物学功能的蛋白结合物。
他们还把同样的思路用在 AlphaFold 3 的结构预测输出上,检测效果接近完美,对数字噪声和小幅坐标改动也扛得住。
DNA 合成公司 Twist Bioscience 负责政策与生物安全的副总裁 James Diggans 给出了评价:
“AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly.”(AI 正在扩大科学家能设计的范围,DNA 合成公司在帮助这类创新负责任地扩张上扮演重要角色。)
和文本水印放在一起看
SynthID 最早用在图片上,后来扩展到文本、音频和视频,文本水印在 2024 年开源。站内此前写过 OpenAI 把谷歌水印装进 ChatGPT,也写过 Anthropic 给 Claude 输出埋隐形水印。这些方案的共同弱点是改写:把一段文字换个说法,统计信号就会被稀释。
蛋白质这边也有对应的”改写”。报道列了几种:很短的蛋白容纳不下足够多的水印位点;在带水印的序列后面接一段天然序列(比如融合一个荧光蛋白),信号会被冲淡;不少蛋白设计工具不基于 ProteinMPNN,也不走逐个放置氨基酸的路线,水印接不进去。DeepMind 自己也承认,面对蓄意篡改的鲁棒性仍是难点。
还有一层是密钥管理。整个体系的可信度取决于谁持有密钥、怎么分发、出了泄露怎么办,这部分目前没有成型的行业安排。
放在生物安全链条的哪一环
现有的生物安全防线主要压在 DNA 合成环节:合成公司拿订单序列去比对已知的危险序列库。AI 设计出来的新蛋白可能跟任何已知序列都不像,比对就会漏掉。水印提供的是另一条线索,告诉合成公司这条序列来自一个登记过的设计流程。
它补的是来源这一块,对危害判断帮不上忙。一个没有水印的序列,可能只是用了别的工具;一个带水印的序列,也不代表它无害。DeepMind 在公告里写明,没有哪一项生物安全措施能单独解决问题。目前 DeepMind 通过 synthidbio@google.com 接洽合作方,有多少合成公司、设计工具会接入,还要看后续进展。
参考来源:Google DeepMind 官方博客、《自然》方法论文、CocoLoop、Ars Technica;靶点、命中率与亲和力比较以论文和官方博客口径为准,局限部分参考 Ars Technica 对方法的解读。