Anthropic 在 8 月 18 日放出了一份实验记录:让 Claude 从头设计能结合指定蛋白靶点的小分子结合体,15 个靶点里有 14 个拿到了可用设计。合成和检测由 Adaptyv Bio 与 Twist Bioscience 完成,并非模型自己打分。
数字比结论更有说服力。多目标模式下,Mythos Preview 的命中率是 26.7%,Opus 4.8 是 22.6%;切换到单靶点专攻,Mythos Preview 升到 35.1%。作为参照,这个领域公开报道的典型命中率在 10% 到 15% 之间。总量上,1320 个设计产出 354 个经实验验证的结合体,6 个靶点拿到了高亲和力结合体,其中 4 个靶点的设计达到或超过了已发表的最佳水平。
挑出来的几个硬骨头
RBX1 这个靶点最能说明差距。Claude 在它身上的命中率是 40%,而同题竞赛的参赛者平均只有 3.7%,最终设计也压过了当年的获奖作品。
TNFα 上做的是跨物种:同一批设计同时结合人、猕猴和小鼠的蛋白。这一条在药物研发里的分量不小,动物实验和人体试验能不能共用一个分子,直接决定前期开发周期。
还有一组专门挑难度:设计 β-折叠含量高的结合体。这类结构在计算设计里历来不好搞,因为 β-链之间的配对容错空间小。这一轮做出了 15 个 β-链占比不低于 20% 的有效结合体。
失败的部分官方也写了:BBF-14 和 MBP 两个靶点表现不佳。一份只报喜的实验记录不会有人信,这两项列出来反而抬高了其余数据的可信度。
算力账
这套流程不便宜。多目标模式一轮最多消耗 12500 个 NVIDIA H100 小时,墙钟时间 48 小时;单靶点模式每个靶点 2500 H100 小时,跑 24 小时。初始提示词大约 3 万 token。
按当前云上 H100 的常见租赁价粗算,2 到 3 美元一卡时,12500 卡时对应两三万美元一轮,摊到 15 个靶点,单靶点两千美元上下。这个数字放在药物早期发现的预算里不算什么——一轮蛋白质合成加亲和力检测的湿实验成本本身就在同一量级,而传统路径要靠多轮试错去逼近同样的命中率。算力成了这条链路上最便宜的一环,这个结论几年前还不成立。
顺手做的另一件事
同一批实验里还有一段分析化学的测试,用的是 Claude Opus 5。任务是处理真实的实验仪器输出:NMR 谱图 23 分钟处理完,LC-MS 数据 19 分钟。其中 LC-MS 的原始文件是专有格式,模型自己把它解析开,核对了 2664 次扫描的数据。
精度对照是这样的:氢原子计数与人工结果的偏差在 0.08 个 ¹H 以内,纯度测定给出 96.4%,实验室对照值是 96.33%。测完之后,模型独立提出了后续该做哪些验证实验,提的方案和实验室原本的安排一致。
这一段的分量可能被前面的蛋白质数据盖过去了。药物发现里最吃人力的并非设计环节,是每天几十上百份谱图的解读和归档,那是博士后的日常。一个能读懂专有格式仪器文件、还能自己判断下一步做什么的模型,动的是这块。
附带的限制
Anthropic 在文中明确写了一句:蛋白质设计和其他双用途生物研究能力,在 Claude Fable 5 上不对一般用户开放。这是一条主动设下的闸门——同一套能力用来设计结合体,也能用来设计别的东西,公司选择把它放在受控通道里,而非直接开进消费级产品。
实验用到的数据集和提示词已经放上 Hugging Face,蛋白质设计和化学分析各有一份技术报告公开。愿意把提示词一起放出来,说明 Anthropic 认为这套方法的门槛在算力和湿实验环节,不在提示工程本身。
参考来源:Anthropic 官方研究页、Adaptyv Bio 与 Twist Bioscience 实验记录、CocoLoop、Hugging Face 公开数据集;核验命中率口径、H100 卡时与纯度测定 96.4% 对照值。