Anthropic在8月18日公布一份實驗紀錄:讓Claude從零開始設計能結合指定蛋白質標靶的小分子結合物,15個標靶裡有14個拿到可用設計。合成與檢測由Adaptyv Bio與Twist Bioscience完成,並非模型自己打分。
數字比結論更有說服力。在多目標模式下,Mythos Preview的命中率是26.7%,Opus 4.8是22.6%;切換成單一標靶專攻後,Mythos Preview拉高到35.1%。作為對照,這個領域公開報導的典型命中率落在10%到15%之間。整體來看,1320個設計產出354個經實驗驗證的結合物,6個標靶拿到高親和力結合物,其中4個標靶的設計達到甚至超越已發表的最佳水準。
挑出來的幾個硬骨頭
RBX1這個標靶最能說明差距。Claude在它身上的命中率是40%,而同一題競賽的參賽者平均只有3.7%,最終設計甚至壓過當年的得獎作品。
TNFα上做的是跨物種設計:同一批設計同時結合人類、獼猴與小鼠的蛋白質。這一點在藥物研發裡分量不輕,動物實驗與人體試驗能不能共用同一個分子,直接決定前期開發的時程長短。
還有一組專門挑難度:設計β-摺疊含量高的結合物。這類結構在計算設計裡向來不好處理,因為β-鏈之間的配對容錯空間很小。這一輪做出15個β-鏈占比不低於20%的有效結合物。
失敗的部分官方也寫了出來:BBF-14與MBP兩個標靶表現不佳。一份只報喜不報憂的實驗紀錄不會有人相信,把這兩項列出來,反而拉高了其餘數據的可信度。
運算成本這筆帳
這套流程並不便宜。多目標模式一輪最多消耗12500個NVIDIA H100工時,實際耗時48小時;單標靶模式每個標靶2500 H100工時,跑24小時。初始提示詞大約三萬token。
以目前雲端H100常見的租用價粗估,每卡時2到3美元,12500卡時對應一輪兩到三萬美元,攤到15個標靶,單一標靶大約落在兩千美元上下。這個數字放進藥物早期開發的預算裡並不算什麼——一輪蛋白質合成加親和力檢測的濕實驗成本本身就是同一量級,而傳統路徑得靠多輪試誤才能逼近同樣的命中率。運算資源反而成了這條鏈路上最便宜的一環,這個結論放在幾年前根本不成立。
順手做的另一件事
同一批實驗裡還有一段分析化學測試,用的是Claude Opus 5。任務是處理真實的實驗儀器輸出:NMR圖譜23分鐘處理完畢,LC-MS數據19分鐘。其中LC-MS的原始檔案是專有格式,模型自己把它解析開,核對了2664次掃描的數據。
精度對照是這樣的:氫原子計數與人工結果的偏差在0.08個¹H以內,純度測定給出96.4%,實驗室對照值是96.33%。測完之後,模型還主動提出後續該進行哪些驗證實驗,提出的方案與實驗室原本的安排一致。
這段的分量可能被前面的蛋白質數據蓋過去。藥物開發裡最耗人力的並非設計環節,而是每天幾十上百份圖譜的判讀與歸檔,那是博士後研究員的日常。一個能讀懂專有格式儀器檔案、還能自己判斷下一步該做什麼的模型,動的正是這一塊。
附帶的限制
Anthropic在文中明白寫了一句:蛋白質設計以及其他具雙重用途風險的生物研究能力,在Claude Fable 5上不對一般使用者開放。這是一道主動設下的關卡——同一套能力用來設計結合物,也能拿去設計別的東西,公司選擇把它放進受控通道,而不是直接開放進消費級產品。
實驗用到的資料集與提示詞已經放上Hugging Face,蛋白質設計與化學分析各自公開一份技術報告。願意把提示詞一併公開,說明Anthropic認為這套方法的門檻在於運算資源與濕實驗環節,不在提示工程本身。
參考來源:Anthropic官方研究頁面、Adaptyv Bio與Twist Bioscience實驗紀錄、CocoLoop、Hugging Face公開資料集;已核驗命中率口徑、H100工時與純度測定96.4%對照值。