Anthropic於9月17日發布一份研究報告,說明如何讓Claude替30多個開源生物分子模型做推理優化,在不到四週內把運算速度平均提升約4倍,準確度幾乎沒有下降。若要求準確度完全不打折,平均加速幅度約1.6倍。所有程式碼已經放上GitHub的anthropics/uplifting-biomolecular-modeling倉庫。
這批模型橫跨四大類:結構預測、蛋白質設計、蛋白質語言模型與基因體學模型。報告點名的有AlphaFold3、OpenFold3、Boltz-2與ColabFold 1.6.3,設計類則涵蓋幻覺式設計、結構生成與逆折疊,底層架構包括擴散模型、流匹配與圖神經網路等。其餘模型報告並未逐一列出。
兩個人加一個模型
這項專案由兩名Anthropic技術人員負責盯場。報告特別交代了兩人的背景:熟悉生物分子建模,但先前沒做過推理優化、也沒寫過GPU核心(kernel)。實際工作由Claude在Claude Science環境中完成,測試過的模型版本包括Mythos 5.1、Mythos 5與Opus 5。
加速手法分成兩層。一層是通用型的:Claude寫了一套名為FlashPairformer的自訂核心,專門處理這類模型裡最吃運算資源的Pairformer模組,其中三角注意力(triangle attention)加速2.7到2.9倍,三角乘法(triangle multiplication)加速1.7到3.2倍。另一層則是逐一針對個別模型處理,例如快取重複計算、剪掉用不到的分支。
至於準確度「幾乎沒有下降」怎麼認定,報告給出了標準:界面預測看DockQ分數,高於0.23算可接受;設計結果則看ipSAE,這是一個與濕實驗結合成功率有相關性的計算分數。
能折疊多大的結構
除了速度,更引人注目的是規模。AlphaFold3先前能預測的上限是7663個token,優化後在單台NVIDIA B300節點上可跑到7萬個token以上,對象包括整個病毒殼體與蛋白質區室這類大型組裝體。
"These are among the largest structures ever folded accurately using structure prediction models."
報告也寫出了邊界:超過7萬token的病毒殼體預測並不準確。硬體門檻同樣存在,大型體系需要B300節點,就連一般任務也要H200等級的顯示卡。
和上個月那輪設計連起來看
8月中旬,Anthropic公布過一輪用Claude從零設計蛋白質結合體的實驗,15個標的裡有14個拿到可用設計,本站當時也做過報導。那一輪是靠多個子代理加上大量提示詞,在Modal雲端上跑,依照這次報告的說法,每個標的成本約1萬美元。
這次改用優化後的模型組合重做蛋白質設計,16個標的的測試中,一張H200、24小時運算時間,GPU加token合計約150美元,Anthropic稱成本大約降了兩個數量級。兩輪的標的並不完全相同,報告也沒有提供這次設計結果的濕實驗驗證數據,所以兩者能直接比較的只有成本與耗時,命中率還得等後續結果。
從8月到9月,Anthropic在生命科學領域的動作順序很清楚:先證明模型能設計出實驗室驗證有效的分子,再回頭改造設計用的工具本身。後者對學術實驗室的影響可能更直接,很多研究團隊手上只有幾張顯示卡,原本折疊不動的大型體系,現在有了一套開源加速版本可以直接拿來試試看。
參考來源:Anthropic研究報告、CocoLoop、anthropics/uplifting-biomolecular-modeling程式碼倉庫;平均加速倍數、FlashPairformer各項加速區間、7663與7萬token上限及單一標的成本口徑,請以報告原文為準。