18個模型自主做實驗,最強補上82%人類差距

Prime Intellect公開了一份規模不小的測試:找來18個前沿模型,各自獨立跑一遍AI研究,總共執行153次全自主實驗。每次實驗占用8張H200顯卡,跑最久的一次超過八天。

任務是nanoGPT的最佳化器速通賽,由Keller Jordan發起的社群比賽:把一個1.24億參數的GPT訓練到驗證損失低於3.28,比誰用的訓練步數少。規則訂得很嚴,只能動最佳化器相關的部分,不能連網,其餘全部交給模型自己安排。模型拿到的工具只有一個常駐的IPython核心,從搭建實驗流程、寫程式、跑驗證到推翻自己的假設,全部得自己來。

成績單

起跑點是3290步。人類社群幾十個人花了好幾個月,把紀錄壓到2600步,中間這690步的差距,正是這次要量的東西。

Fable 5跑出2726步,補上其中約82%的差距。Opus 5停在2920步,Kimi K3則是2930步,兩者各自補上大約一半。GPT-5.6 Sol是3042步,GLM 5.3沒有跑出有效成績。

Opus 5和Kimi K3只差10步。粗略算一下,這10步占總差距的1.4%,考慮到nanoGPT訓練本身的雜訊與取樣隨機性,這個先後順序基本上沒有多少解釋力。換句話說,在需要連續好幾天自主推進的任務上,開源模型已經追上第一梯隊的閉源模型——Kimi K3也是唯一擠進前三名的開源選手。

拉開差距的是執行功夫

報告把模型之間的分野歸到執行環節:選哪些實驗做、做得有多仔細、怎麼解讀帶雜訊的結果,每一步都在把差距拉大。

具體來看,表現好的模型在拿到一個邊緣結果時,會先在三個隨機種子上重測,確認結果穩定了才進到全量驗證;也會回頭重做消融實驗,把之前判定為沒效果的方向再翻出來試一次。有幾個模型甚至自己搭了實驗管理流程和小型模擬器。表現差的那些,則常常是在雜訊裡看到根本不存在的進步,接著順著錯誤的結論一路走到底。

這個結論對做工程的人來說不算陌生。調參數這件事的門檻,從來不在讀不讀得懂論文,而在於有沒有耐心把一個可疑的正面結果重複驗證三次。

潑冷水的是「沒有新東西」

報告裡有一句自嘲的話:作者說自己再一次對缺乏新意感到意外。153次實驗跑下來,勝出的方案用的全是現成技巧——預處理(preconditioning)、學習率排程、權重平均——沒有一個模型提出過去沒人試過的方法。

這盆冷水澆在最近關於AI自我改進的討論上,時機抓得剛好。會做實驗和會提出新方法是兩回事,前者已經能自動化到八天不用人管,後者在這份資料裡完全看不到蹤影。

這份資料能推廣多遠

限制條件不少。nanoGPT速通賽本身變異就大,運算預算又不夠讓每個模型跑足夠多次重複來取平均,作者自己也承認,分不清結果裡有多少是這個特定任務的設定造成的、多少反映了模型的真實上限。

單一任務、單一領域、固定的測試環境(harness),換一個研究方向排名會不會翻盤,目前誰也說不準。但把18個模型放進同一套沙盒裡跑上八天,這種規模的公開對照實驗此前沒有出現過,光是把變異攤在檯面上,就比一堆互相沒辦法比較的自我評測有用得多。

參考來源:Prime Intellect研究部落格與實驗程式庫、CocoLoop、量子位;各模型步數與基準已核對nanoGPT速通賽排行榜。