預訓練進步中資料貢獻是模型的三倍

Dwarkesh Patel與Jerry Han在9月8日公開了一組預訓練對照實驗的結果:2019年到2025年之間,在1e19 FLOPs的運算預算下,來自資料改善的運算效率提升是12.0倍,來自模型改善的是3.7倍,前者是後者的3.24倍。

實驗怎麼做的

兩人把模型配方和資料語料按年份拆成兩條軸,交叉組合起來訓練。模型這條軸從2019年的GPT-2排到2025年的OLMo-2,中間放了GPT-3和NeoX的配方;資料這條軸從2019年的OpenWebText排到2025年的UltraFineWeb,中間是The Pile。OpenWebText大約90億個token,現代語料要大出好幾個量級。

運算預算取了五檔:1e17、3.16e17、1e18、3.16e18、1e19 FLOPs,按C = 6ND的名義口徑計算。評測用OLMES,它把10個相對簡單的基準彙整起來,多數是選擇題問答。兩人選它,不選交叉熵損失,原因寫得很直白:各組實驗用的資料集不一樣,損失值之間沒辦法直接比較。

把結果放進線性迴歸,一個把資料項和模型項相加的模型解釋了88%的變異數。

年化下來的數字更小

按年折算,模型端的運算效率年化提升是1.24倍,資料端是1.51倍,兩項合起來1.57倍。

1.57倍低於先前的業界估計。Anson Ho等人給出的平均值是3倍,差了將近一半。作者沒有迴避這一點,把差異歸到兩處:他們的實驗規模太小,很多增益在這個量級上根本顯現不出來;小規模訓練也沒有涵蓋推論端的最佳化。

這兩組數字不能直接拿來對比。一個是受控的小規模對照實驗,變數乾淨,往上外推的空間有限;一個是對整個產業的宏觀估計,涵蓋面廣,但拆解不開增益的來源。這項研究的價值在於把「資料」和「模型」分開秤重,3.24這個具體倍數反而是次要的。

作者自己留下的但書

原文裡有一句判斷比結論更該記下來:

"if the gains are limited, then the main driver of pretraining progress will stall, because we're not generating more internet, and you can only curate a fixed set of data by so much."

(意譯:如果增益有限,預訓練進步的主要驅動力就會停滯,因為我們不會生出更多網路內容,而對一份固定的資料反覆清理,能榨出來的也就那麼多。)

作者同時列了四條侷限。第一,實驗規模小到抓不住很多增益。第二,運算倍數對選哪套模型配方、哪份語料相當敏感,換一組結果就會變。第三,他們只研究了從Common Crawl做清理這一類方法,沒有涵蓋從新來源蒐集高品質資料、人類專家生成資料、合成資料生成這三條路。第四,換一套基準,結論「會很不一樣」。

第三條尤其要緊。這兩年公開討論裡被反覆提到的增量來源,正好落在他們沒測的那三類裡面。這份實驗回答的是過去六年清理網路資料這條路走了多遠,至於往後還剩多少路,它沒有給答案。

參考來源:Dwarkesh Podcast原文、OLMES基準說明、CocoLoop;運算效率倍數與年化增速以原文1e19 FLOPs口徑為準,產業3倍估計引自Anson Ho等人研究。