Dwarkesh Patel 与 Jerry Han 在 9 月 8 日公开了一组预训练对照实验的结果:2019 到 2025 年之间,在 1e19 FLOPs 的算力预算下,来自数据改进的算力效率提升是 12.0 倍,来自模型改进的是 3.7 倍,前者是后者的 3.24 倍。
实验怎么做的
两人把模型配方和数据语料按年份拆成两条轴,交叉组合起来训练。模型这条轴从 2019 年的 GPT-2 排到 2025 年的 OLMo-2,中间放了 GPT-3 和 NeoX 的配方;数据这条轴从 2019 年的 OpenWebText 排到 2025 年的 UltraFineWeb,中间是 The Pile。OpenWebText 大约 90 亿 token,现代语料要大出好几个量级。
算力预算取了五档:1e17、3.16e17、1e18、3.16e18、1e19 FLOPs,按 C = 6ND 的名义口径计算。评测用 OLMES,它把 10 个相对简单的基准聚合起来,多数是多选题问答。两人选它,不选交叉熵损失,原因写得很直白:各组实验用的数据集不一样,loss 之间没法直接比。
把结果放进线性回归,一个把数据项和模型项相加的模型解释了 88% 的方差。
年化下来的数字更小
按年折算,模型侧的算力效率年化提升是 1.24 倍,数据侧是 1.51 倍,两项合起来 1.57 倍。
1.57 倍低于此前的行业估计。Anson Ho 等人给出的均值是 3 倍,差了将近一半。作者没有绕开这一点,把差异归到两处:他们的实验规模太小,很多增益在这个量级上根本显现不出来;小规模训练也没有覆盖推理侧的优化。
这两组数字不能对着直接用。一个是受控的小规模对照实验,变量干净,往上外推的余地有限;一个是对整个行业的宏观估计,覆盖面大,但拆不开增益的来源。这项工作的用处在于把”数据”和”模型”分开称了重,3.24 这个具体倍数反倒是次要的。
作者自己留下的口子
原文里有一句判断比结论更该记下来:
“if the gains are limited, then the main driver of pretraining progress will stall, because we’re not generating more internet, and you can only curate a fixed set of data by so much.” (如果增益有限,预训练进步的主要驱动力就会停滞,因为我们不会造出更多互联网,而对一份固定的数据反复清洗,能榨出来的也就那么多。)
作者同时列了四条局限。第一,实验规模小到拿不到很多增益。第二,算力乘数对选哪套模型配方、哪份语料相当敏感,换一组结果会变。第三,他们只研究了从 Common Crawl 做清洗这一类方法,没有覆盖从新来源采集高质量数据、人类专家生成数据、合成数据生成这三条路。第四,换一套基准,结论”会很不一样”。
第三条尤其要紧。这两年公开讨论里被反复提到的增量来源,正好落在他们没测的那三类里面。这份实验回答的是过去六年清洗互联网数据这条路走了多远,至于往后还剩多少路,它没有给答案。
参考来源:Dwarkesh Podcast 原文、OLMES 基准说明、CocoLoop;算力效率倍数与年化增速以原文 1e19 FLOPs 口径为准,行业 3 倍估计引自 Anson Ho 等人研究。