En el pre-entrenamiento, los datos aportan el triple que el modelo

El 8 de septiembre, Dwarkesh Patel y Jerry Han publicaron los resultados de una serie de experimentos controlados sobre pre-entrenamiento: entre 2019 y 2025, con un presupuesto computacional fijo de 1e19 FLOPs, la mejora en eficiencia computacional procedente de los datos fue de 12.0 veces, y la procedente del modelo, de 3.7 veces; la primera equivale a 3.24 veces la segunda.

Cómo se diseñó el experimento

Los dos autores dividieron las recetas de modelo y los corpus de datos en dos ejes ordenados por año y los combinaron de forma cruzada para el entrenamiento. El eje de modelos va de GPT-2 (2019) a OLMo-2 (2025), pasando por las recetas de GPT-3 y NeoX. El eje de datos va de OpenWebText (2019) a UltraFineWeb (2025), pasando por The Pile. OpenWebText tiene alrededor de 9.000 millones de tokens, mientras que los corpus modernos son órdenes de magnitud mayores.

Se eligieron cinco niveles de presupuesto computacional: 1e17, 3.16e17, 1e18, 3.16e18 y 1e19 FLOPs, calculados con la fórmula nominal C = 6ND. La evaluación usó OLMES, que agrupa 10 benchmarks relativamente sencillos, la mayoría preguntas de opción múltiple. Los autores explican sin rodeos por qué eligieron OLMES en lugar de la pérdida de entropía cruzada: como cada grupo de experimentos usa un conjunto de datos distinto, los valores de pérdida no son directamente comparables.

Al introducir los resultados en una regresión lineal, un modelo que suma el término de datos y el término del modelo explicó el 88% de la varianza.

Convertidas a tasa anual, las cifras se reducen

Convertida a tasa anual, la ganancia anual de eficiencia computacional del lado del modelo es de 1.24 veces, del lado de los datos, 1.51 veces, y en conjunto, 1.57 veces.

La cifra de 1.57 queda por debajo de estimaciones previas del sector. Anson Ho y sus colegas dieron una media de 3 veces, casi el doble. Los autores no eluden la diferencia, sino que la atribuyen a dos factores: la escala de su propio experimento es demasiado pequeña, de modo que muchas ganancias simplemente no se manifiestan a esta magnitud; y el entrenamiento a pequeña escala tampoco cubre las optimizaciones del lado de la inferencia.

Los dos conjuntos de cifras no pueden usarse comparándolos directamente. Uno procede de un experimento controlado a pequeña escala, con variables limpias pero poco margen de extrapolación; el otro es una estimación macro para todo el sector, con amplia cobertura, pero incapaz de separar el origen de las ganancias. El valor de este trabajo está en pesar por separado "datos" y "modelo"; la razón concreta de 3.24 es secundaria.

El resquicio que los propios autores dejan abierto

En el texto original hay una frase que merece más atención que la propia conclusión:

"if the gains are limited, then the main driver of pretraining progress will stall, because we're not generating more internet, and you can only curate a fixed set of data by so much."
(si las ganancias son limitadas, el motor principal del progreso del pre-entrenamiento se estancará, porque no estamos generando más internet, y de un conjunto fijo de datos solo se puede extraer tanto por más que se cure.)

Los propios autores enumeran cuatro limitaciones. Primera: la escala del experimento es demasiado pequeña para captar muchas ganancias. Segunda: el multiplicador de eficiencia computacional es bastante sensible a la elección de receta de modelo y corpus; con otro par, el resultado cambia. Tercera: solo estudiaron métodos de limpieza a partir de Common Crawl, sin cubrir tres vías: recopilar datos de alta calidad de nuevas fuentes, datos generados por expertos humanos y generación de datos sintéticos. Cuarta: con otra batería de benchmarks, la conclusión "sería muy distinta".

El tercer punto es especialmente relevante. Las fuentes incrementales mencionadas una y otra vez en el debate público de los últimos dos años caen justo en esas tres categorías no probadas. Este experimento responde hasta dónde ha llegado, en los últimos seis años, el camino de limpiar datos de internet; cuánto camino queda por delante, no lo responde.

Fuentes: texto original del Dwarkesh Podcast, documentación del benchmark OLMES, CocoLoop; los factores de eficiencia computacional y las tasas anualizadas siguen el marco de 1e19 FLOPs del texto original, y la estimación sectorial de 3 veces procede de la investigación de Anson Ho y colegas.