Autor: Dwarkesh Patel
Compilado por Deep潮 TechFlow
Guía de Shenchao: En los últimos seis años, la capacidad de los modelos de IA ha avanzado rápidamente, pero ¿este progreso proviene realmente de los algoritmos o de los datos? Este artículo presenta, mediante un conjunto de experimentos controlados a pequeña escala, una conclusión contraintuitiva: la mejora en los datos impulsa un aumento en la eficiencia computacional más de tres veces mayor que la mejora en los modelos. Para quienes siguen la inversión en infraestructura de IA y la competencia entre laboratorios de vanguardia, revela un impulsor subestimado: la ingeniería de datos.
En los últimos años, ¿qué proporción de los rápidos avances observados en el campo de la IA se debe a mejoras en los datos y qué proporción a mejoras en los modelos? La respuesta a esta pregunta tiene un impacto significativo en los modelos económicos de los laboratorios de vanguardia y en la velocidad de los futuros avances.
Realizamos una investigación relativamente pequeña sobre este problema, enfocada específicamente en el preentrenamiento entre 2019 y 2025. Durante estos años, cada año se publicó un nuevo conjunto de modelos de código abierto que resumía las mejoras en algoritmos conocidas públicamente ese año (por ejemplo, mejoras en arquitectura, optimizadores, inicialización, programación de tasas de aprendizaje, hiperparámetros, etc.). Al mismo tiempo, cada año surgieron nuevos corpus de datos públicos (generados por capturas de mayor escala y nuevas técnicas de curación, extracción y filtrado).
Entrenamos estos modelos, combinando distintas configuraciones con conjuntos de datos correspondientes a diferentes niveles de años, y lo hicimos bajo distintas escalas de potencia de entrenamiento (hasta 1e19 FLOPs).
Claramente, no podemos comparar estos diferentes modelos según su pérdida de entropía cruzada en un conjunto de datos fijo, ya que estamos cambiando los conjuntos de datos en los que se entrenan. Por lo tanto, en su lugar, evaluamos estos modelos según su capacidad final, utilizando la evaluación OLMES (que resume 10 benchmarks relativamente simples, en su mayoría preguntas de opción múltiple). Desafortunadamente, evaluar la capacidad final en lugar de la pérdida de preentrenamiento introduce cierto ruido en nuestros resultados, como podrás observar en la gráfica a continuación; sin embargo, intentamos obtener límites más limpios mediante múltiples semillas aleatorias.
Descubrimos que, entre 2019 y 2025, bajo un presupuesto de capacidad de cómputo de 1e19 FLOPs, una mejora en la eficiencia de cómputo de más de 3.24 veces se debió a mejoras en los datos, y no a mejoras en los modelos (los datos aportaron 12.0 veces, mientras que los modelos aportaron 3.7 veces).

La siguiente cuadrícula muestra el grado de mejora en la capacidad final de prueba de nuestros modelos, en comparación con la línea base de datos y arquitectura de 2019, bajo una capacidad de 3.16e18 FLOPs.

Descubrimos que los beneficios derivados de las mejoras en los datos y las mejoras en el modelo son en su mayoría independientes entre sí, sin interacciones (es decir, el beneficio de implementar una mejora en el modelo no depende de un conjunto específico de datos de entrenamiento, y viceversa). Utilizando un modelo lineal, el 88% de la varianza en la puntuación OLMES se puede explicar por los efectos aditivos de las mejoras en el modelo y las mejoras en los datos.
Discusión
Como contexto, resumamos brevemente los cambios ocurridos en el lado de los datos y en el lado de los modelos entre 2019 y 2025.
En el lado del modelo, hemos avanzado desde GPT-2 hasta OLMo-2, incluyendo innovaciones clave en optimizadores, codificación de posición, normalización, funciones de activación e inicialización.
En el lado de los datos, comenzamos en 2019 con OpenWebText, que solo incluía páginas web enlazadas en Reddit con suficientes me gusta, y tras eliminar duplicados y filtrar, terminamos con aproximadamente 9 mil millones de tokens (esto es esencialmente los datos de entrenamiento de GPT-2). Para 2025, corpus de datos de código abierto como UltraFineWeb no solo son mucho más grandes (mediante el raspado de toda la internet), sino que también emplean métodos de filtrado mucho más complejos (por ejemplo, entrenar un clasificador para predecir qué datos realmente mejoran el rendimiento del modelo).
Una interpretación sencilla de nuestros resultados es que la mayor parte del progreso en IA entre 2019 y 2024 (la era de la preentrenamiento) fue en realidad debido a una mejor ingeniería de datos (extracción, curación, etc.), y que el trabajo con modelos durante ese período fue mucho menos importante.
Pero esta podría ser una forma errónea de evaluar el valor de las mejoras del modelo. La contribución principal de las mejoras del modelo no necesariamente es la eficiencia computacional, es decir, lograr el mismo rendimiento con menos FLOPs. En cambio, primero hace que la capacidad computacional a mayor escala sea accesible. A medida que aumentan la cantidad de parámetros, la longitud del contexto, la duración de ejecución y el tamaño del clúster, surgen diversos problemas de fallo (explosión o desaparición de gradientes, agotamiento de memoria y ancho de banda, entrenamiento se vuelve increíblemente lento). Gran parte de la investigación en modelos consiste en eliminar o posponer estas limitaciones para la escalabilidad. Muchas de las innovaciones más importantes pertenecen a esta categoría, como MoE, variantes de atención dispersa, innovaciones de estabilidad (posición de normalización, inicialización, etc.) y optimizaciones a nivel de sistema y kernel como FlashAttention.
Las mejoras en los datos que estudiamos aquí pueden ser menos importantes para modelos más grandes. Los modelos pequeños (como los que entrenamos) se benefician significativamente de la mejora en la calidad de los datos, ya que tienen capacidad limitada y debes ser muy cuidadoso al decidir qué introducir en ellos. En cambio, los modelos grandes tienen una gran cantidad de capacidad excedente, y quizás solo quieras introducir la mayor cantidad posible de datos, incluso si la mayor parte es basura, ya que la magia del descenso de gradiente estocástico separará la señal del ruido. Si optas por una filtración agresiva, tendrás que realizar decenas de épocas, y los resultados empíricos suelen ser peores que al usar un conjunto de datos más grande pero con calidad promedio más baja. De hecho, si se tiene en cuenta que los modelos de vanguardia pueden estar sobreentrenados hasta 100 veces más que el óptimo de Chinchilla para minimizar la potencia de inferencia utilizada en el aprendizaje por refuerzo y la implementación, el daño causado por una curaduría agresiva de datos se vuelve aún mayor.
Una analogía podría ser la diferencia entre un velero y un buque portacontenedores: el buque portacontenedores no necesariamente viaja más rápido, pero puede transportar miles de toneladas de carga (equivalente a cientos de trillones de tokens de datos de preentrenamiento) y no se voltea en aguas agitadas (equivalente a un entrenamiento estable en cientos de miles de GPU).
Ahora que tenemos contenedores más grandes y más resistentes, ya no necesitamos preocuparnos por qué carga llevar; podemos cargar todo lo que siquiera tenga un poco de utilidad. En cambio, para los pequeños y frágiles veleros de 2019, debías ser extremadamente cuidadoso y solo llevar las mercancías más valiosas.
Pero si la esencia del progreso en el preentrenamiento es simplemente cargar más carga en este barco, ¿estamos a punto de quedarnos sin carga? Esto plantea el problema del muro de datos y la cuestión de hasta qué punto los datos sintéticos nos ayudan a superar este muro. Los datos sintéticos ya se utilizan ampliamente en diversos laboratorios, pero aún no hemos investigado si pueden ampliar eficazmente el corpus de datos sin comprometer el rendimiento del modelo. Si estos beneficios son limitados, la principal fuerza impulsora del progreso en el preentrenamiento se estancará, ya que no generaremos más contenido en internet y la capacidad de curar un conjunto de datos fijo también es limitada. Es importante aclarar que actualmente no tenemos ninguna razón positiva para creer que esto sea cierto. Sin embargo, dado que los datos parecen ser tan cruciales para impulsar el progreso en el preentrenamiento, este parece ser un problema clave que merece investigación adicional.
Ryan Greenblatt señala que muchas mejoras históricas en los corpus de datos de preentrenamiento parecen ser del tipo que los investigadores automatizados podrían impulsar directamente mediante pruebas empíricas, como ejecutar experimentos de abstracción con modelos entrenados en diferentes datos para observar cómo se desempeñan. Por lo tanto, es completamente coherente con nuestros resultados: si el desarrollo de IA se automatiza, los avances en datos que han impulsado el progreso en el preentrenamiento desde 2019 podrían acelerarse considerablemente.
Queremos aclarar un punto: determinar si el progreso en el preentrenamiento se acelera o se ralentiza en aislamiento no es la pregunta más importante sobre el progreso general de la IA, ya que muchos de los avances de los últimos dos años provienen del aprendizaje por refuerzo.
Direcciones futuras de investigación
A continuación, algunos futuros ámbitos de investigación y preguntas que consideramos interesantes y importantes:
- You can scale up this experiment to see whether the data or model improvements are more dependent on scale, thereby having a greater impact in cutting-edge areas.
- ¿Cuál es el valor marginal de nuevos datos de alta calidad en el preentrenamiento y el postentrenamiento, medido por la capacidad final?
- Queremos tener una idea general del efecto real de los datos sintéticos. Una pregunta específica digna de estudio es: si tienes un pequeño conjunto de datos de alta calidad, ¿cuánto mejor sería el rendimiento al ampliarlo mediante generación de datos sintéticos en comparación con entrenar múltiples veces directamente con ese conjunto de datos?
- Puedes calcular el valor implícito de los datos mediante la proporción entre los gastos en intermediarios de datos, productores ambientales, etc., y los gastos en capacidad de cómputo y investigadores.
Queremos investigar el papel que los datos desempeñan en impulsar el avance de la IA. Hay muchas otras formas de explorar esta pregunta, algunas de las cuales podrían ser más ingeniosas e informativas que nuestro enfoque. Además, nuestro experimento es de muy pequeño escala. Realmente creemos que podríamos haber omitido algo y nos encantaría saber cómo otros investigarían este problema, ¡y preferiblemente ver sus resultados!
Agradecemos especialmente a Charlie O'Neill por sus numerosas discusiones útiles.
Apéndice: Metodología


Entrenamos desde cero estas recetas de modelos en diversos conjuntos de datos, utilizando diferentes presupuestos de cómputo y configurando múltiples semillas independientes 6. Nuestros presupuestos de cómputo son: 1e17, 3.16e17, 1e18, 3.16e18 y 1e19 FLOP. La convención para el cálculo del cómputo utiliza el cómputo nominal C = 6ND (donde N es la cantidad de parámetros no incrustados y D es el número de tokens de datos).
Bajo cada presupuesto de potencia de cómputo, ajustamos la cantidad de parámetros para modificar el número de tokens de entrenamiento, con el fin de determinar la proporción óptima de potencia de cómputo para cada combinación de receta de entrenamiento y corpus. Utilizamos la pérdida de validación en el corpus para identificar este punto óptimo de potencia de cómputo. Luego, podemos obtener las curvas de escalamiento de potencia de cómputo para el rendimiento en tareas downstream de cada combinación, a partir de las cuales extraemos finalmente el multiplicador de potencia de cómputo.
Forzamos el uso de un tokenizador y longitud de contexto compartidos en todas las ejecuciones: GPT-2 BPE (tiktoken, vocabulario de 50257) y T=2048, batch = 262144 tokens.
La capacidad final del entrenamiento depende en gran medida de los hiperparámetros. Obviamente, es imposible explorar todas las combinaciones posibles de hiperparámetros; la optimización de hiperparámetros es realmente un arte sutil. Hacemos todo lo posible por controlar esto y consideramos la tasa de aprendizaje pico como el hiperparámetro clave más importante.
Algunas versiones de algoritmos proporcionan especificaciones sobre el valor al que debe ajustarse la tasa de aprendizaje máxima, como función de otras variables relacionadas (como el tamaño del modelo, el presupuesto de datos, el tamaño del lote, etc.). Estas nos ofrecen una buena información previa para determinar la tasa de aprendizaje óptima.
Primero escaneamos la tasa de aprendizaje en 5 puntos de anclaje: 3 tamaños de modelo diferentes y 2 relaciones D/N diferentes. Determinamos la tasa de aprendizaje óptima para estos puntos de anclaje y ajustamos una forma paramétrica para la tasa de aprendizaje óptima.
Para todas las recetas de modelos, excepto OLMo-2, ajustamos un exponente común a y b, junto con un lr₀ específico del modelo. Para OLMo-2, utilizamos la tasa de aprendizaje óptima especificada para esa receta de modelo. La razón por la que tratamos OLMo-2 de esta manera es que Ai2 publicó el escalón de modelos pequeños como parte de la receta, que define los hiperparámetros óptimos para las dimensiones que estudiamos. También verificamos que nuestra tasa de aprendizaje de producción se encuentra en o cerca del punto óptimo de computación de 3.16e18 FLOP.
Principales resultados técnicos


Explicar algunas anomalías en el gráfico
Hemos observado que, en ambos aspectos, modelo y datos, la eficiencia de cálculo ha mejorado generalmente con el tiempo, lo cual es esperado. Algunos valores atípicos que hemos observado:
- NeoX se desempeña peor que GPT-2 en 1e19 (aunque se desempeña mejor en el rango de 1e17 a 3.16e18). Esto podría deberse al ruido en la evaluación de OLMES. También observamos que NeoX supera a GPT-2 en la pérdida de preentrenamiento de retención en el corpus FineWeb-Edu.
- El rendimiento de The Piles parece ser mucho peor que el de OpenWebText. Esto no es sorprendente, ya que la principal mejora de The Pile radica en la diversidad del corpus de datos, no en el filtrado. Cuenta con una mezcla cuidadosamente seleccionada de 22 fuentes, incluyendo artículos de PubMed y arXiv, código de GitHub, opiniones legales, patentes y registros parlamentarios. Para muchos de estos tokens, la transferencia interdominio hacia OLMES (English Web Prose Multiple Choice) puede ser mínima, lo que resulta en una menor eficiencia computacional. Observamos que, debido a su mayor escala, esperamos que The Pile finalmente supere a OpenWebText (cuya escala es realmente muy pequeña) a escalas más grandes.
- También es importante destacar que los factores de potencia de NeoX y Pile se obtuvieron mediante extrapoliación, lo que introduce un error potencial adicional.
How is the hashrate multiplier calculated and its error line?
- Cada punto en la curva de expansión de poder de cómputo proviene de múltiples ejecuciones de entrenamiento con semillas independientes. Las barras de error allí representan la desviación estándar de las evaluaciones de OLMES sobre estas semillas.
- Considere el modelo de referencia o el corpus de datos bajo un nivel de potencia de cálculo dado y un nivel de rendimiento de referencia específico.
- Luego calculamos el multiplicador de capacidad computacional encontrando el punto más a la izquierda en la curva de escalamiento de capacidad computacional del modelo o corpus candidato donde se alcanza por primera vez el nivel de rendimiento de referencia. La proporción entre la capacidad computacional requerida por la referencia y la requerida por el candidato es el multiplicador de capacidad computacional del candidato.
- La línea de error del multiplicador de potencia de cálculo proviene del método bootstrap de los parámetros de todo el proceso de estimación, y corresponde a un intervalo de una desviación estándar.
- Realmente queremos enfatizar que esperamos que la incertidumbre real del multiplicador de capacidad del modelo sea mayor de lo que indican las líneas de error. Esto se debe a que el rango de optimización de hiperparámetros que realizamos es limitado, y la capacidad final o la pérdida de validación podrían ser bastante sensibles a las elecciones exactas de la tasa de aprendizaje máxima, el tamaño del lote, etc.
Es igualmente importante tener en cuenta que nuestros experimentos de ablation no pueden capturar completamente el rango total de mejora en la eficiencia de la capacidad de cómputo por varias razones. De hecho, entre 2019 y 2025, observamos un aumento anual en la eficiencia de la capacidad de cómputo de 1.24 veces [1.19, 1.29] en el lado del modelo y de 1.51 veces [1.45, 1.57] en el lado de los datos. Al medir conjuntamente, observamos un aumento anual en la eficiencia de la capacidad de cómputo de 1.57 veces [1.49, 1.65]7. Esto es claramente inferior a la estimación promedio de 3 veces anual de Anson Ho et al., por las siguientes razones:
- Muchos beneficios pueden depender de la escala o ser particularmente importantes en contextos más largos, pero nuestra escala de operación es demasiado pequeña para manifestar muchos de estos beneficios. Por ejemplo, la normalización por capas y la normalización QK de OLMo-2, y los bloques de atención paralela más MLP en NeoX.
- La optimización de la eficiencia de inferencia (como la GQA de Llama-3, una optimización de caché KV) no se refleja como un multiplicador de potencia de cómputo en nuestro estudio. Tampoco hemos investigado mejoras en los tokenizadores.
- El multiplicador de poder de cómputo que obtenemos es bastante sensible a la receta del modelo o al corpus de datos que elegimos cada año. Hemos seleccionado recetas de modelos o corpus de datos que consideramos representativos, pero esto no demuestra exhaustivamente que sean los mejores de cada año.
- Nos enfocamos en el multiplicador de potencia de cómputo en relación con el benchmark OLMES (que combina 10 tipos de tareas relativamente simples), y no en el multiplicador de potencia de cómputo necesario para alcanzar un determinado índice de perplexidad. Si observamos otros benchmarks (por ejemplo, benchmarks especializados en codificación o resolución de problemas), los números también serían muy diferentes, ya que esos benchmarks podrían recompensar métodos de ingeniería de datos completamente distintos.
También queremos señalar que no hemos investigado mejoras en otros aspectos de los datos, como recopilar más datos de alta calidad desde nuevas fuentes, datos generados por expertos humanos o métodos de generación de datos sintéticos. La mayoría de los corpus estudiados provienen del mismo Common Crawl (subconjunto curado), y no amplían el conjunto de datos disponible. Esto claramente implica agotar un stock limitado, cuyo potencial de impulso es limitado.
Returns independent of model recipes and datasets
Realizamos la siguiente investigación para determinar qué tan independientes son los beneficios entre las recetas del modelo y los conjuntos de datos. Analizamos la cuadrícula de puntuaciones OLMES bajo 3.16e18 FLOPs. Al realizar una regresión lineal de las puntuaciones OLMES con el modelo OLMES = media + efecto del modelo + efecto del conjunto de datos, obtuvimos un R cuadrado de 0.88. Esto significa que el 88% de la varianza en las puntuaciones OLMES puede explicarse por los efectos aditivos de las mejoras en el modelo y en los datos, y solo aproximadamente el 12% de la varianza proviene de términos de interacción o de orden superior, así como del ruido de evaluación. Esto sugiere que las interacciones complejas entre modelos y datos (es decir, que una mejora en el modelo dependa de una ingeniería de datos específica, o viceversa) son relativamente pequeñas.

Anson Ho y otros estiman que la mejora de la eficiencia del software (en el preentrenamiento) es de 3 veces por año (intervalo de confianza del 95%: 1.5 veces a 64 veces). Como menciona Ho en este blog, "la mayoría de los avances en software probablemente provienen de mejoras en la calidad de los datos", así como "de la escalabilidad de unos pocos cambios algorítmicos relacionados con el tamaño".
Utilizamos la convención nominal C = 6ND para calcular la potencia de hash.
La receta del modelo de 2019 era GPT-2, y la receta del modelo de 2025 es OLMo-2. El conjunto de datos de 2019 era OpenWebText, y el conjunto de datos de 2025 es UltraFineWeb.
Al implementar el GPT3 en Pile, enfrentamos algunos problemas de inestabilidad en el entrenamiento (picos de gradiente).
Estos incluyen: mejoras en el optimizador, programación de calentamiento con decaimiento, sustitución de posiciones absolutas aprendidas por RoPE, RMSNorm con MLP con puerta SwiGLU, reordenamiento de Norm, QK-norm, regularización Z-loss y una inicialización más limpia.
Para el gráfico de expansión de potencia de cálculo, utilizamos al menos 3 semillas por cada configuración. Para la cuadrícula 7x7 de combinaciones de recetas de modelos y conjuntos de datos bajo un presupuesto de 3.16e18, utilizamos solo 1 semilla por cada una.
El multiplicador anual de 1.57 veces se calcula mediante la mejora conjunta desde el modelo y el corpus de 2019 hasta el modelo y el corpus de 2025, y no como el producto de la mejora del 1.24 veces en el lado del modelo y del 1.51 veces en el lado de los datos.
