Автор: Dwarkesh Patel
Перевод: Shenchao TechFlow
Обзор Shenchao: За последние шесть лет возможности моделей ИИ значительно возросли, но прогресс был обусловлен алгоритмами или данными? В этой статье с помощью серии небольших контролируемых экспериментов приводится неинтуитивный вывод: улучшение данных повышает эффективность вычислений в более чем три раза больше, чем улучшение моделей. Для тех, кто следит за инвестициями в инфраструктуру ИИ и конкуренцией передовых лабораторий, это раскрывает недооцененный драйвер — инженерию данных.
За последние несколько лет, какая доля быстрого прогресса в области ИИ приходится на улучшение данных, а какая — на улучшение моделей? Ответ на этот вопрос имеет огромное значение для экономических моделей передовых лабораторий и скорости будущих достижений.
Мы провели относительно небольшое исследование этой проблемы, сосредоточившись на предварительном обучении с 2019 по 2025 год. В течение этих лет ежегодно публиковались новые наборы открытых моделей, обобщающие улучшения алгоритмов, известные на тот момент (например, архитектура, оптимизаторы, инициализация, планирование скорости обучения, гиперпараметры и т. д.). В то же время ежегодно появлялись новые открытые корпуса данных (создаваемые за счет более масштабного сбора, а также новых методов курирования, извлечения и фильтрации).
Мы обучали эти модели, представляющие различные уровни лет, с различными комбинациями наборов данных и проводили обучение при различных масштабах вычислительных ресурсов (до 1e19 FLOPs).
Конечно, мы не можем сравнивать эти различные модели по кросс-энтропийной потере на фиксированном наборе данных, поскольку мы меняем наборы данных, на которых они обучались. Вместо этого мы оцениваем эти модели по их конечной способности, используя оценку OLMES (которая агрегирует 10 относительно простых бенчмарков, большинство из которых — вопросы с множественным выбором). К сожалению, оценка конечной способности вместо потери предварительного обучения добавляет некоторый шум к нашим результатам, что вы увидите на приведенных ниже графиках, однако мы стараемся получить более четкие границы, используя несколько случайных семян.
Мы обнаружили, что с 2019 по 2025 год при бюджетной мощности в 1e19 FLOPs более чем в 3,24 раза большее повышение эффективности вычислений обусловлено улучшением данных, а не моделей (данные — в 12,0 раза, модели — в 3,7 раза).

Ниже представлена таблица, показывающая улучшение в финальных тестовых показателях наших моделей по сравнению с базовой моделью 2019 года при вычислительной мощности 3,16e18 FLOPs.

Мы обнаружили, что выгоды от улучшения данных и улучшения модели в основном независимы друг от друга и не взаимодействуют (то есть выгода от внедрения улучшения модели не зависит от конкретного набора обучающих данных, и наоборот). С использованием линейной модели 88% дисперсии в оценке OLMES можно объяснить аддитивным эффектом улучшений модели и данных.
Обсудить
В качестве контекста кратко резюмируем, что изменилось на стороне данных и на стороне моделей с 2019 по 2025 год.
На стороне модели мы перешли от GPT-2 к OLMo-2, включая ключевые инновации в оптимизаторах, позиционном кодировании, нормализации, функциях активации и инициализации.
На стороне данных мы начали в 2019 году с OpenWebText, который содержал только веб-страницы по ссылкам на Reddit, получившим достаточное количество лайков, и после удаления дубликатов и фильтрации в итоге осталось около 9 миллиардов токенов (это примерно данные для обучения GPT-2). К 2025 году такие открытые корпусы данных, как UltraFineWeb, не только значительно больше по объему (за счет сканирования всего интернета), но и используют гораздо более сложные методы фильтрации (например, обучение классификатора для прогнозирования, какие данные действительно улучшают производительность модели).
Простая интерпретация наших результатов: большинство прогрессов в ИИ с 2019 по 2024 год (эра предварительного обучения) на самом деле связаны с более качественной инженерией данных (извлечение, курирование и т.д.), а работа над моделями в этот период была значительно менее важной.
Но это может быть неверным способом оценки ценности улучшений модели. Основной вклад улучшений модели не обязательно заключается в повышении вычислительной эффективности, то есть достижении той же производительности с меньшим количеством FLOPs. Напротив, он первоочередно делает доступными более масштабные вычислительные ресурсы. По мере увеличения количества параметров, длины контекста, времени выполнения и размера кластера возникают различные проблемы (взрыв или исчезновение градиентов, исчерпание памяти и пропускной способности, чрезвычайно замедленное обучение). Большая часть исследований моделей направлена на устранение или отсрочку этих ограничений масштабирования. Многие из наиболее важных инноваций относятся именно к этой категории, например, MoE, варианты разреженного внимания, стабильностные инновации (положение нормализации, инициализация и т.д.), а также системные и ядерные оптимизации, такие как FlashAttention.
Исследуемые нами здесь улучшения данных могут быть менее значимы для более крупных моделей. Малые модели (такие, как те, которые мы обучали) значительно выигрывают от повышения качества данных, поскольку их емкость ограничена, и вам нужно очень тщательно решать, что в них помещать. В то время как крупные модели обладают огромным избыточным объемом, и, возможно, вы просто хотите загрузить в них как можно больше данных, даже если большая часть из них — мусор, ведь магия стохастического градиентного спуска сама отделит сигнал от шума. Если вы выберете агрессивную фильтрацию, вам придется делать десятки эпох, и эмпирические результаты часто оказываются хуже, чем при использовании более крупного набора данных со средним более низким качеством. Фактически, если учесть, что передовые модели могут быть переобучены вплоть до 100 раз по сравнению с оптимальными стандартами Chinchilla, чтобы минимизировать вычислительные ресурсы, необходимые для вывода при обучении с подкреплением и развертывании, вред от агрессивной курировки данных становится еще больше.
Аналогия может быть сравнением парусного судна и контейнеровоза: контейнеровоз не обязательно движется быстрее, но он может перевозить тысячи тонн груза (что эквивалентно сотням триллионов токенов предварительно обученных данных) и не опрокидывается в бурном море (что эквивалентно стабильному обучению на десятках тысяч GPU).
Теперь, когда у нас есть более крупные и прочные контейнеровозы, нам не нужно беспокоиться о том, какой груз загружать — мы можем загружать всё, что хоть немного полезно. А для маленьких и хрупких парусников 2019 года нужно было быть крайне осторожными и перевозить только самые ценные грузы.
Но если суть прогресса в предварительном обучении заключается лишь в загрузке все большего количества груза на этот корабль, не приближаемся ли мы к исчерпанию груза? Это вопрос о «стене данных» и о том, насколько синтетические данные могут помочь нам преодолеть эту стену. Синтетические данные уже широко используются в различных лабораториях, однако мы до сих пор не изучали, могут ли они эффективно расширить корпус данных без ущерба для производительности модели. Если такие выгоды ограничены, основной двигатель прогресса в предварительном обучении замедлится, поскольку мы не будем генерировать больше интернет-контента, а степень, до которой фиксированный набор данных может быть курирован, также ограничена. Следует подчеркнуть, что у нас пока нет никаких положительных оснований полагать, что это действительно произойдет. Однако, учитывая, что данные кажутся столь важными для продвижения предварительного обучения, это кажется ключевым вопросом, требующим дальнейшего исследования.
Райан Гринблатт отмечает, что многие исторические улучшения обучающих корпусов предварительной подготовки выглядят как прогресс, который автоматизированные исследователи могут напрямую продвигать с помощью эмпирических тестов, например, запуская абляционные эксперименты с моделями, обученными на разных данных, чтобы оценить их производительность. Таким образом, это полностью согласуется с нашими результатами: если разработка ИИ будет автоматизирована, прогресс в данных, способствовавший улучшениям в предварительной подготовке с 2019 года, может значительно ускориться.
Мы хотим прояснить один момент: вопрос о том, ускоряется или замедляется прогресс в предварительном обучении в изоляции, не является наиболее важным аспектом общего прогресса в ИИ, поскольку многие достижения за последние два года были получены благодаря обучению с подкреплением.
Направления будущих исследований
Вот несколько направлений и вопросов будущих исследований, которые мы считаем интересными и важными:
- Вы можете провести этот эксперимент в более масштабном виде, чтобы проверить, зависят ли данные или улучшения модели от масштаба и оказывают ли они большее влияние на передовые области.
- Какова предельная ценность высококачественных новых данных в предварительном и последующем обучении, измеряемая по конечной производительности?
- Мы хотим примерно понять, насколько эффективны синтетические данные. Конкретный вопрос, заслуживающий изучения: если у вас есть небольшой набор высококачественных данных, насколько лучше будет результат при увеличении этого набора с помощью генерации синтетических данных по сравнению с прямым многократным обучением на этом же наборе?
- Вы можете оценить скрытую стоимость данных, исходя из соотношения расходов на данных-брокеров, экологических производителей и т.п. по сравнению с расходами на вычислительную мощность и исследователей.
Мы хотели изучить, какую роль играют данные в продвижении ИИ. Существует множество других способов исследования этого вопроса, некоторые из которых могут быть более изощренными и информативными, чем наш подход. Кроме того, масштаб наших экспериментов очень мал. Мы считаем, что могли что-то упустить, и очень хотим узнать, как другие люди будут исследовать этот вопрос — и, желательно, увидеть их результаты!
Особая благодарность Чарли О’Ниллу за многочисленные полезные обсуждения.
Приложение: методология


Мы с нуля предобучали эти модели на различных наборах данных, используя разные вычислительные бюджеты и устанавливая несколько независимых семян 6. Наш вычислительный бюджет составлял: 1e17, 3,16e17, 1e18, 3,16e18 и 1e19 FLOP. Принятая практика расчета вычислительных ресурсов — использование номинальных вычислений C = 6ND (N — количество неэмбеддинговых параметров, D — количество токенов в данных).
При каждом бюджете на вычислительные ресурсы мы настраиваем количество параметров, тем самым корректируя количество токенов для обучения, чтобы определить оптимальное соотношение вычислительных ресурсов для каждой комбинации метода обучения и корпуса. Мы используем потерю на удерживаемом корпусе для определения этой оптимальной точки по вычислительным ресурсам. Затем мы получаем кривые масштабирования вычислительных ресурсов для производительности на нижнем уровне для каждой комбинации и извлекаем из них вычислительный мультипликатор.
Мы принудительно используем общий токенизатор и длину контекста во всех запусках: GPT-2 BPE (tiktoken, словарь из 50257 токенов) и T=2048, batch = 262144 токенов.
Конечная производительность нашей тренировки сильно зависит от гиперпараметров. Очевидно, невозможно перебрать все возможные комбинации гиперпараметров, и настройка гиперпараметров действительно является тонким искусством! Мы стараемся максимально контролировать этот процесс и рассматриваем пиковую скорость обучения как наиболее важный гиперпараметр.
Некоторые версии алгоритмов действительно предоставляют рекомендации по установке пиковой скорости обучения в виде функции от других связанных переменных, таких как размер модели, бюджет данных, размер пакета и т. д. Эти рекомендации дают нам хорошую априорную оценку для определения оптимальной скорости обучения.
Мы сначала просканировали скорость обучения на 5 опорных точках: 3 различных размера моделей и 2 различных соотношения D/N. Мы определили оптимальную скорость обучения для этих опорных точек и подобрали параметрическую форму оптимальной скорости обучения.
Для всех моделей, кроме OLMo-2, мы подбираем общие экспоненты a и b, а также отдельное начальное значение скорости обучения lr₀ для каждой модели. Для OLMo-2 мы используем оптимальную скорость обучения, указанную в соответствующей конфигурации модели. Мы поступаем так с OLMo-2, потому что Ai2 опубликовала ступенчатый график для малых моделей как часть конфигурации, в котором заданы оптимальные гиперпараметры для наших исследуемых масштабов. Мы также подтвердили, что наша производственная скорость обучения находится на или рядом с оптимальной точкой при вычислительной мощности 3,16e18 FLOP.
Основные технические результаты


Объясните аномалии на графике
Мы заметили, что вычислительная эффективность по двум измерениям — модели и данным — в целом повышается со временем, что соответствует ожиданиям. Некоторые выбросы, которые мы наблюдали:
- NeoX при 1e19 показывает худшие результаты, чем GPT-2 (хотя в диапазоне от 1e17 до 3,16e18 показывает лучшие результаты). Это может быть связано с шумом в оценке OLMES. Мы также заметили, что NeoX превосходит GPT-2 по потере предварительного обучения на удерживаемом корпусе FineWeb-Edu.
- Производительность The Piles кажется намного хуже, чем у OpenWebText. Это неудивительно, поскольку основное улучшение Pile заключается в разнообразии данных, а не в фильтрации. Он включает тщательно подобранный набор из 22 источников, включающий статьи из PubMed и arXiv, код GitHub, юридические заключения, патенты и парламентские протоколы. Для многих из этих токенов междоменная переобучаемость на OLMES (английские веб-эссе с множественным выбором) может быть незначительной, что приводит к более низкой эффективности вычислений. Мы отмечаем, что из-за большего масштаба ожидается, что Pile в конечном итоге превзойдет (очень небольшой по масштабу) OpenWebText при больших объемах данных.
- Следует отметить, что мультипликаторы хэш-мощности для NeoX и Pile были получены экстраполяцией, что вносит дополнительный потенциальный источник ошибок.
Как рассчитывается мультипликатор хэш-мощности и его погрешность
- Каждая точка на кривой расширения вычислительной мощности получена из нескольких независимых запусков обучения с разными начальными значениями. Погрешности на графике представляют собой стандартное отклонение оценок OLMES по этим начальным значениям.
- Учитывайте модель или корпус данных при определенном уровне вычислительной мощности и заданном уровне производительности.
- Затем мы вычисляем коэффициент вычислительной мощности, найдя самую левую точку на кривой масштабирования вычислительной мощности кандидатской модели или корпуса, где впервые достигается уровень производительности эталона. Отношение вычислительной мощности, необходимой эталону, к вычислительной мощности, необходимой кандидату, и есть коэффициент вычислительной мощности кандидата.
- Погрешность коэффициента вычислительной мощности получена с помощью бутстрепа параметров всей оценочной процедуры и представляет собой интервал в одно стандартное отклонение.
- Мы хотим подчеркнуть, что реальная неопределенность в расчетах коэффициента вычислительной мощности модели превышает ту, которая указана на ошибках. Это связано с тем, что диапазон подбора гиперпараметров, который мы использовали, был ограничен, и конечная производительность или потеря на удержанных данных могут быть довольно чувствительны к точному выбору максимальной скорости обучения, размера пакета и других параметров.
Также важно отметить, что наши эксперименты по абляции по многим причинам не могут полностью охватить весь диапазон повышения эффективности вычислительных ресурсов. Фактически, с 2019 по 2025 год мы наблюдали ежегодное повышение эффективности вычислительных ресурсов на стороне моделей на 1,24 раза [1,19; 1,29], а на стороне данных — на 1,51 раза [1,45; 1,57]. При совместном измерении мы зафиксировали ежегодное повышение эффективности вычислительных ресурсов на 1,57 раза [1,49; 1,65]7. Это значительно ниже средней оценки в 3 раза в год, представленной Ансоном Хо и другими, по следующим причинам:
- Многие преимущества могут зависеть от масштаба или особенно важны в контексте большего объема, однако наш масштаб операций слишком мал, чтобы проявить многие из этих преимуществ. Например, нормы слоев и нормы QK в OLMo-2, параллельные блоки внимания и MLP в NeoX.
- Оптимизация эффективности вывода (например, GQA в LLama-3, это оптимизация кэша KV) не проявляется в виде мультипликатора вычислительной мощности в наших исследованиях. Мы также не изучали улучшения токенизаторов.
- Полученный нами множитель вычислительной мощности чувствителен к выбранным нами ежегодно моделям или корпусам данных. Мы выбрали те модели или корпусы данных, которые считаем репрезентативными, но это не исчерпывающее доказательство того, что они являются наилучшими на каждый год.
- Мы фокусируемся на мультипликаторе вычислительной мощности относительно эталона OLMES (включающего 10 относительно простых типов задач), а не на мультипликаторе вычислительной мощности, необходимой для достижения определенного показателя перплексии. Если мы рассмотрим другие эталоны (например, специализированные эталоны для кодирования или решения задач), цифры будут совершенно другими, поскольку такие эталоны могут поощрять совершенно иные методы инженерии данных.
Мы также хотим подчеркнуть, что не изучали улучшения на других данных, такие как сбор большего количества высококачественных данных из новых источников, данные, сгенерированные человеческими экспертами, методы синтетического генерирования данных и т.д. Большинство корпусов, которые мы изучали, являются теми же самыми отобранными (подмножествами) данными Common Crawl, а не расширением доступного набора данных. Это явно приводит к истощению ограниченного запаса, и степень, на которую этот рычаг может продвинуть результаты, ограничена.
Yield independence from model recipe and dataset
Мы провели следующее исследование, чтобы определить, насколько независимы выгоды от модели и набора данных. Мы проанализировали сетку оценок OLMES при 3,16e18 FLOPs. При линейной регрессии оценок OLMES по модели OLMES = среднее + эффект модели + эффект данных коэффициент детерминации R² составил 0,88. Это означает, что 88% дисперсии оценок OLMES можно объяснить аддитивными эффектами улучшений модели и данных, а лишь около 12% дисперсии приходится на взаимодействия или высшие порядки, а также шум оценки. Это указывает на то, что сложные взаимодействия между моделью и данными (то есть зависимость определенного улучшения модели от конкретной инженерии данных или наоборот) относительно невелики.

Ансон Хо и другие оценили повышение эффективности программного обеспечения (в процессе предварительного обучения) в 3 раза в год (95%-й доверительный интервал: от 1,5 до 64 раз). Как Хо упомянул в этом блоге, «большинство прогрессов в программном обеспечении, вероятно, связаны с улучшением качества данных», а также «с масштабированием нескольких алгоритмических изменений».
Мы используем соглашение C = 6ND для расчета хэшрейта.
Рецепт модели 2019 года — GPT-2, рецепт модели 2025 года — OLMo-2. Датасет 2019 года — OpenWebText, датасет 2025 года — UltraFineWeb.
Мы столкнулись с некоторыми проблемами нестабильности обучения GPT3 на Pile (пики градиента).
Это включает: улучшения оптимизатора, расписание разогрева с затуханием, замену обучаемых абсолютных позиций на RoPE, RMSNorm с SwiGLU-гейтами MLP, переупорядочивание нормализации, QK-norm, регуляризацию Z-loss и более чистую инициализацию.
Для графика расширения вычислительной мощности мы использовали по крайней мере 3 семени для каждого. Для сетки 7x7, состоящей из комбинаций рецептов моделей и наборов данных с бюджетом 3,16e18, мы использовали только по одному семени.
Коэффициент умножения 1,57 рассчитан с использованием совместного улучшения от модели и корпуса 2019 года до модели и корпуса 2025 года, а не как произведение улучшения на стороне модели (1,24) и улучшения на стороне данных (1,51).
