Новый документ предлагает обучение «с конца до конца» для генеративных моделей с помощью эксплоративного моделирования

icon MarsBit
Поделиться
AI summary iconСводка
Новый документ от UIUC и Гарварда представляет Explorative Modeling (XM) — метод конечного обучения для генеративных моделей. Подход использует цикл for для генерации и отбора лучших кандидатов, снижая размытие режимов. Он демонстрирует улучшения в задачах изображений, видео и языка, обеспечивая лучшую эффективность по FLOP, образцам и параметрам. По мере того как альткоины, за которыми стоит наблюдать, привлекают внимание, такие инновации могут повлиять на индекс страха и жадности среди трейдеров.

В 2012 году AlexNet завершила эпоху подавляющей победой. До этого распознавание изображений требовало ручной разработки многоуровневых процессов извлечения признаков; AlexNet доказала то, что позже неоднократно подтверждалось: передача всей задачи модели для самостоятельного обучения почти всегда превосходит тщательно спроектированные человеческие многоэтапные конвейеры.

От классификации изображений до обнаружения объектов и до сегментации изображений — за каждым скачком в глубоком обучении стоит одна и та же фраза: дайте ему учиться самостоятельно до конца.

Единственная область, которая всегда является исключением: генеративные модели.

Сегодняшние самые мощные и масштабируемые генеративные модели (как авторегрессивные, так и диффузионные) не являются энд-ту-энд.

Они обучались предсказывать только «один небольшой шаг», но при выводе должны повторять этот шаг сотни или тысячи раз, как рекуррентная сеть.

Для обучения и вывода используются разные методы выборки. Этот разрыв порождает старую проблему: ошибка на каждом шаге передается на следующий, ввод постепенно смещается от распределения, с которым сталкивалась модель при обучении, и ошибки накапливаются. В научной среде это называется «смещением экспозиции» (exposure bias).

Другими словами, ключевой опыт глубокого обучения — «конец в конец лучше» — на протяжении десятилетий так и не был успешно применен к генеративным моделям.

И совсем недавно статья из UIUC и Гарвардского университета попыталась заполнить этот последний пазл.

Генеративная модель

Автор назвал эту новую парадигму Explorative Modeling (эксплоративное моделирование), сокращенно XM. Ее идея проста до почти наивности, но ведет к смелому выводу: у генеративных моделей, помимо параметров и данных, есть третья ось, которую можно масштабировать.

Генеративная модель

Сайт проекта: https://explorative-modeling.github.io

Адрес статьи: https://arxiv.org/abs/2607.27372

Репозиторий кода: https://github.com/alexiglad/XM

Источник проблемы: модель умеет только «брать среднее»

Чтобы понять, в чем заключается проблема, которую решает эта статья, сначала нужно понять, почему генерация настолько сложна.

В обычном обучении с учителем (например, классификации) у каждого входа в основном есть только один правильный ответ, и модели достаточно выучить однозначное отображение.

Но результаты генерации различаются. Когда вы просите модель «сгенерировать собаку», правильных ответов может быть бесконечно много. Эти допустимые выходные данные — это отдельные моды в распределении данных (т.е. отдельные пики в распределении). Генерация сложна именно потому, что нужно одновременно уловить все эти моды.

Проблема в том, что при обучении основных генеративных моделей используется реконструктивная потеря (например, квадратичная ошибка). Когда одному входу случайным образом сопоставляется множество различных допустимых целей, оптимальным решением реконструктивной потери будет среднее значение этих целей. Однако для большинства данных среднее значение вообще не лежит на многообразии данных, а оказывается между несколькими модами, не похоже ни на одну из них.

На рисунке в статье наглядно показано: если заставить модель напрямую выполнять энд-ту-энд регрессию без каких-либо уловок, три облака точек она предскажет как одну точку посередине, фотографию собаки превратит в размытое пятно, а предложение — сведет к повторению слова «the» до бесконечности. Это и есть «размытие режимов» (mode blurring), когда оптимальное решение как раз и является наименее похожим на реальные данные.

Генеративная модель

Как современные модели это обходят? Ответ — разбить процесс «генерации» на мелкие части. Авторегрессивные модели предсказывают один элемент за раз, диффузионные модели удаляют лишь небольшое количество шума за шаг, и на каждом маленьком шаге цель сужается до почти единственного режима, поэтому функция потерь реконструкции больше не стремится к усреднению.

Этот процесс «разделения и генерации» является причиной того, почему диффузионные и авторегрессивные модели могут генерировать высококачественные образцы, но именно он мешает построению модели в режиме end-to-end.

Автор задаёт ключевой вопрос: у генеративной модели есть только два аспекта, которые можно разобрать — как она генерирует и как она обучается.

Если разбиение на этапы разрушает конец-в-конец, почему бы тогда не разбить обучение?

Генеративная модель

Цикл for: вся суть эксплораторского моделирования

Explorative Modeling разбирает сам тренировочный цикл.

Его механизм можно объяснить одним предложением: на каждом шаге обучения модель больше не генерирует только один образец для жесткого соответствия цели, а генерирует K кандидатов, а затем обучает и передает градиент только тому, который ближе всего к реальным данным. В статье это реализовано в виде цикла for из 3–5 строк, что настолько просто, что вызывает сомнения (Алгоритм 1).

Генеративная модель

Почему это решает нечеткость режима?

Смените сцену из повседневной жизни: угадайте, где упадут дротики. Если вам разрешено угадать только один раз, ваша оптимальная стратегия — предсказать среднее положение всех дротиков, но это часто будет место на мишени, где вообще мало дротиков попали. Однако, если вам разрешено угадать K раз, и зачисляется только ближайший к правильному результату, оптимальная стратегия сразу меняется: вы распределите свои попытки, чтобы каждая из них охватывала свою отдельную группу точек падения.

Генеративная модель

То же самое и с моделью. Когда ей разрешено исследовать K кандидатов, разные входные шумы будут каждый «заявлять» на свой собственный режим, а не все сходиться в центре для усреднения. Сколько раз будет проведено исследование, столько режимов модель сможет надежно зафиксировать.

Генеративная модель

Автор дал этому долгое время игнорируемому свойству название — генеративная выразительность (generative expressivity), и отметил, что оно определяется самой целью обучения, и никакое увеличение параметров и данных не заставит его расти само по себе.

Генеративная модель

Это также объясняет странный феномен, который давно замечали в отрасли: почему самые лучшие модели сегодня так сильно зависят от технологии «направления» (guidance).

Так называемое классификатор-свободное управление по сути заключается в том, чтобы «оттолкнуть» прогноз от расплывчатого среднего значения. Но если модель сама по себе не размыта, зачем ее толкать? Управление полезно именно потому, что размытость моды является следствием проблемы.

Статья также предлагает два направления поиска: Forward и Reverse. Первое фиксирует реальную цель и ищет ближайшую среди собственных генераций, ориентируясь на «полноту» (покрытие всех режимов); второе фиксирует генерацию и ищет ближайшую среди реальных данных, ориентируясь на «точность» и практически не увеличивая вычислительные затраты, но с риском сжатия к нескольким режимам. Оба подхода дополняют друг друга и могут использоваться совместно.

Генеративная модель

Генеративная модель

Третья ось: чем больше масштаб, тем выше доход

Самый значимый вывод этой статьи — превращение «исследования» в настоящую ось масштабирования.

Автор применил исследование к моделям диффузии/потока, моделям Jumpy и маскированным диффузионным языковым моделям, и во всех трех модальностях — изображениях, видео и языке — наблюдался монотонный рост производительности. Еще более важно, что выгода при масштабировании возрастает все сильнее: чем больше масштаб, тем заметнее эффект.

Цифры, приведенные в статье: с ростом объема данных выгода от исследования возрастает с 7% до 36%; с увеличением размера модели — с 13% до 23%; при увеличении вычислительных мощностей в три раза выгода по эффективности более чем удваивается.

В плане эффективности было достигнуто повышение эффективности по FLOP в 4,1 раза, эффективности по образцам в 6,2 раза и эффективности по параметрам на 47%. В генерации изображений он продвинул текущую лучшую рецептуру RAE до FID 1,43 без управления на ImageNet, приблизившись к лучшим показателям в отрасли.

Генеративная модель

Большая модель, исследующая 5 режимов, даже обгоняет XLarge-модель с на 47% большими параметрами, но не осуществляющую исследование.

Генеративная модель

Этот тренд имеет большое значение. Автор объясняет: при небольших масштабах модель в основном ограничена параметрами и данными, а выразительность генерации еще не является узким местом; однако, как только параметры и данные увеличиваются до уровня, когда они перестают быть ограничивающими факторами, выразительность генерации становится все более настоящим узким местом. И именно она является тем, что можно напрямую масштабировать.

Учитывая, что текущие тренировки настоящих базовых моделей требуют вычислительных ресурсов, примерно на четыре порядка превышающих самые крупные эксперименты в этой статье, авторы считают, что приведенные в статье цифры, скорее всего, являются лишь нижней границей доходности при более масштабных условиях.

Настоящий конец-в-конец генератор

Что произойдет, если довести исследование до предела? Ответ возвращается к начальной загадке: генеративные модели наконец стали энд-ту-энд.

Автор рассматривает XM как независимую конечную модель и применяет её для задач управления роботами. При имитации поведения (Behavior Cloning) их эксплоративная политика достигла и даже превзошла производительность диффузионной политики, требующей 100 прямых проходов, всего за один прямой проход сети. При моделировании мира с ориентацией на цель эксплоративная модель мира достигла лучшего среднего результата, используя в 16–256 раз меньше вычислительных ресурсов, чем диффузионная модель.

Генеративная модель

Генеративная модель

Источник этого различия очевиден: диффузионные модели обменивают выразительность на генерацию за сотни шагов при выводе, тогда как энд-ту-энд XM переносит эту стоимость на исследование во время обучения, благодаря чему вывод требует только одного прямого прохода. «Обработка нескольких модальностей» — это одна и та же задача: либо медленно разбирать её при выводе, либо исследовать её полностью во время обучения; в этой статье выбран второй подход.

Автор представляет

Первый автор этой статьи, Алекси Глэдстоун, не является новичком. Еще в июле 2025 года его работа над Energy-Based Transformers (EBT) вызвала значительное обсуждение в социальных сетях.

Генеративная модель

Работа утверждает, что впервые превзошла кривую масштабирования стандартного прямого Transformer по нескольким измерениям и пытается распространить «мышление системы 2» на произвольные режимы. См. статью MachineHeart: «Пришла новая парадигма! Новая энергетическая модель преодолевает предел масштабирования Transformer++, скорость масштабирования при обучении выше на 35%».

Генеративная модель

Explorative Modeling согласуется с его традиционным подходом: оба направления задаются вопросом, может ли модель с помощью поиска или исследования выполнять задачи, недоступные при однократном прямом проходе. Эта статья основана на другой теории, разработанной им и его соавторами (Илунь Ду и Хэн Цзи) — Mode Forcing. В статье открыто признается, что благодаря этой предшествующей теории большинство результатов XM были сначала предсказаны теоретически, а затем подтверждены экспериментально — что редкость в сообществе глубокого обучения, где принято «сначала запускать эксперименты, а потом объяснять результаты».

Генеративная модель

Автор также честно признает ограничения: сама идея best-of-K не нова — ранее ее уже много раз применяли; их настоящий вклад заключается в том, что они точно поняли, что делает этот простой цикл: он напрямую усиливает выразительность генерации, не разделяя процесс генерации.

Кроме того, авторегрессивные языковые модели по-прежнему остаются самыми сложными задачами, а чисто энд-ту-энд Forward XM по-прежнему слишком дороги для крайне многомодальных распределений (например, генерации изображений), что оставлено для последующих работ.

На протяжении многих лет мы привыкли регулировать генеративные модели с помощью двух параметров: делать их больше и подавать на них больше данных.

Третий регулятор, предложенный в этой статье, довольно прост: заставить модель сделать несколько попыток и оставить только лучшую. Однако, если выявленная тенденция верна, то по мере дальнейшего роста масштаба первые два регулятора в конце концов достигнут своих пределов, а третий только начинает вращаться.

Ссылка для справки

https://x.com/AlexiGlad/status/2083230922196107288

Эта статья взята из официального аккаунта WeChat «Machine Heart» (ID: almosthuman2014), автор: Panda

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.