Обучить ИИ писать работающий код — это одно. Обучить его писать код, который работает быстро, — это, похоже, совершенно другое дело.
Новый документ команды FAIR от Meta AI, опубликованный 29 июля, показывает, что расширение обучения с подкреплением от корректности кода до оптимизации его скорости сопряжено с проблемами, которые стандартные подходы просто не могут решить. Виновники: шумные измерения времени, разреженные награды и алгоритмы, которые перестают работать, когда их просят заботиться о производительности, а не только о точности.
Проблема со скоростью
Когда вы проверяете, даёт ли код правильный ответ, вы получаете чёткий бинарный сигнал. Но измерение скорости выполнения кода — это запутанный процесс. Запустив один и тот же код дважды на одном и том же компьютере, вы получите немного разные времена выполнения. Фоновые процессы, планирование ЦП, выделение памяти — всё это вносит шум в измерения времени.
Команда Meta обнаружила, что обобщенная оптимизация политики усиления (GRPO), стандартный алгоритм из набора инструментов усиления обучения, становится нестабильной, когда ей передаются такие шумные измерения скорости.
Разреженность вознаграждений усугубляет проблему. Большинство оптимизаций кода дают лишь незначительное ускорение, что означает, что модель редко получает сильный положительный сигнал, говорящий ей: «да, это изменение сделало вещи быстрее».
DMC-Optim: новый стандарт для новой задачи
Чтобы справиться с этими вызовами, исследователи создали DMC-Optim — эталон с настроенной песочницей и специализированным конвейером обучения. Система объединяет награды за точность и скорость выполнения в оффлайн-симуляторе, создавая контролируемую среду, в которой временной шум можно управлять, а не игнорировать.
Результаты трудно оспорить. Проходимость Qwen 2.5 7B выросла с 18,0% до 31,3%, что составляет примерно 74% относительного улучшения. У CWM 32B проходимость повысилась с 30,7% до 50,4%, что составляет 64% относительного роста. На бенчмарке LCB CWM 32B, обученный с использованием этого подхода, превосходил модели, обученные с помощью стандартного усиления от проверяемых вознаграждений, в 83% случаев по скорости.
При ухудшенных временных условиях, когда шум измерений намеренно усиливается, эталон DMC-Optim продемонстрировал улучшение производительности на 100–200% по сравнению со стандартными методами.
Статью авторами являются Пьер Шамбон, Кунхао Чжэн, Жюльет Декюги, Бенуа Саго и Габриэль Синнаев, все из Meta AI.
