Meta AI выявила вызовы в обучении с подкреплением для оптимизации скорости кода

iconCryptoBriefing
Поделиться
AI summary iconСводка
Новости об ИИ и криптовалюте от команды FAIR Meta AI показывают, что обучение с подкреплением сталкивается с трудностями при оптимизации скорости кода из-за шумного временного интервала, разреженных наград и нестабильности. Команда запустила DMC-Optim — эталон, объединяющий корректность и скорость, что повысило процент прохождения для моделей, таких как Qwen 2.5 7B и CWM 32B. Новые листинги токенов остаются ключевым приоритетом для трейдеров, отслеживающих достижения в области ИИ.

Обучить ИИ писать работающий код — это одно. Обучить его писать код, который работает быстро, — это, похоже, совершенно другое дело.

Новый документ команды FAIR от Meta AI, опубликованный 29 июля, показывает, что расширение обучения с подкреплением от корректности кода до оптимизации его скорости сопряжено с проблемами, которые стандартные подходы просто не могут решить. Виновники: шумные измерения времени, разреженные награды и алгоритмы, которые перестают работать, когда их просят заботиться о производительности, а не только о точности.

Проблема со скоростью

Когда вы проверяете, даёт ли код правильный ответ, вы получаете чёткий бинарный сигнал. Но измерение скорости выполнения кода — это запутанный процесс. Запустив один и тот же код дважды на одном и том же компьютере, вы получите немного разные времена выполнения. Фоновые процессы, планирование ЦП, выделение памяти — всё это вносит шум в измерения времени.

Реклама

Команда Meta обнаружила, что обобщенная оптимизация политики усиления (GRPO), стандартный алгоритм из набора инструментов усиления обучения, становится нестабильной, когда ей передаются такие шумные измерения скорости.

Разреженность вознаграждений усугубляет проблему. Большинство оптимизаций кода дают лишь незначительное ускорение, что означает, что модель редко получает сильный положительный сигнал, говорящий ей: «да, это изменение сделало вещи быстрее».

DMC-Optim: новый стандарт для новой задачи

Чтобы справиться с этими вызовами, исследователи создали DMC-Optim — эталон с настроенной песочницей и специализированным конвейером обучения. Система объединяет награды за точность и скорость выполнения в оффлайн-симуляторе, создавая контролируемую среду, в которой временной шум можно управлять, а не игнорировать.

Результаты трудно оспорить. Проходимость Qwen 2.5 7B выросла с 18,0% до 31,3%, что составляет примерно 74% относительного улучшения. У CWM 32B проходимость повысилась с 30,7% до 50,4%, что составляет 64% относительного роста. На бенчмарке LCB CWM 32B, обученный с использованием этого подхода, превосходил модели, обученные с помощью стандартного усиления от проверяемых вознаграждений, в 83% случаев по скорости.

При ухудшенных временных условиях, когда шум измерений намеренно усиливается, эталон DMC-Optim продемонстрировал улучшение производительности на 100–200% по сравнению со стандартными методами.

Статью авторами являются Пьер Шамбон, Кунхао Чжэн, Жюльет Декюги, Бенуа Саго и Габриэль Синнаев, все из Meta AI.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.