Навчити штучний інтелект писати код, який працює — це одне. Навчити його писати код, який працює швидко — це, здається, зовсім інша справа.
Новий документ від команди FAIR Meta AI, опублікований 29 липня, розкриває, що розширення підсиленого навчання від коректності коду до оптимізації швидкості коду пов’язане з численними проблемами, яких не можуть вирішити стандартні підходи. Винуватці: шумні вимірювання часу, розріджені нагороди та алгоритми, які руйнуються, коли ви просите їх ставити до уваги продуктивність, а не лише точність.
Проблема зі швидкістю
Коли ви вимірюєте, чи код дає правильну відповідь, ви отримуєте чіткий бінарний сигнал. Але вимірювання швидкості виконання коду — це складний процес. Запустивши один і той же код двічі на тому самому пристрої, ви отримаєте трохи різні часи виконання. Фонові процеси, планування ЦП, виділення пам’яті — усе це вносить шум у вимірювання часу.
Команда Meta виявила, що узагальнена політика підсиленого навчання (GRPO), стандартний алгоритм із набору інструментів підсиленого навчання, стає нестабільною, коли їй надаються ці типи шумних вимірювань швидкості.
Розрідженість нагород посилює проблему. Більшість оптимізацій коду дають мінімальні покращення швидкості, що означає, що модель рідко отримує сильний позитивний сигнал, який би говорив їй: «так, ця зміна зробила речі швидшими».
DMC-Optim: новий стандарт для нової задачі
Щоб вирішити ці виклики, дослідники створили DMC-Optim — набір інструментів із налаштованим сандбоксом та спеціалізованою тренувальною пайплайн-системою. Система поєднує винагороди за правильність та швидкість виконання в офлайн-симуляторі, створюючи контрольоване середовище, де шум часу можна керувати, а не ігнорувати.
Результати важко сперечатися. Прохідний рейтинг для Qwen 2.5 7B зростився з 18,0% до 31,3%, що становить приблизно 74% відносного покращення. CWM 32B підвищив свій прохідний рейтинг з 30,7% до 50,4%, що становить 64% відносного зростання. На бенчмарку LCB CWM 32B, навчений за цим підходом, перевершив медіанні порівняння швидкості в 83% випадків порівняно з моделями, навченими за допомогою стандартного підсилення з підтверджених винагород.
За погіршених умов таймінгу, коли шум вимірювання навмисно посилюється, еталон DMC-Optim продемонстрував покращення продуктивності на 100–200% порівняно зі стандартними методами.
Статтю авторизували П'єр Шамон, Кунхао Чжэн, Жюлієт Декюгіс, Бенуа Саго та Габріель Синнаеве, усі з Meta AI.
