Meta AI виявила виклики у підсиленому навчанні для оптимізації швидкості коду

iconCryptoBriefing
Поділитися
AI summary iconКороткий зміст
Новини про ШІ та криптовалюту від команди FAIR Meta AI показують, що підсилююче навчання стикається з труднощами при оптимізації швидкості коду через шумовий таймінг, розріджені нагороди та нестабільність. Команда запустила DMC-Optim — бенчмарк, що поєднує коректність і швидкість, що підвищив показники проходження для моделей, таких як Qwen 2.5 7B і CWM 32B. Нові лістинги токенів залишаються ключовим фокусом для трейдерів, які стежать за розвитком ШІ.

Навчити штучний інтелект писати код, який працює — це одне. Навчити його писати код, який працює швидко — це, здається, зовсім інша справа.

Новий документ від команди FAIR Meta AI, опублікований 29 липня, розкриває, що розширення підсиленого навчання від коректності коду до оптимізації швидкості коду пов’язане з численними проблемами, яких не можуть вирішити стандартні підходи. Винуватці: шумні вимірювання часу, розріджені нагороди та алгоритми, які руйнуються, коли ви просите їх ставити до уваги продуктивність, а не лише точність.

Проблема зі швидкістю

Коли ви вимірюєте, чи код дає правильну відповідь, ви отримуєте чіткий бінарний сигнал. Але вимірювання швидкості виконання коду — це складний процес. Запустивши один і той же код двічі на тому самому пристрої, ви отримаєте трохи різні часи виконання. Фонові процеси, планування ЦП, виділення пам’яті — усе це вносить шум у вимірювання часу.

Реклама

Команда Meta виявила, що узагальнена політика підсиленого навчання (GRPO), стандартний алгоритм із набору інструментів підсиленого навчання, стає нестабільною, коли їй надаються ці типи шумних вимірювань швидкості.

Розрідженість нагород посилює проблему. Більшість оптимізацій коду дають мінімальні покращення швидкості, що означає, що модель рідко отримує сильний позитивний сигнал, який би говорив їй: «так, ця зміна зробила речі швидшими».

DMC-Optim: новий стандарт для нової задачі

Щоб вирішити ці виклики, дослідники створили DMC-Optim — набір інструментів із налаштованим сандбоксом та спеціалізованою тренувальною пайплайн-системою. Система поєднує винагороди за правильність та швидкість виконання в офлайн-симуляторі, створюючи контрольоване середовище, де шум часу можна керувати, а не ігнорувати.

Результати важко сперечатися. Прохідний рейтинг для Qwen 2.5 7B зростився з 18,0% до 31,3%, що становить приблизно 74% відносного покращення. CWM 32B підвищив свій прохідний рейтинг з 30,7% до 50,4%, що становить 64% відносного зростання. На бенчмарку LCB CWM 32B, навчений за цим підходом, перевершив медіанні порівняння швидкості в 83% випадків порівняно з моделями, навченими за допомогою стандартного підсилення з підтверджених винагород.

За погіршених умов таймінгу, коли шум вимірювання навмисно посилюється, еталон DMC-Optim продемонстрував покращення продуктивності на 100–200% порівняно зі стандартними методами.

Статтю авторизували П'єр Шамон, Кунхао Чжэн, Жюлієт Декюгіс, Бенуа Саго та Габріель Синнаеве, усі з Meta AI.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.