Чи можуть харнеси розблокувати потужніші системи ШІ? Дослідники розробили новий харнес, який дозволяє існуючим моделям обробляти довші та складніші робочі процеси. Рекурсивна мовна модель (RLM) зберігає великі файли та набори даних поза основним контекстом моделі. Модель використовує код для вибору відповідних фрагментів, надсилання кожного через окремий запит до моделі та об’єднання результатів. Це відрізняється від звичайних сеансів, де файли, вихідні дані інструментів та результати накопичуються в одному контексті. Зі зростанням контексту моделі можуть починати втрачати контроль над ключовими деталями. Щоб перевірити, чи така структура також покращує навчання, дослідники використали підсилення (RL) для навчання Qwen3-30B у фіксованому харнесі RLM, використовуючи лише короткі завдання, а потім оцінили його на завданнях у 8–32 рази довших. При оцінці довших завдань модель, навчена за допомогою RLM, продемонструвала значне покращення, тоді як та сама модель, навчена без харнесу, загалом не показала практично жодного прогресу. У окремих експериментах вона також застосувала ці ж стратегії в нових галузях, які вимагали подібних базових кроків.
MintyПоділитися

Джерело:Показати оригінал
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації.
Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.