source avatarMinty

Поділитися

Чи може ШІ навчитися того, що оптимізувати, на прикладах, а не просто копіювати їх? Надзорне доналаштування (SFT) навчає модель імітувати відповіді експертів. У новій статті представлений метод PARED — метод вирівнювання, який намагається витягнути повторно використовувану нагороду з тих самих демонстрацій. PARED порівнює відповіді експертів із власними відповідями моделі за вибраними характеристиками, такими як корисність, безпечність та тема. Використовуючи ці розбіжності, він навчається явній нагороді, яка потім керує додатковим підсиленням навчання після SFT. Використовуючи 4 000 демонстрацій, згенерованих GPT-5.1, відповіді моделей, навчених за допомогою PARED, були вибрані переважно порівняно з відповідями початкової контрольної точки SFT у 86,2 % і 88,4 % незв’язаних порівнянь за двома підходами оновлення нагороди, за оцінкою Gemini 2.5 Flash. Демонстрації можуть стати корисними не лише для імітації. Вони також можуть допомогти визначити мету, від якої модель продовжує навчатися після SFT.

No.0 picture
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.