source avatarMinty

Поделиться

Может ли ИИ учиться тому, что оптимизировать, на примерах, а не просто копировать их? При supervised fine-tuning (SFT) модель обучается имитировать ответы экспертов. В новой статье представлен метод PARED — метод выравнивания, который пытается извлечь из этих же примеров переиспользуемую награду. PARED сравнивает ответы экспертов с собственными ответами модели по выбранным параметрам, таким как полезность, безвредность и тематика. На основе этих различий он обучает явную функцию награды, которая затем направляет дополнительное обучение с подкреплением после SFT. Используя 4000 демонстраций, сгенерированных GPT-5.1, ответы моделей, обученных с помощью PARED, были предпочтительнее ответов исходной контрольной точки SFT в 86,2% и 88,4% случаев неравных сравнений при двух подходах обновления награды, по оценке Gemini 2.5 Flash. Демонстрации могут оказаться полезными не только для имитации. Они также могут помочь определить цель, от которой модель будет продолжать учиться после SFT.

No.0 picture
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.