source avatarMinty

I-share

Maaari ba ang AI na matutunan kung ano ang dapat i-optimize mula sa mga halimbawa kaysa sa pagkopya lamang nito? Ang supervised fine-tuning (SFT) ay nagtuturo sa isang model sa pamamagitan ng paghahamon sa ito na imitahin ang mga sagot ng mga eksperto. Isang bagong papel ay naglalayon ng PARED, isang paraan ng pagpapalago na sumusubok na makuha ang isang muling gamitin na reward mula sa mga parehong demonstrasyon. Ang PARED ay ihahambing ang mga sagot ng eksperto sa mga sariling sagot ng model sa pamamagitan ng mga napiling tampok tulad ng pagiging makatulong, pagiging walang panganib, at paksa. Ginagamit nito ang mga pagkakaiba upang matutunan ang isang eksplisitong reward, na magiging gabay sa karagdagang reinforcement learning pagkatapos ng SFT. Gamit ang 4,000 na demonstrasyon na ginawa ng GPT-5.1, ang mga sagot mula sa mga modelong tinuruan ng PARED ay piniling mas mabuti kaysa sa mga sagot mula sa orihinal na SFT checkpoint sa 86.2% at 88.4% ng mga hindi tied na paghahambing sa ilalim ng dalawang paraan ng pag-update ng reward, ayon sa pagtataya ni Gemini 2.5 Flash. Ang mga demonstrasyon ay maaaring magkaroon ng kapaki-pakinabang na gamit higit pa sa pagkopya. Maaari rin silang tumulong sa pagtukoy ng isang layunin na patuloy na natututunan ng model pagkatapos ng SFT.

No.0 picture
Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.