source avatarMinty

共有

AIは例を単にコピーするのではなく、何を最適化すべきかを学べるのか? 教師付き微調整(SFT)は、モデルに専門家の回答を模倣させることで学習させる。新しい論文では、PAREDというアライメント手法が紹介され、この手法は同じデモンストレーションから再利用可能な報酬を抽出することを試みている。 PAREDは、有用性、無害性、トピックなどの選択された特徴に基づいて、専門家の回答とモデル自身の回答を比較し、その差異から明示的な報酬を学習する。この報酬は、SFT後に追加の強化学習を導くために使用される。 4,000のGPT-5.1生成デモンストレーションを使用したところ、Gemini 2.5 Flashによる評価結果によると、2つの報酬更新アプローチのいずれにおいても、PAREDで学習したモデルの回答は、元のSFTチェックポイントの回答よりも86.2%および88.4%の非引き分け比較で好まれた。 デモンストレーションは模倣以上の価値を持つ可能性がある。それらは、SFT後にモデルが継続的に学習する目的を定義するのにも役立つ可能性がある。

No.0 picture
免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。