AIは例を単にコピーするのではなく、何を最適化すべきかを学べるのか? 教師付き微調整(SFT)は、モデルに専門家の回答を模倣させることで学習させる。新しい論文では、PAREDというアライメント手法が紹介され、この手法は同じデモンストレーションから再利用可能な報酬を抽出することを試みている。 PAREDは、有用性、無害性、トピックなどの選択された特徴に基づいて、専門家の回答とモデル自身の回答を比較し、その差異から明示的な報酬を学習する。この報酬は、SFT後に追加の強化学習を導くために使用される。 4,000のGPT-5.1生成デモンストレーションを使用したところ、Gemini 2.5 Flashによる評価結果によると、2つの報酬更新アプローチのいずれにおいても、PAREDで学習したモデルの回答は、元のSFTチェックポイントの回答よりも86.2%および88.4%の非引き分け比較で好まれた。 デモンストレーションは模倣以上の価値を持つ可能性がある。それらは、SFT後にモデルが継続的に学習する目的を定義するのにも役立つ可能性がある。



