source avatarMinty

Partager

L’IA peut-elle apprendre ce qu’il faut optimiser à partir d’exemples plutôt que de simplement les copier ? Le raffinement supervisé (SFT) enseigne un modèle en lui faisant imiter les réponses d’experts. Un nouvel article présente PARED, une méthode d’alignement qui cherche à extraire une récompense réutilisable à partir de ces mêmes démonstrations. PARED compare les réponses d’experts aux réponses du modèle lui-même selon des caractéristiques choisies telles que l’utilité, l’innocuité et le sujet. Il utilise ces différences pour apprendre une récompense explicite, qui guide ensuite un apprentissage par renforcement supplémentaire après le SFT. À l’aide de 4 000 démonstrations générées par GPT-5.1, les réponses des modèles formés avec PARED ont été préférées à celles du point de contrôle SFT original dans 86,2 % et 88,4 % des comparaisons non nulles selon deux approches de mise à jour de la récompense, selon l’évaluation de Gemini 2.5 Flash. Les démonstrations pourraient s’avérer utiles bien au-delà de l’imitation. Elles pourraient également aider à définir un objectif dont le modèle continue d’apprendre après le SFT.

No.0 picture
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.