هل يمكن للذكاء الاصطناعي تعلم ما يجب تحسينه من الأمثلة بدلاً من مجرد نسخها؟ يُدرّب التFine-tuning الخاضع للإشراف (SFT) النموذج على تقليد إجابات الخبراء. تقدم ورقة جديدة طريقة تسمى PARED، وهي طريقة محاذاة تسعى لاستخلاص مكافأة قابلة لإعادة الاستخدام من هذه العينات نفسها. تُقارن PARED بين إجابات الخبراء وإجابات النموذج الخاصة بها عبر ميزات مختارة مثل المساعدة، وعدم الضرر، والمواضيع. وتستخدم هذه الاختلافات لتعلم مكافأة صريحة، والتي توجه بعد ذلك عملية التعلم المعزز الإضافية بعد SFT. باستخدام 4000 عينة تم إنشاؤها بواسطة GPT-5.1، تم تفضيل إجابات النماذج المدربة باستخدام PARED على إجابات نقطة التحقق الأصلية من SFT في 86.2% و88.4% من المقارنات غير المتكافئة تحت نهجين لتحديث المكافأة، وفقًا لتقييم Gemini 2.5 Flash. يمكن أن تصبح العينات مفيدة أكثر من مجرد التقليد. يمكنها أيضًا مساعدة في تحديد هدف يستمر النموذج في تعلمه بعد SFT.
Mintyمشاركة

المصدر:عرض النسخة الأصلية
إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات.
يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.
