source avatarMinty

بانٹیں

کیا AI مثالوں سے یہ سیکھ سکتا ہے کہ کیا بہتر بنایا جائے، صرف انہیں کاپی کرنے کے بجائے؟ supervised fine-tuning (SFT) ایک ماڈل کو ماہر جوابات کی نقل کرنے کے ذریعے سکھاتا ہے۔ ایک نئی تحقیق میں PARED نامی ایک ایلائنمنٹ طریقہ متعارف کرایا گیا ہے جو انہیں دکھائی دینے والی مثالوں سے قابلِ استعمال انعام استخراج کرنے کی کوشش کرتا ہے۔ PARED ماہر جوابات اور ماڈل کے اپنے جوابات کو منتخب شدہ خصوصیات جیسے مددگاری، بے ضرری اور موضوع کے لحاظ سے موازنہ کرتا ہے۔ یہ فرق استعمال کرتا ہے تاکہ ایک واضح انعام سیکھ سکے، جو پھر SFT کے بعد مزید تقویتی سیکھنے کو ہدایت دیتا ہے۔ 4,000 GPT-5.1 جنریٹڈ مثالوں کا استعمال کرتے ہوئے، PARED سے تربیت یافتہ ماڈلز کے جوابات کو Gemini 2.5 Flash کے جائزہ کے مطابق دو انعام اپڈیٹ طریقوں کے تحت 86.2% اور 88.4% غیر برابر موازنہ میں اصل SFT چیک پوائنٹ کے جوابات سے ترجیح دی گئی۔ مثالوں کا استعمال صرف نقل کرنے تک محدود نہیں ہونا چاہئے۔ وہ ماڈل کو SFT کے بعد بھی سیکھنے کا مقصد تعریف کرنے میں مدد بھی کر سکتی ہیں۔

No.0 picture
اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔