क्या AI उदाहरणों से यह सीख सकता है कि क्या अनुकूलित करना है, बस उन्हें कॉपी करने के बजाय? नियंत्रित सूक्ष्म-समायोजन (SFT) एक मॉडल को विशेषज्ञ उत्तरों का अनुकरण करके सिखाता है। एक नया पेपर PARED नामक एक समायोजन विधि पेश करता है, जो इन्हीं प्रदर्शनों से एक पुनःउपयोगयोग्य पुरस्कार निकालने का प्रयास करता है। PARED, उपयोगिता, हानिरहितता और विषय जैसी चुनी गई विशेषताओं के आधार पर विशेषज्ञ उत्तरों की तुलना मॉडल के स्वयं के उत्तरों से करता है। यह इन अंतरों का उपयोग एक स्पष्ट पुरस्कार सीखने के लिए करता है, जो SFT के बाद अतिरिक्त प्रवर्धन सीखने को मार्गदर्शन करता है। 4,000 GPT-5.1-जेनरेटेड प्रदर्शनों का उपयोग करते हुए, PARED-प्रशिक्षित मॉडल के उत्तरों को Gemini 2.5 Flash द्वारा मूल्यांकन किए जाने पर, दो पुरस्कार-अद्यतन दृष्टिकोणों के अंतर्गत 86.2% और 88.4% गैर-बराबरी तुलनाओं में मूल SFT चेकपॉइंट के उत्तरों से पसंद किया गया। प्रदर्शन केवल अनुकरण के लिए ही उपयोगी नहीं हो सकते। वे मॉडल के लिए एक ऐसा उद्देश्य परिभाषित करने में भी मदद कर सकते हैं, जिससे SFT के बाद मॉडल सीखता रहता है।
Mintyसाझा करें

स्रोत:मूल दिखाएं
डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा।
डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।
