source avatarMinty

साझा करें

क्या AI उदाहरणों से यह सीख सकता है कि क्या अनुकूलित करना है, बस उन्हें कॉपी करने के बजाय? नियंत्रित सूक्ष्म-समायोजन (SFT) एक मॉडल को विशेषज्ञ उत्तरों का अनुकरण करके सिखाता है। एक नया पेपर PARED नामक एक समायोजन विधि पेश करता है, जो इन्हीं प्रदर्शनों से एक पुनःउपयोगयोग्य पुरस्कार निकालने का प्रयास करता है। PARED, उपयोगिता, हानिरहितता और विषय जैसी चुनी गई विशेषताओं के आधार पर विशेषज्ञ उत्तरों की तुलना मॉडल के स्वयं के उत्तरों से करता है। यह इन अंतरों का उपयोग एक स्पष्ट पुरस्कार सीखने के लिए करता है, जो SFT के बाद अतिरिक्त प्रवर्धन सीखने को मार्गदर्शन करता है। 4,000 GPT-5.1-जेनरेटेड प्रदर्शनों का उपयोग करते हुए, PARED-प्रशिक्षित मॉडल के उत्तरों को Gemini 2.5 Flash द्वारा मूल्यांकन किए जाने पर, दो पुरस्कार-अद्यतन दृष्टिकोणों के अंतर्गत 86.2% और 88.4% गैर-बराबरी तुलनाओं में मूल SFT चेकपॉइंट के उत्तरों से पसंद किया गया। प्रदर्शन केवल अनुकरण के लिए ही उपयोगी नहीं हो सकते। वे मॉडल के लिए एक ऐसा उद्देश्य परिभाषित करने में भी मदद कर सकते हैं, जिससे SFT के बाद मॉडल सीखता रहता है।

No.0 picture
डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।