नॉइज सेमी-सुपरवाइज्ड लर्निंग में मॉडल प्रदर्शन में सुधार कर सकता है

icon MarsBit
साझा करें
AI summary iconसारांश
ICML 2026 में प्रकाशित 'सेमी-सुपरवाइज्ड नॉइज़ एडैप्टेशन: नॉइज़ डोमेन से ज्ञान का स्थानांतरण' शीर्षक से एक नया अध्ययन दर्शाता है कि यादृच्छिक नॉइज़ कम लेबल वाले परिदृश्यों में मॉडल के प्रदर्शन को बढ़ा सकता है। नॉइज़ एडैप्टेशन फ्रेमवर्क (NAF) नॉइज़ से क्लास संरचनाएँ बनाता है और उन्हें वास्तविक डेटा पर ट्रांसफ़र करता है, जिससे CIFAR-10 और ImageNet-1K जैसे डेटासेट्स पर सटीकता में सुधार होता है। MiCA (यूरोपीय क्रिप्टो-एसेट्स रेगुलेशन) के विकासशील परिदृश्य के बीच, ऐसी प्रगतियाँ ट्रेडिंग और जोखिम विश्लेषण में उपयोग किए जाने वाले प्रेडिक्टिव मॉडल्स को सुधारकर लिक्विडिटी और क्रिप्टो मार्केट्स को बढ़ावा दे सकती हैं।

मॉडल ट्रांसफर लर्निंग में "स्रोत डेटा" अनिवार्य रूप से चित्र, पाठ या ऑडियो होना चाहिए।

गाउस वितरण से यादृच्छिक रूप से निकाले गए, कोई अर्थ नहीं रखने वाले शोर के सेट भी मॉडल को कम लेबल्ड डेटा के साथ बेहतर सीखने में मदद कर सकते हैं।

यह कार्य अर्ध-निरीक्षित शोर अनुकूलन (Semi-Supervised Noise Adaptation, SSNA) के नाम से जाना जाता है, और इस पेपर को ICML 2026 में प्रकाशित किया गया है।

कंप्यूटर विज़न

SSNA टीम ने एक शोर-अनुकूलन ढांचा (Noise Adaptation Framework, NAF) और अधिक प्रस्तावित किया, जो यादृच्छिक रूप से उत्पन्न शोर का उपयोग करके एक विभेदक वर्ग संरचना बनाता है और इस संरचना को वास्तविक लक्ष्य डेटा पर स्थानांतरित करता है, जिससे कम लेबल किए गए परिदृश्यों में मॉडल की सीखने की क्षमता में सुधार होता है।

कंप्यूटर विज़न

△NAF शोर डोमेन और टारगेट डोमेन को एक साझा प्रतिनिधि स्थान में प्रक्षेपित करता है और श्रेणी स्तर पर अलाइन करता है। चित्र पेपर से।

प्रत्येक श्रेणी में केवल 4 लेबल किए गए नमूनों के साथ, ResNet-18 बॉनीनेट के आधार पर, NAF ने CIFAR-10, CIFAR-100, DTD-47 और Caltech-101 पर स्टैंडर्ड सुपरवाइज्ड लर्निंग बेसलाइन ERM (एम्पिरिकल रिस्क मिनिमाइजेशन) की तुलना में क्रमशः 12.35, 7.61, 4.38 और 2.74 प्रतिशत की वृद्धि की है। वर्तमान में, पेपर का सोर्स कोड ओपन सोर्स हो चुका है, विवरण के लिए अंत में देखें।

रियल सोर्स डोमेन को नॉइज में बदल दें

पारंपरिक स्थानांतरण शिक्षा आमतौर पर एक लेबल वाले स्रोत डोमेन की आवश्यकता करती है। लेकिन वास्तविक स्रोत डेटा हमेशा आसानी से उपलब्ध नहीं होता। गोपनीयता, गुप्तता और कॉपीराइट सीमाएँ, स्रोत डोमेन डेटा को साझा करने से रोक सकती हैं। SSNA इस पूर्वधारण को हटाने का प्रयास करता है: स्रोत डोमेन में वास्तविक नमूने नहीं, बल्कि सरल संभाव्यता वितरण से उत्पन्न शोर को शामिल किया जाता है।

विधि जटिल नहीं है; मान लीजिए कि लक्ष्य कार्य में C वर्ग हैं। अनुसंधान टीम पहले 1024-आयामी स्थान में प्रत्येक वर्ग के लिए एक औसत सदिश यादृच्छिक रूप से नमूना लेती है और इकाई मैट्रिक्स को सहसंबंध के रूप में उपयोग करती है, जिससे C गॉसियन वितरण बनते हैं, और फिर प्रत्येक वितरण से 50 शोर सदिश नमूना लिए जाते हैं। शोर क्षेत्र और लक्ष्य क्षेत्र एक ही वर्ग सूचकांक समूह का उपयोग करते हैं, प्रत्येक शोर वर्ग पहले से ही एक लक्ष्य वर्ग सूचकांक के साथ संबंधित होता है, लेकिन इस संबंध में कोई अर्थपूर्ण जानकारी शामिल नहीं होती है।

यहाँ संख्याएँ स्वयं कोई अर्थ नहीं रखतीं। शोर वर्ग 0 स्वाभाविक रूप से “बिल्ली” को नहीं दर्शाता, बल्कि प्रशिक्षण शुरू होने से पहले, शोधकर्ताओं ने इसे लक्ष्य क्षेत्र में किसी एक वर्ग से स्थिर रूप से संबंधित कर दिया है। वास्तव में स्थानांतरित होने वाला, बिल्ली या कुत्ते का दृश्य ज्ञान नहीं, बल्कि शोर क्षेत्र में बनी विभेदक संरचना है।

एक ही श्रेणी के शोर को एक साथ दबा दिया जाता है और अलग-अलग श्रेणियों के शोर को अलग कर दिया जाता है। जब तक यह संरचना लक्ष्य क्षेत्र के साथ संरेखित हो सकती है, यह वास्तविक लक्ष्य नमूनों के लिए अधिक स्पष्ट वर्गीकरण सीमा प्रदान कर सकती है।

थोड़े टैग अभी भी आवश्यक हैं

शोर को वास्तविक स्रोत डेटा के स्थान पर उपयोग किया जा सकता है, लेकिन लक्ष्य क्षेत्र लेबल को पूरी तरह से विकल्प नहीं बनाया जा सकता। कारण सीधा है: शोर एक अन्य स्थान से आता है, और श्रेणी संख्याएँ मानव द्वारा निर्दिष्ट की गई हैं, इसलिए मॉडल को कुछ कम लेबल किए गए लक्ष्य नमूनों की सहायता से यह जानने की आवश्यकता होती है कि शोर वर्ग 0 को वास्तविक किस श्रेणी के साथ समायोजित किया जाए।

जब CIFAR-100 पर प्रत्येक वर्ग के लेबल किए गए नमूनों को 0 तक घटा दिया जाता है, तो ERM और NAF की सटीकता क्रमशः केवल 0.97% और 1.34% होती है, जो यादृच्छिक स्तर के करीब है। एक छोटी संख्या में लेबल उपलब्ध होते ही, NAF ERM को लगातार पार कर जाता है।

इसलिए, इस कार्य का निष्कर्ष है: अर्ध-निरीक्षित वर्गीकरण सेटिंग में, वास्तविक स्रोत डोमेन सकारात्मक स्थानांतरण प्राप्त करने के लिए आवश्यक नहीं है।

NAF ने मुख्य रूप से तीन कार्य किए

पेपर में दिए गए सामान्यीकरण सीमा के आधार पर, NAF ट्रेनिंग लक्ष्य को तीन भागों में विभाजित करता है।

पहले कुछ वास्तविक टैग्स को अच्छी तरह से सीखें

टारगेट डोमेन एन्कोडर वास्तविक नमूनों को साझा प्रतिनिधि स्थान में मैप करता है, और वर्गीकर्ता कुछ लेबल किए गए नमूनों का उपयोग करके क्रॉस-एंट्रॉपी नुकसान की गणना करता है। यह भाग सामान्य अधीक्षित शिक्षा के समान है, जो शोर वर्ग और वास्तविक श्रेणी के बीच एक पुल स्थापित करता है।

Let the noise form a clear categorical structure

नॉइज प्रोजेक्टर रैंडम वेक्टर को एक ही रिप्रेजेंटेशन स्पेस में मैप करता है, जबकि क्लासिफायर इन नॉइज को पूर्वनिर्धारित श्रेणी संख्या के आधार पर पहचानता है। प्रशिक्षण के बाद, समान श्रेणी के नॉइज एक साथ इकट्ठे हो जाते हैं और अलग-अलग श्रेणियों के नॉइज एक-दूसरे से अलग हो जाते हैं।

अंत में दोनों को संरेखित करें

NAF अतिरिक्त रूप से शोर डोमेन और लक्ष्य डोमेन के बीच वितरण अंतर की गणना करता है। वितरण संरेखण मॉड्यूल किसी विशिष्ट कार्यान्वयन पर निर्भर नहीं करता है; पेपर ने कई विकल्पों की तुलना की है, और प्रयोगों में अनुभवजन्य रूप से नेगेटिव डोमेन समानता (Negative Domain Similarity, NDS) को डिफ़ॉल्ट मैकेनिज़म के रूप में अपनाया गया है। NDS दोनों डोमेन के वैश्विक माध्य और प्रत्येक श्रेणी के माध्य की तुलना करता है और उन्हें एक-दूसरे के करीब लाने के लिए कोसाइन समानता का उपयोग करता है। अनटैग किए गए लक्ष्य नमूनों के श्रेणी माध्य का अनुमान मॉडल द्वारा उत्पादित प्सीडो-लेबल्स के माध्यम से पुनरावृत्ति से किया जाता है।

पूरा लक्ष्य लिखा जा सकता है

कंप्यूटर विज़न

। जिसमें,

कंप्यूटर विज़न

प्रामाणिक, थोड़े और लेबल किए गए लक्ष्य नमूनों के वर्गीकरण के लिए जिम्मेदार

कंप्यूटर विज़न

नोइज़ क्लासिफिकेशन के लिए जिम्मेदार

कंप्यूटर विज़न

लक्ष्य क्षेत्र और शोर क्षेत्र वितरण के संरेखण के लिए उत्तरदायी। अनुसंधान पत्र द्वारा दिया गया सामान्यीकरण सीमा इन तीन बिंदुओं से संबंधित है: लक्ष्य क्षेत्र की अनुभवजन्य त्रुटि, शोर क्षेत्र की अनुभवजन्य त्रुटि, और साझा प्रतिनिधि स्थान में दोनों क्षेत्रों के वितरण का अंतर।

CIFAR से लेकर ImageNet तक, शोर से लाभ मिलता है

मुख्य प्रयोग में 8 विजुअल डेटासेट और 1 टेक्स्ट वर्गीकरण डेटासेट शामिल हैं। ImageNet-1K के अलावा, सभी विजुअल कार्यों में प्रति वर्ग 4 लेबल किए गए नमूने का उपयोग किया जाता है, और शेष प्रशिक्षण नमूनों को अलेबल्ड डेटा के रूप में उपयोग किया जाता है।

ResNet-18 पर, NAF ने ERM की तुलना में Top-1 में निम्नलिखित वृद्धि दर्ज की: CIFAR-10 +12.35, CIFAR-100 +7.61, DTD-47 +4.38, Caltech-101 +2.74 प्रतिशत बिंदु।

कंप्यूटर विज़न

सूक्ष्म वर्गीकरण भी प्रभावी है। ResNet-18 का उपयोग करते समय, NAF ने CUB-200, Oxford Flowers-102 और Stanford Cars-196 पर ERM की तुलना में क्रमशः 8.94, 5.51 और 7.74 प्रतिशत बढ़ोतरी की।

ImageNet-1K के बड़े स्केल पर, अनुसंधान टीम ने प्रत्येक वर्ग के लिए 100 लेबल किए गए नमूने बनाए रखे। NAF ने 37.10% सटीकता प्राप्त की, जो ERM से 0.99 प्रतिशत अधिक है। AG News-4 पर टेक्स्ट टास्क पर, BERT के साथ NAF ने 82.82% सटीकता प्राप्त की, जो ERM के 78.64% से 4.18 प्रतिशत अधिक है।

NAF को मौजूदा अर्ध-निरीक्षित विधियों में सीधे एकीकृत किया जा सकता है। शोध पत्र ने इसे UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM और SA-FixMatch में शामिल किया, जिससे सभी में सुधार हुआ। CIFAR-10 के 20 राउंड के प्रशिक्षण के परिणामों को उदाहरण के रूप में लेते हुए, UDA और FixMatch में NAF जोड़ने से सटीकता क्रमशः 20.83 और 9.91 प्रतिशत बढ़ गई।

वास्तविक रूप से उपयोगी बात “यादृच्छिक” नहीं, बल्कि संरचना है

शोर क्यों मदद करता है? अध्ययन के अपवर्जन परीक्षण उत्तर को एक ही कारक की ओर इशारा करते हैं: क्या वर्गों के बीच अलग-थलग संरचना है?

टीम ने सबसे पहले सभी श्रेणियों के शोर को एक ही बिंदु पर समेट दिया। इससे शोर क्षेत्र पूरी तरह से विभेदक संरचना खो देता है, NAF को कोई लाभ नहीं मिलता और इसके बजाय स्पष्ट नकारात्मक स्थानांतरण होता है। CIFAR-10 की सटीकता ERM के 58.15% से घटकर 33.34% हो गई, जबकि CIFAR-100 की सटीकता 42.24% से घटकर 6.79% हो गई।

इसके विपरीत, जब शोर वर्ग केंद्रों के बीच की दूरी को कदम दर कदम बढ़ाया जाता है, तो CIFAR-100 की सटीकता 43.80% से बढ़कर 49.78% हो जाती है। इससे स्पष्ट होता है कि जितना शोर वर्ग अधिक अलग-थलग होता है, उतना ही अधिक मजबूत संरचनात्मक मार्गदर्शन प्रदान किया जा सकता है।

शोर की संख्या इतनी महत्वपूर्ण नहीं है। जब प्रत्येक श्रेणी के शोर की संख्या 10 से बढ़ाकर 100 कर दी गई, तो शुद्धता लगभग 50% पर स्थिर रही; 200 तक बढ़ाने पर थोड़ी कम हो गई। इस आधार पर पेपर का निष्कर्ष है कि जब तक अलग-अलग पैटर्न बन सकते हैं, तब तक कुछ ही शोर पर्याप्त होता है।

कंप्यूटर विज़न

अनुसंधान टीम ने शोर क्षेत्र को प्रत्येक वर्ग के लिए एक केंद्र बिंदु में सरल कर दिया। चाहे केंद्र स्थिर हो या सीखने योग्य, दोनों स्थितियों में ERM से बेहतर परिणाम मिले; जिनमें सीखने योग्य केंद्र स्थिर केंद्रों से बेहतर थे, लेकिन पूर्ण NAF से कम थे।

Amazon से Caltech-10 के स्थानांतरण प्रयोग में, वास्तविक स्रोत डेटा अभी भी हल्के से बेहतर है, लेकिन शोर स्रोत डोमेन ने ERM के 83.51% से सटीकता को लगभग 88% से 89% तक बढ़ा दिया है। इससे एक अधिक वास्तविक स्थिति सामने आती है: जब वास्तविक स्रोत डेटा उपलब्ध नहीं होता, तो सिंथेटिक शोर एक बहुत कम लागत वाला विकल्प बन सकता है।

यह सामान्य डेटा वृद्धि से भी भिन्न है। डेटा वृद्धि आमतौर पर वास्तविक नमूनों के पास घूर्णन, क्रॉपिंग, इंटरपोलेशन या जनरेशन करती है; जबकि SSNA पहले एक स्वतंत्र शोर क्षेत्र बनाता है, और फिर प्रतिनिधि स्थान में क्रॉस-डोमेन अलाइनमेंट पूरा करता है।

सारांश: बिना अर्थ के, संरचना अभी भी स्थानांतरित की जा सकती है

यह कार्य स्थानांतरण शिक्षा के लिए एक अत्यंत अप्रत्याशित नया दृष्टिकोण प्रदान करता है: स्रोत डेटा लक्ष्य कार्य की मदद कर सकता है, और इसके लिए इसकी वास्तविक अर्थपूर्णता पर पूरी तरह से निर्भर करना आवश्यक नहीं है; प्रतिनिधित्व स्थान में बनने वाली श्रेणी संरचना भी स्थानांतरणीय ज्ञान बन सकती है।

NAF इस बात का लाभ उठाता है कि यादृच्छिक शोर साझा प्रतिनिधि स्थान में विभेदक संरचना बनाता है, और फिर कुछ लेबल किए गए नमूनों के माध्यम से इसे वास्तविक डेटा पर स्थानांतरित करता है। परीक्षण परिणाम दर्शाते हैं कि भले ही स्रोत डोमेन में वास्तविक छवियाँ, पाठ या ऑडियो शामिल न हों, बस उपयुक्त श्रेणी संरचना को बनाए रखने से लक्ष्य कार्य पर सकारात्मक प्रभाव पड़ सकता है।

दूसरे शब्दों में, स्थानांतरित शिक्षा द्वारा स्थानांतरित होने वाला केवल “डेटा क्या कहता है” ही नहीं, बल्कि “डेटा प्रतिनिधित्व स्थान में कैसे संगठित है” भी हो सकता है। इससे गोपनीयता सीमित, कॉपीराइट संवेदनशील या वास्तविक स्रोत डेटा कठिनाई से उपलब्ध होने के परिदृश्यों के लिए एक नया शोध दृष्टिकोण प्रदान होता है।

शीर्षक: अर्ध-सुपरवाइज्ड शोर अनुकलन: शोर डोमेन से ज्ञान का स्थानांतरण

कागजात का पता: https://arxiv.org/pdf/2606.00558

सोर्स कोड लिंक: https://github.com/AIResearch-Group/SSNA

वीडियो व्याख्या: https://www.bilibili.com/video/BV1UV7h61EvW/

यह लेख वेचेन ग्रुप "क्वांटम बिट" से आया है, लेखक: SSNA टीम

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।