مقامی سیکھنے میں "ذرائع ڈیٹا" ضروری طور پر تصاویر، متن یا آڈیو ہونا ضروری نہیں۔
گاوسی توزیع سے تصادفی طور پر نمونہ لیا گیا، کوئی معنی نہ رکھنے والا شور، مدل کو کم لیبلled ڈیٹا کے ساتھ بہتر سیکھنے میں مدد کر سکتا ہے۔
یہ کام "سیمی-سپروائزڈ نویز ایڈاپٹیشن" (Semi-Supervised Noise Adaptation، SSNA) کے نام سے جانا جاتا ہے، اور پیپر ICML 2026 میں شائع ہوا ہے۔

SSNA ٹیم نے مزید ایک ادراکی شور سازگار فریم ورک (Noise Adaptation Framework, NAF) پیش کیا، جو تصادفی طور پر تخلیق کردہ شور کا استعمال کرتے ہوئے تمیزی طور پر طبقاتی ساخت بناتا ہے اور اس ساخت کو حقیقی ہدف ڈیٹا پر منتقل کرتا ہے، جس سے محدود اینوٹیشن کے سیناریوز میں ماڈل کی سیکھنے کی صلاحیت بہتر ہوتی ہے۔

△NAF نویز ڈومین اور ٹارگٹ ڈومین کو مشترکہ ریپریزینٹیشن اسپیس میں پروجیکٹ کرتا ہے اور کیٹیگری لیول پر الائن کرتا ہے۔ تصویر پیپر سے۔
ہر شریط میں صرف 4 لیبل شدہ نمونوں کے ساتھ، ResNet-18 بیک بون کے ساتھ، NAF نے CIFAR-10، CIFAR-100، DTD-47 اور Caltech-101 پر مانک سپروائیزڈ لرننگ بیس لائن ERM (تجرباتی خطرہ کم کرنا) کے مقابلے میں ت lần 12.35، 7.61، 4.38 اور 2.74 فیصد کا بہتری حاصل کیا۔ اب تک، پیپر کا سورس کوڈ اوپن سورس ہو چکا ہے، تفصیلات کے لیے مضامین کے آخر میں دیکھیں۔
حقیقی سرچھڑی کو شور میں بدل دیں
سنتی تبدیلی سیکھنے کے لیے عام طور پر ایک لیبل شدہ ماخذ ڈومین کی ضرورت ہوتی ہے۔ لیکن حقیقی ماخذ ڈیٹا ہمیشہ آسانی سے دستیاب نہیں ہوتا۔ خصوصیات، سرکاری پابندیاں اور کاپی رائٹ کے پابندیاں ماخذ ڈومین ڈیٹا کو شیئر ہونے سے روک سکتی ہیں۔ SSNA اس پرفرضیہ کو ختم کرنے کی کوشش کرتا ہے: ماخذ ڈومین میں حقیقی نمونے نہیں ہوتے، بلکہ ان کی جگہ آسان احتمالی تقسیم سے تخلیق کردہ شور لیا جاتا ہے۔
عمل کا طریقہ پیچیدہ نہیں ہے؛ فرض کریں کہ مقصدی ٹاسک میں C درجات ہیں۔ تحقیقی ٹیم پہلے 1024 ڈیمنشن کی جگہ میں ہر درجے کے لیے ایک اوسط ویکٹر کا رینڈم نمونہ لیتی ہے اور ایک یونٹ میٹرکس کو کوویریئنس کے طور پر استعمال کرتی ہے، جس سے C گاوسین توزیعیں تشکیل دی جاتی ہیں، اور پھر ہر توزیع سے 50 اضطرابی ویکٹرز نمونہ لیے جاتے ہیں۔ اضطرابی میدان اور مقصدی میدان ایک ہی درجے انڈیکس سیٹ کا استعمال کرتے ہیں، جہاں ہر اضطرابی درجہ پہلے سے مقصدی درجے کے انڈیکس سے متعلق ہوتا ہے، لیکن یہ تطابق خود میں کوئی معنائی معلومات نہیں رکھتا۔
یہاں نمبر کا کوئی مفہوم نہیں ہے۔ شور کی قسم 0 خود بخود "بلی" کو نہیں ظاہر کرتی، بلکہ صرف تربیت شروع ہونے سے پہلے، محققین نے اسے مقصدی دامن میں ایک خاص قسم سے منسلک کر دیا۔ واقعی منتقل ہونے والی چیز بلی یا کتے کا بصری علم نہیں، بلکہ شور دامن میں تشکیل پانے والا تمیزی ڈھانچہ ہے۔
ایک ہی شریط کے شور کو ایک ساتھ دبایا جاتا ہے، جبکہ مختلف شریطوں کے شور کو الگ کیا جاتا ہے۔ اگر یہ ساخت مقصد کے شعبے کے ساتھ مطابقت رکھتی ہے، تو یہ حقیقی مقصد نمونوں کے لیے زیادہ واضح طبقہ بندی کی سرحد فراہم کر سکتی ہے۔
کچھ ٹیگز اب بھی ضروری ہیں
شوخی حقیقی ذرائع ڈیٹا کی جگہ لے سکتی ہے، لیکن ہدف شدہ ڈومین لیبلز کی مکمل جگہ نہیں لے سکتی۔ وجہ بہت سیدھی ہے: شوخی دوسرے اسپیس سے آتی ہے، اور درجہ بندی نمبرز انسانی طور پر مقرر کیے گئے ہیں، ماڈل کو کچھ مارکڈ ہدف نمونوں کی مدد سے یہ جاننا ہوگا کہ شوخی کلاس 0 کو کس حقیقی کلاس کے ساتھ ملانا چاہیے۔
جب CIFAR-100 پر ہر کلاس کے لیے لیبل شدہ نمونوں کی تعداد کو صفر کر دیا جاتا ہے، تو ERM اور NAF کی درستگی کریکٹریلی 0.97% اور 1.34% ہوتی ہے، جو تصادفی سطح کے قریب ہے۔ جب بھی کچھ لیبل شدہ نمونے فراہم کیے جاتے ہیں، NAF ERM کو مستقل طور پر پار کر جاتا ہے۔
اس لیے، اس کام کا نتیجہ یہ ہے کہ نیم-سپروائزڈ طبقہ بندی کے سیٹنگ میں، اصل سورس ڈومین ضروری نہیں ہے کہ مثبت ٹرانسفر کو حاصل کیا جا سکے۔
NAF نے تین اہم کام کیے
پیپر میں دیے گئے جنرلائزیشن باؤنڈ کے حوالے سے، NAF تربیت کے مقصد کو تین حصوں میں تقسیم کرتا ہے۔
پہلے کچھ حقیقی لیبلز سیکھیں
ہدف شدہ اینکوڈر حقیقی نمونوں کو مشترکہ رپریزینٹیشن اسپیس میں مپ کرتا ہے، جبکہ طبقہ بند کنندہ کم علامت دار نمونوں کا استعمال کرتے ہوئے کراس اینٹروپی نقص کا حساب لگاتا ہے۔ یہ حصہ عام مراقبہ شدہ سیکھنے کے ساتھ مطابقت رکھتا ہے اور اس کا مقصد اندراج کی اقسام اور حقیقی اقسام کے درمیان پل بنانا ہے۔
شورو غوشا کو واضح طبقاتی ساخت بنائیں
نومیز پروجیکٹر تصادفی ویکٹرز کو ایک ہی ریپریزینٹیشن سپیس میں مپ کرتا ہے، جبکہ طبقہ بند کنندہ ان نومیز کو پیش گوئی کردہ شریحوں کے نمبروں کے مطابق پہچانتا ہے۔ تربیت کے بعد، ایک جیسے نومیز ایک ساتھ جمع ہو جاتے ہیں اور مختلف قسم کے نومیز ایک دوسرے سے الگ ہو جاتے ہیں۔
آخر میں دونوں طرف کو مساوی کریں
NAF اس کے علاوہ اضطرابی دامن اور مقصدی دامن کے درمیان تقسیم کے فرق کو بھی حساب کرتا ہے۔ تقسیم کی تطابق ماڈیول کا کوئی خاص عملی جائزہ محدود نہیں ہے، اور مقالہ نے کئی منصوبوں کا موازنہ کیا، جس کے بعد تجرباتی طور پر نیگیٹو ڈومین سملارٹی (Negative Domain Similarity، NDS) کو ڈیفالٹ مکینزم کے طور پر اپنایا گیا۔ NDS دونوں دامنوں کے عالمی اوسط اور مختلف اقسام کے اوسطات کا موازنہ کرتا ہے اور انہیں قریب لانے کے لیے کوزائن سملارٹی استعمال کرتا ہے۔ غیر نشان دار مقصد نمونوں کے اقسام کے اوسطات کو ماڈل کے ذریعہ تخلیق کردہ جھوٹے لیبلز کے ذریعہ دہرائی جانے والی تخمینہ لگائی جاتی ہے۔
مکمل مقصد لکھا جا سکتا ہے

۔ جن میں،

حقیقی، کم مقدار میں اینوٹیٹڈ ہدف نمونوں کی طبقہ بندی کرنا

نویس کی درجہ بندی کی ذمہ داری

ہدف کے شعبہ اور شور کے شعبہ کی تقسیم کو مطابق کرنے کی ذمہ داری۔ تحقیقی مقالہ میں دیا گیا تعمیمی حد بھی ان تینوں چیزوں سے مطابقت رکھتا ہے: ہدف کے شعبہ کی تجرباتی خطاء، شور کے شعبہ کی تجرباتی خطاء، اور دونوں شعبوں کے درمیان مشترکہ نمائندگی کے خلائی میں تقسیم کا فرق۔
CIFAR سے لے کر ImageNet تک، شور سے فائدہ ہوتا ہے
مین ایکسپیریمنٹ میں 8 ویژوئل ڈیٹا سیٹس اور ایک ٹیکسٹ کلاسیفیکیشن ڈیٹا سیٹ شamil ہیں۔ ImageNet-1K کے علاوہ، ویژوئل ٹاسکس میں ہر کلاس کے لیے 4 اینوٹیٹڈ نمونے استعمال کیے جاتے ہیں، باقی تربیتی نمونے بے اینوٹیٹڈ ڈیٹا کے طور پر استعمال کیے جاتے ہیں۔
ResNet-18 پر، NAF کا ERM کے مقابلے میں Top-1 میں اضافہ درج ذیل ہے: CIFAR-10 +12.35، CIFAR-100 +7.61، DTD-47 +4.38، Caltech-101 +2.74 فیصد۔

△
گرانیولر کلاسیفیکیشن بھی مؤثر ہے۔ ResNet-18 کا استعمال کرتے ہوئے، NAF نے CUB-200، Oxford Flowers-102 اور Stanford Cars-196 پر ERM کے مقابلے میں 각각 8.94، 5.51 اور 7.74 فیصد کا بہتری لایا۔
بڑے پیمانے پر ImageNet-1K پر، تحقیقی ٹیم نے ہر کلاس کے لیے 100 اینوٹیڈ نمونے محفوظ کیے۔ NAF نے 37.10% درستگی حاصل کی، جو ERM سے 0.99 فیصد زیادہ ہے۔ متن کا کام AG News-4 پر، BERT کا استعمال کرتے ہوئے NAF نے 82.82% حاصل کیا، جو ERM کے 78.64% سے 4.18 فیصد زیادہ ہے۔
NAF کو موجودہ نیم-سپروائزڈ طریقہ کاروں میں براہ راست شامل کیا جا سکتا ہے۔ مقالہ نے اسے UDA، FixMatch، FlexMatch، DebiasMatch، DST، LERM اور SA-FixMatch میں شامل کیا، جس سے تمام میں بہتری آئی۔ CIFAR-10 کے 20 راؤنڈ کی تربیت کے نتائج کے حوالے سے، UDA اور FixMatch میں NAF شامل کرنے سے درستگی میں lần 20.83 اور 9.91 فیصد کی اضافہ ہوا۔
اصلی طور پر مفید چیز "تصادفی" نہیں، بلکہ ساخت ہے
شوخی کیوں مدد کرتی ہے؟ تحقیقی مضمون کے ابلاسیشن تجربات نے جواب ایک ہی عامل کی طرف اشارہ کیا: کیا درمیانی طبقات میں الگ کرنے کے قابل ساخت ہے؟
ٹیم نے سبھی زمرے کے شور کو ایک ہی نقطے پر دبادیا۔ اس طرح، شور کا خانہ مکمل طور پر تمیزی ساخت کھو دیا، جس کی وجہ سے NAF کو کوئی فائدہ نہیں ملا بلکہ واضح منفی منتقلی ہوئی۔ CIFAR-10 کی درستگی ERM کے 58.15% سے گھٹ کر 33.34% ہو گئی، جبکہ CIFAR-100 کی درستگی 42.24% سے گھٹ کر 6.79% ہو گئی۔
اس کے برعکس، جب شور کی اقسام کے مراکز کے درمیان فاصلہ تدریجاً بڑھایا جاتا ہے، تو CIFAR-100 کی درستگی 43.80% سے بڑھ کر 49.78% ہو جاتی ہے۔ اس سے ثابت ہوتا ہے کہ جتنی زیادہ شور کی اقسام آسانی سے الگ کی جا سکتی ہیں، اتنی ہی زیادہ ساختی رہنمائی فراہم ہوتی ہے۔
شوخی کی تعداد اتنی اہم نہیں ہے۔ جب ہر قسم کی شوخی کی تعداد 10 سے بڑھا کر 100 کر دی گئی، تو درستگی لگ بھگ 50 فیصد پر مستقل رہی؛ جب اسے 200 تک بڑھایا گیا تو اس میں تھوڑا سا کمی آئی۔ اس لیے پیپر کا خیال ہے کہ جب تک قابل تقسیم نمونہ تشکیل پا سکے، تو تھوڑی سی شوخی بھی کافی ہے۔

△
تحقیقی ٹیم نے اضافی میدان کو ہر شرط کے لیے ایک مرکزی نقطہ تک محدود کر دیا۔ چاہے مرکز ثابت ہو یا سیکھا جا سکے، دونوں صورتوں میں ERM سے بہتر نتائج ملے؛ جن میں سیکھا جانے والا مرکز ثابت مرکز سے بہتر تھا، لیکن پورے NAF سے کم تھا۔
Amazon سے Caltech-10 تک کے منتقلی تجربے میں، اصل ماخذ ڈیٹا اب بھی تھوڑا بہتر ہے، لیکن شور ماخذ نے ERM کی 83.51% درستگی کو تقریباً 88% سے 89% تک بڑھا دیا ہے۔ اس سے ایک زیادہ عملی نقطہ نظر سامنے آتا ہے: جب اصل ماخذ ڈیٹا دستیاب نہ ہو، تو مصنوعی شور ایک بہت کم لاگت والی جگہ لے سکتا ہے۔
یہ عام ڈیٹا ایکسٹینشن سے بھی مختلف ہے۔ عام طور پر، ڈیٹا ایکسٹینشن میں حقیقی نمونوں کے قریب گھماؤ، کاٹنا، انٹرپولیشن یا جنریشن کی جاتی ہے؛ جبکہ SSNA پہلے ایک مستقل اضافی میدان تشکیل دیتا ہے، اور پھر رپریزنٹیشن اسپیس میں میدانوں کے درمیان تطابق حاصل کرتا ہے۔
خلاصہ: بے معنی ہونے کے باوجود، ساخت کو منتقل کیا جا سکتا ہے
یہ کام میگریشن لرننگ کے لیے ایک نئی، غیر متوقع نظریہ پیش کرتا ہے: ذرائع کے ڈیٹا کو مقصد کے کام میں مدد مل سکتی ہے، اور اس کے لیے ان کے حقیقی معنی پر مکمل طور پر انحصار نہیں کرنا پڑتا، بلکہ نمائش کے فضا میں تشکیل پانے والی اقسام کی ساخت بھی منتقل کی جا سکنے والی معلومات بن سکتی ہے۔
NAF اس بات کا فائدہ اٹھاتا ہے کہ تصادفی ا噪声 مشترکہ خصوصیات کے فضا میں تمیزی ساخت بناتا ہے، اور پھر کچھ نشان زدہ نمونوں کی مدد سے اسے حقیقی ڈیٹا تک منتقل کرتا ہے۔ تجرباتی نتائج ظاہر کرتے ہیں کہ جب تک مناسب طور پر درجہ بندی کی ساخت برقرار رکھی جائے، تو ذرائع کے شعبے میں حقیقی تصاویر، متن یا آواز نہ ہونے کے باوجود، مقصدی کام کے لیے مثبت اثر ہو سکتا ہے۔
دوسروں کے الفاظ میں، منتقلی سیکھنے میں منتقل ہونے والی چیز صرف “ڈیٹا کیا کہتے ہیں” نہیں بلکہ “ڈیٹا کیسے ریپریزنٹیشن اسپیس میں منظم ہوتا ہے” بھی شامل ہے۔ اس سے خصوصیات کی پابندی، کاپی رائٹ حساس یا اصل ذرائع کے ڈیٹا تک رسائی مشکل ہونے والے مناظر کے لیے ایک نئی تحقیقی راہ فراہم ہوتی ہے۔
ٹائٹل: نیم-سپروائزڈ نویز ایڈاپٹیشن: نویز ڈومین سے علم منتقل کرنا
کاغذ کا لنک: https://arxiv.org/pdf/2606.00558
سرچ کا پتہ: https://github.com/AIResearch-Group/SSNA
ویڈیو کا تجزیہ: https://www.bilibili.com/video/BV1UV7h61EvW/
یہ مضمون ویچن گروپ "Quantum Bit" سے ہے، مصنف: SSNA ٹیم
