সোর ডেটা হিসাবে মেশিন লার্নিং-এ অবশ্যই ইমেজ, টেক্সট বা অডিও হতে হবে এমন কোনো কথা নেই।
গাউসীয় বিন্যাস থেকে র্যান্ডমভাবে নমুনা করা এবং কোনো অর্থবহ তথ্য বহন করা নয় এমন শব্দ মডেলটিকে কম লেবেলযুক্ত ডেটার সাহায্যে ভালোভাবে শেখায়।
এই কাজটির নাম সেমি-সুপারভাইজড নয়েজ অ্যাডাপ্টেশন (Semi-Supervised Noise Adaptation, SSNA), যা ICML 2026-এ প্রকাশিত হয়েছে।

এসএসএনএ দল আরও একটি শব্দ সামঞ্জস্য কাঠামো (Noise Adaptation Framework, NAF) প্রস্তাব করেছে, যা র্যান্ডম জেনারেট করা শব্দ ব্যবহার করে একটি পার্থক্যমূলক শ্রেণী কাঠামো তৈরি করে এবং এই কাঠামোটিকে বাস্তব লক্ষ্য ডেটাতে স্থানান্তরিত করে কম লেবেলযুক্ত পরিস্থিতিতে মডেলের শিক্ষণ ক্ষমতা উন্নত করে।

△NAF শব্দ ডোমেইন এবং লক্ষ্য ডোমেইনকে একটি শেয়ার্ড রিপ্রেজেন্টেশন স্পেসে প্রজেক্ট করে এবং ক্লাস লেভেলে অ্যালাইন করে। চিত্রটি পেপার থেকে।
প্রতিটি শ্রেণিতে মাত্র 4টি লেবেলযুক্ত নমুনা থাকার অবস্থায়, ResNet-18 ব্যাকবোন ব্যবহার করে, NAF এর CIFAR-10, CIFAR-100, DTD-47 এবং Caltech-101-এ সঠিকতা যথাক্রমে 12.35, 7.61, 4.38 এবং 2.74 পার্সেন্টপয়েন্ট বৃদ্ধি পায়, যা শুধুমাত্র লেবেলযুক্ত নমুনা ব্যবহার করে প্রশিক্ষিত স্ট্যান্ডার্ড সুপারভাইজড লার্নিং বেসলাইন ERM (এম্পিরিকাল রিস্ক মিনিমাইজেশন) এর তুলনায়। বর্তমানে, পেপারের সোর্স কোড ওপেন-সোর্স করা হয়েছে, বিস্তারিতের জন্য নিচের লিঙ্কটি দেখুন।
বাস্তব সোর্স ডোমেইনকে নয়েজে প্রতিস্থাপন করুন
প্রায়শই পাস করা শিক্ষার জন্য একটি লেবেলযুক্ত সোর ডোমেন প্রয়োজন। কিন্তু বাস্তব সোর ডেটা সবসময় পাওয়া সহজ নয়। গোপনীয়তা, গোপনীয়তা এবং কপিরাইট সীমাবদ্ধতা সবগুলি সোর ডোমেন ডেটা শেয়ার করা থেকে বাধা দিতে পারে। SSNA এই ধারণাটি সরিয়ে ফেলার চেষ্টা করে: সোর ডোমেনে বাস্তব নমুনা রাখা হয় না, বরং এটি সহজ সম্ভাব্যতা বিন্যাস থেকে উৎপন্ন শব্দের সাথে প্রতিস্থাপিত হয়।
পদ্ধতিটি জটিল নয়; ধরুন লক্ষ্য কাজে Cটি শ্রেণী রয়েছে। গবেষণা দলটি প্রথমে 1024-মাত্রিক স্থানে প্রতিটি শ্রেণীর জন্য একটি গড় ভেক্টর র্যান্ডমলি নমুনা করে, এবং একক ম্যাট্রিক্সকে সহগুণক হিসাবে ব্যবহার করে, Cটি গাউসীয় বিন্যাস তৈরি করে, তারপর প্রতিটি বিন্যাস থেকে 50টি শব্দ ভেক্টর নমুনা করে। শব্দ ডোমেইন এবং লক্ষ্য ডোমেইন একই শ্রেণী সূচক সেট ব্যবহার করে, প্রতিটি শব্দ শ্রেণীর আগে থেকেই একটি লক্ষ্য শ্রেণী সূচকের সাথে মিলে যায়, কিন্তু এই মিলটির মধ্যে কোনও বৈষয়িক তথ্য অন্তর্ভুক্ত নয়।
এখানে সংখ্যাগুলির নিজস্ব কোনো অর্থ নেই। শব্দ শ্রেণী 0 স্বাভাবিকভাবেই “বিড়াল” কে বোঝায় না, এটি শুধুমাত্র প্রশিক্ষণ শুরুর আগে গবেষকদের দ্বারা লক্ষ্য ডোমেইনের একটি শ্রেণীর সাথে স্থিরভাবে সংযুক্ত করা হয়েছিল। আসলে যা স্থানান্তরিত হয়, তা হলো বিড়াল বা কুকুরের দৃশ্যমান জ্ঞান নয়, বরং শব্দ ডোমেইনে গঠিত পার্থক্যমূলক কাঠামো।
একই শ্রেণীর শব্দকে একসাথে চাপা দেওয়া হয় এবং ভিন্ন শ্রেণীর শব্দকে আলাদা করা হয়। যদি এই কাঠামোটি লক্ষ্য ডোমেইনের সাথে সামঞ্জস্যপূর্ণ হয়, তবে এটি বাস্তব লক্ষ্য নমুনার জন্য আরও স্পষ্ট শ্রেণীবিভাজন সীমানা প্রদান করবে।
কিছু ট্যাগ এখনও প্রয়োজন
শব্দ প্রকৃত সোর ডেটা প্রতিস্থাপন করতে পারে, কিন্তু টার্গেট ডোমেইন লেবেল পুরোপুরি প্রতিস্থাপন করতে পারে না। কারণটি সরাসরি: শব্দ অন্য স্পেস থেকে আসে, এবং ক্লাস নম্বরগুলি মানব-নির্ধারিত; মডেলটিকে কিছু লেবেলযুক্ত টার্গেট নমুনা ব্যবহার করে জানতে হবে যে শব্দ ক্লাস 0 কোন প্রকৃত ক্লাসের সাথে মিলবে।
CIFAR-100-এ প্রতিটি ক্লাসের লেবেলযুক্ত নমুনাকে 0-এ নামিয়ে আনলে, ERM এবং NAF-এর সঠিকতা যথাক্রমে মাত্র 0.97% এবং 1.34%, যা দৈব পর্যায়ের কাছাকাছি। কিছু লেবেলযুক্ত ডেটা প্রদানের সাথে সাথে NAF ধারাবাহিকভাবে ERM-এর উপরে চলে যায়।
অতএব, এই কাজের সিদ্ধান্ত হল: অর্ধ-পর্যবেক্ষিত শ্রেণীবিভাগ পরিস্থিতিতে, বাস্তব সোর ডোমেইন ইতিবাচক ট্রান্সফার অর্জনের জন্য প্রয়োজনীয় নয়।
NAF মূলত তিনটি কাজ করেছে
পেপারে প্রদত্ত জেনারালাইজেশন বাউন্ডের ভিত্তিতে, NAF ট্রেনিং লক্ষ্যকে তিনটি অংশে বিভক্ত করে।
কম সংখ্যক বাস্তব লেবেল শিখুন
টার্গেট ডোমেইন এনকোডার বাস্তব নমুনাগুলিকে শেয়ার্ড রিপ্রেজেন্টেশন স্পেসে ম্যাপ করে, এবং ক্লাসিফায়ার কম সংখ্যক লেবেলযুক্ত নমুনার উপর ভিত্তি করে ক্রস-এনট্রপি লস গণনা করে। এই অংশটি সাধারণ সুপারভাইজড লার্নিংয়ের সাথে একই, যা শব্দ শ্রেণী এবং বাস্তব শ্রেণীর মধ্যে সেতুবন্ধন তৈরি করে।
আবার শব্দকে স্পষ্ট শ্রেণীবদ্ধ করুন
নয়েজ প্রজেক্টর র্যান্ডম ভেক্টরগুলিকে একই রিপ্রেজেন্টেশন স্পেসে ম্যাপ করে, যখন ক্লাসিফায়ার পূর্বনির্ধারিত ক্লাস নম্বর অনুযায়ী এই নয়েজগুলিকে চিহ্নিত করে। প্রশিক্ষণের পর, একই শ্রেণির নয়েজগুলি ধীরে ধীরে একত্রিত হয়, এবং বিভিন্ন শ্রেণির নয়েজগুলি পরস্পর থেকে পৃথক হয়।
শেষে দুই পাশ সাজান
NAF এছাড়াও শব্দ ডোমেইন এবং লক্ষ্য ডোমেইনের মধ্যে বিন্যাসের পার্থক্য গণনা করে। বিন্যাস সামঞ্জস্য মডিউলটির কোনো নির্দিষ্ট বাস্তবায়ন সীমাবদ্ধ করা হয়নি; পেপারটি বিভিন্ন পদ্ধতির তুলনা করেছে এবং পরীক্ষায় অভিজ্ঞতাজনিতভাবে নেগেটিভ ডোমেইন সামঞ্জস্য (Negative Domain Similarity, NDS) কে ডিফল্ট মেকানিজম হিসেবে গ্রহণ করা হয়েছে। NDS দুটি ডোমেইনের গ্লোবাল গড় এবং প্রতিটি ক্লাসের গড়কে একসাথে তুলনা করে এবং কসাইন সামঞ্জস্য ব্যবহার করে এগুলিকে একে অপরের কাছাকাছি নিয়ে আসে। অপ্রতিষ্ঠিত লক্ষ্য নমুনাগুলির ক্লাসের গড়গুলি মডেল দ্বারা উত্পাদিত পিউডো-লেবেলগুলির মাধ্যমে পুনরাবৃত্তভাবে অনুমান করা হয়।
সম্পূর্ণ লক্ষ্যটি লেখা যেতে পারে

। যার মধ্যে

প্রকৃত, কম পরিমাণে লেবেলযুক্ত লক্ষ্য নমুনার শ্রেণীবিভাগ দায়িত্ব নিন।

শব্দ বর্গীকরণের দায়িত্বে রয়েছে,

লক্ষ্য ডোমেইন এবং শব্দ ডোমেইনের বণ্টন সামঞ্জস্য করা। পেপারটিতে দেওয়া সাধারণীকরণ সীমা এই তিনটির সাথে সামঞ্জস্যপূর্ণ: লক্ষ্য ডোমেইনের অভিজ্ঞতাজনিত ত্রুটি, শব্দ ডোমেইনের অভিজ্ঞতাজনিত ত্রুটি, এবং শেয়ারড রিপ্রেজেনটেশন স্পেসে দুটি ডোমেইনের বণ্টনের পার্থক্য।
CIFAR থেকে ImageNet পর্যন্ত, শব্দ সবসময় উপকার আনে
মূল পরীক্ষাটি 8টি ভিজুয়াল ডেটাসেট এবং 1টি টেক্সট ক্লাসিফিকেশন ডেটাসেট কভার করে। ImageNet-1K ছাড়া, ভিজুয়াল টাস্কগুলিতে প্রতিটি ক্লাসের জন্য 4টি লেবেলযুক্ত নমুনা ব্যবহার করা হয়, বাকি ট্রেনিং নমুনাগুলিকে অলেবেলযুক্ত ডেটা হিসাবে বিবেচনা করা হয়।
ResNet-18-এ, NAF-এর তুলনায় ERM-এর Top-1 উন্নতি যথাক্রমে: CIFAR-10+12.35, CIFAR-100+7.61, DTD-47+4.38, Caltech-101+2.74 পার্সেন্ট পয়েন্ট।

△
সূক্ষ্ম শ্রেণীবিভাগও কার্যকর। ResNet-18 ব্যবহার করে, NAF যথাক্রমে CUB-200, Oxford Flowers-102 এবং Stanford Cars-196-এ ERM-এর তুলনায় 8.94, 5.51 এবং 7.74 পার্সেন্টপয়েন্ট বৃদ্ধি করে।
ImageNet-1K-এর বড় স্কেলে, গবেষণা দল প্রতিটি শ্রেণির জন্য 100টি লেবেলযুক্ত নমুনা সংরক্ষণ করে। NAF 37.10% সঠিকতা অর্জন করে, যা ERM-এর চেয়ে 0.99 পার্সেন্টপয়েন্ট বেশি। AG News-4 টেক্সট টাস্কে, BERT ব্যবহার করে NAF 82.82% অর্জন করে, যা ERM-এর 78.64% এর চেয়ে 4.18 পার্সেন্টপয়েন্ট বেশি।
NAF-কে বিদ্যমান অর্ধ-পর্যবেক্ষিত পদ্ধতিগুলিতে সরাসরি এমবেড করা যায়। পেপারটি এটিকে UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM এবং SA-FixMatch-এর সাথে যুক্ত করে, যার ফলে সবগুলিতেই উন্নতি দেখা যায়। CIFAR-10-এর 20 রাউন্ডের প্রশিক্ষণের ফলাফলের উদাহরণস্বরূপ, UDA এবং FixMatch-এ NAF যোগ করার পর, সঠিকতা যথাক্রমে 20.83 এবং 9.91 পয়েন্ট বৃদ্ধি পায়।
বাস্তবিকভাবে উপযোগী হয় এলোমেলো নয়, বরং কাঠামো
কেন শব্দ সাহায্য করে? পেপারের অ্যাবলেশন পরীক্ষাগুলি একই কারণের দিকে ইঙ্গিত করে: ক্লাসগুলির মধ্যে কি পৃথককরণযোগ্য কাঠামো রয়েছে?
টিম প্রথমে সমস্ত শ্রেণীর শব্দকে একই বিন্দুতে চাপিয়ে দেয়। এর ফলে শব্দ ডোমেইন সম্পূর্ণরূপে পার্থক্যমূলক কাঠামো হারায়, NAF কোনও লাভ প্রদান করে না, বরং প্রায়শই স্পষ্ট নেতিবাচক স্থানান্তর দেখা যায়। CIFAR-10-এর সঠিকতা ERM-এর 58.15% থেকে হ্রাস পেয়ে 33.34% হয়, আর CIFAR-100-এর ক্ষেত্রে 42.24% থেকে হ্রাস পেয়ে 6.79% হয়।
অন্যদিকে, শোরগোলের শ্রেণীর কেন্দ্রগুলির মধ্যে দূরত্ব ধাপে ধাপে বাড়ানোর সাথে সাথে CIFAR-100 সঠিকতা 43.80% থেকে বেড়ে 49.78% হয়। এটি নির্দেশ করে যে শোরগোলের শ্রেণীগুলি যত বেশি চিহ্নিত করা যায়, তত বেশি সংগঠনগত নির্দেশনা প্রদান করতে পারে।
শব্দের পরিমাণ এতটাই গুরুত্বপূর্ণ নয়। প্রতিটি শ্রেণির শব্দ 10 থেকে 100-এ বাড়ানোর সাথে সাথে সঠিকতা প্রায় 50% এ স্থির থাকে; 200-এ বাড়ানোর পর এটি কিছুটা কমে যায়। পেপারটি এটি থেকে উপসংহারে পৌঁছায় যে, যদি পৃথককরণযোগ্য প্যাটার্ন গঠন করা যায়, তবে কম শব্দই যথেষ্ট।

△
গবেষণা দল শব্দ ডোমেইনকে প্রতিটি শ্রেণির জন্য একটি কেন্দ্র বিন্দুতে সরলীকরণ করেছে। যাইহোক, কেন্দ্র স্থির বা শিক্ষযোগ্য হোক না কেন, ফলাফল ERM-এর চেয়ে উচ্চতর; শিক্ষযোগ্য কেন্দ্রগুলি স্থির কেন্দ্রগুলির চেয়ে ভালো, তবে পূর্ণাঙ্গ NAF-এর চেয়ে কম।
অ্যামাজন থেকে Caltech-10-এর মাইগ্রেশন পরীক্ষায়, বাস্তব সোর ডেটা এখনও সামান্য বেশি ভালো ফলাফল দেয়, কিন্তু নয়েসি সোর ডোমেইনটি ERM-এর 83.51% থেকে প্রায় 88% থেকে 89% পর্যন্ত সঠিকতা বাড়িয়েছে। এটি আরও বাস্তবসম্মত অবস্থান প্রদান করে: যখন বাস্তব সোর ডেটা পাওয়া যায় না, তখন সিনথেটিক নয়েস একটি খুবই কম খরচের বিকল্প হিসেবে কাজ করতে পারে।
এটি সাধারণ ডেটা অগমেন্টেশন থেকেও ভিন্ন। ডেটা অগমেন্টেশন সাধারণত বাস্তব নমুনার কাছাকাছি ঘূর্ণন, কাটিয়া, ইন্টারপোলেশন বা জেনারেশন করে; এর বিপরীতে, SSNA প্রথমে একটি স্বাধীন নয়েজ ডোমেইন তৈরি করে, তারপর রিপ্রেজেন্টেশন স্পেসে ক্রস-ডোমেইন অ্যালাইনমেন্ট সম্পন্ন করে।
সারাংশ: অর্থহীন হলেও, কাঠামো এখনও স্থানান্তরিত হতে পারে
এই কাজটি মিগ্রেশন লার্নিং-এর জন্য একটি অত্যন্ত অপ্রত্যাশিত দৃষ্টিভঙ্গি প্রদান করে: সোর ডেটা টার্গেট টাস্ককে সহায়তা করতে পারে, এবং এটি অবশ্যই তার প্রকৃত অর্থের উপর নির্ভরশীল হতে হবে না; প্রতিনিধিত্বমূলক স্পেসে গঠিত ক্লাস স্ট্রাকচারও সম্ভবত স্থানান্তরযোগ্য জ্ঞান হতে পারে।
NAF এই বিষয়টির উপর ভিত্তি করে এলোমেলো শব্দকে শেয়ার করা প্রতিনিধিত্বমূলক স্পেসে পার্থক্যমূলক কাঠামো হিসেবে গঠন করে, এবং তারপর কিছু লেবেলযুক্ত নমুনার মাধ্যমে এটিকে বাস্তব ডেটাতে প্রেরণ করে। পরীক্ষার ফলাফলগুলি দেখায় যে, যদিও সোর ডোমেইনে বাস্তব ছবি, টেক্সট বা অডিও না থাকে, তবুও যদি উপযুক্ত শ্রেণির কাঠামোটি বজায় রাখা হয়, তবে এটি লক্ষ্য কাজের জন্য ইতিবাচকভাবে প্রভাব ফেলতে পারে।
অর্থাৎ, মিগ্রেশন লার্নিং যা স্থানান্তরিত হয়, তা শুধু “ডেটা কী বলছে” নয়, বরং “ডেটা কিভাবে রিপ্রেজেন্টেশন স্পেসে সংগঠিত হয়” তাও অন্তর্ভুক্ত করে। এটি গোপনীয়তা সীমাবদ্ধ, কপিরাইট সংবেদনশীল বা বাস্তব সোর ডেটা পাওয়া কঠিন পরিস্থিতিতে একটি নতুন গবেষণা পথ প্রদান করে।
পেপারের শিরোনাম: সেমি-সাপারভাইজড নয়েজ অ্যাডাপটেশন: নয়েজ ডোমেইন থেকে জ্ঞান স্থানান্তর
পেপারের লিঙ্ক: https://arxiv.org/pdf/2606.00558
সোর্স কোড লিঙ্ক: https://github.com/AIResearch-Group/SSNA
ভিডিও ব্যাখ্যা: https://www.bilibili.com/video/BV1UV7h61EvW/
এই লেখাটি ওয়েইচ্যান গিটহাব অ্যাকাউন্ট "Quantum Bit" থেকে এসেছে, লেখক: SSNA টিম
