অর্ধ-সুপারভাইজড লার্নিং-এ নয়েজ মডেলের পারফরম্যান্স উন্নত করতে পারে

icon MarsBit
শেয়ার
AI summary iconসারাংশ
ICML 2026-এ প্রকাশিত 'সেমি-সাপারভাইজড নয়েজ অ্যাডাপ্টেশন: নয়েজ ডোমেইন থেকে জ্ঞান ট্রান্সফার' শিরোনামের একটি নতুন গবেষণা দেখিয়েছে যে র‍্যান্ডম নয়েজ কম লেবেলযুক্ত পরিস্থিতিতে মডেলের পারফরম্যান্স বাড়াতে পারে। নয়েজ অ্যাডাপ্টেশন ফ্রেমওয়ার্ক (NAF) নয়েজ থেকে ক্লাস স্ট্রাকচার তৈরি করে এবং এগুলিকে বাস্তব ডেটাতে ট্রান্সফার করে, যা CIFAR-10 এবং ImageNet-1K-এর মতো ডেটাসেটগুলিতে সঠিকতা বাড়ায়। MiCA (ইউরোপীয় ক্রিপ্টো-অ্যাসেটস রেগুলেশন) এর বিকাশশীল পরিস্থিতির মধ্যে, এই উন্নতিরা ট্রেডিং এবং ঝুঁকি বিশ্লেষণে ব্যবহৃত প্রেডিকটিভ মডেলগুলিকে উন্নত করে তরলতা এবং ক্রিপ্টো মার্কেটগুলিকে উন্নত করতে পারে।

সোর ডেটা হিসাবে মেশিন লার্নিং-এ অবশ্যই ইমেজ, টেক্সট বা অডিও হতে হবে এমন কোনো কথা নেই।

গাউসীয় বিন্যাস থেকে র‍্যান্ডমভাবে নমুনা করা এবং কোনো অর্থবহ তথ্য বহন করা নয় এমন শব্দ মডেলটিকে কম লেবেলযুক্ত ডেটার সাহায্যে ভালোভাবে শেখায়।

এই কাজটির নাম সেমি-সুপারভাইজড নয়েজ অ্যাডাপ্টেশন (Semi-Supervised Noise Adaptation, SSNA), যা ICML 2026-এ প্রকাশিত হয়েছে।

কম্পিউটার দৃষ্টি

এসএসএনএ দল আরও একটি শব্দ সামঞ্জস্য কাঠামো (Noise Adaptation Framework, NAF) প্রস্তাব করেছে, যা র‍্যান্ডম জেনারেট করা শব্দ ব্যবহার করে একটি পার্থক্যমূলক শ্রেণী কাঠামো তৈরি করে এবং এই কাঠামোটিকে বাস্তব লক্ষ্য ডেটাতে স্থানান্তরিত করে কম লেবেলযুক্ত পরিস্থিতিতে মডেলের শিক্ষণ ক্ষমতা উন্নত করে।

কম্পিউটার দৃষ্টি

△NAF শব্দ ডোমেইন এবং লক্ষ্য ডোমেইনকে একটি শেয়ার্ড রিপ্রেজেন্টেশন স্পেসে প্রজেক্ট করে এবং ক্লাস লেভেলে অ্যালাইন করে। চিত্রটি পেপার থেকে।

প্রতিটি শ্রেণিতে মাত্র 4টি লেবেলযুক্ত নমুনা থাকার অবস্থায়, ResNet-18 ব্যাকবোন ব্যবহার করে, NAF এর CIFAR-10, CIFAR-100, DTD-47 এবং Caltech-101-এ সঠিকতা যথাক্রমে 12.35, 7.61, 4.38 এবং 2.74 পার্সেন্টপয়েন্ট বৃদ্ধি পায়, যা শুধুমাত্র লেবেলযুক্ত নমুনা ব্যবহার করে প্রশিক্ষিত স্ট্যান্ডার্ড সুপারভাইজড লার্নিং বেসলাইন ERM (এম্পিরিকাল রিস্ক মিনিমাইজেশন) এর তুলনায়। বর্তমানে, পেপারের সোর্স কোড ওপেন-সোর্স করা হয়েছে, বিস্তারিতের জন্য নিচের লিঙ্কটি দেখুন।

বাস্তব সোর্স ডোমেইনকে নয়েজে প্রতিস্থাপন করুন

প্রায়শই পাস করা শিক্ষার জন্য একটি লেবেলযুক্ত সোর ডোমেন প্রয়োজন। কিন্তু বাস্তব সোর ডেটা সবসময় পাওয়া সহজ নয়। গোপনীয়তা, গোপনীয়তা এবং কপিরাইট সীমাবদ্ধতা সবগুলি সোর ডোমেন ডেটা শেয়ার করা থেকে বাধা দিতে পারে। SSNA এই ধারণাটি সরিয়ে ফেলার চেষ্টা করে: সোর ডোমেনে বাস্তব নমুনা রাখা হয় না, বরং এটি সহজ সম্ভাব্যতা বিন্যাস থেকে উৎপন্ন শব্দের সাথে প্রতিস্থাপিত হয়।

পদ্ধতিটি জটিল নয়; ধরুন লক্ষ্য কাজে Cটি শ্রেণী রয়েছে। গবেষণা দলটি প্রথমে 1024-মাত্রিক স্থানে প্রতিটি শ্রেণীর জন্য একটি গড় ভেক্টর র‍্যান্ডমলি নমুনা করে, এবং একক ম্যাট্রিক্সকে সহগুণক হিসাবে ব্যবহার করে, Cটি গাউসীয় বিন্যাস তৈরি করে, তারপর প্রতিটি বিন্যাস থেকে 50টি শব্দ ভেক্টর নমুনা করে। শব্দ ডোমেইন এবং লক্ষ্য ডোমেইন একই শ্রেণী সূচক সেট ব্যবহার করে, প্রতিটি শব্দ শ্রেণীর আগে থেকেই একটি লক্ষ্য শ্রেণী সূচকের সাথে মিলে যায়, কিন্তু এই মিলটির মধ্যে কোনও বৈষয়িক তথ্য অন্তর্ভুক্ত নয়।

এখানে সংখ্যাগুলির নিজস্ব কোনো অর্থ নেই। শব্দ শ্রেণী 0 স্বাভাবিকভাবেই “বিড়াল” কে বোঝায় না, এটি শুধুমাত্র প্রশিক্ষণ শুরুর আগে গবেষকদের দ্বারা লক্ষ্য ডোমেইনের একটি শ্রেণীর সাথে স্থিরভাবে সংযুক্ত করা হয়েছিল। আসলে যা স্থানান্তরিত হয়, তা হলো বিড়াল বা কুকুরের দৃশ্যমান জ্ঞান নয়, বরং শব্দ ডোমেইনে গঠিত পার্থক্যমূলক কাঠামো।

একই শ্রেণীর শব্দকে একসাথে চাপা দেওয়া হয় এবং ভিন্ন শ্রেণীর শব্দকে আলাদা করা হয়। যদি এই কাঠামোটি লক্ষ্য ডোমেইনের সাথে সামঞ্জস্যপূর্ণ হয়, তবে এটি বাস্তব লক্ষ্য নমুনার জন্য আরও স্পষ্ট শ্রেণীবিভাজন সীমানা প্রদান করবে।

কিছু ট্যাগ এখনও প্রয়োজন

শব্দ প্রকৃত সোর ডেটা প্রতিস্থাপন করতে পারে, কিন্তু টার্গেট ডোমেইন লেবেল পুরোপুরি প্রতিস্থাপন করতে পারে না। কারণটি সরাসরি: শব্দ অন্য স্পেস থেকে আসে, এবং ক্লাস নম্বরগুলি মানব-নির্ধারিত; মডেলটিকে কিছু লেবেলযুক্ত টার্গেট নমুনা ব্যবহার করে জানতে হবে যে শব্দ ক্লাস 0 কোন প্রকৃত ক্লাসের সাথে মিলবে।

CIFAR-100-এ প্রতিটি ক্লাসের লেবেলযুক্ত নমুনাকে 0-এ নামিয়ে আনলে, ERM এবং NAF-এর সঠিকতা যথাক্রমে মাত্র 0.97% এবং 1.34%, যা দৈব পর্যায়ের কাছাকাছি। কিছু লেবেলযুক্ত ডেটা প্রদানের সাথে সাথে NAF ধারাবাহিকভাবে ERM-এর উপরে চলে যায়।

অতএব, এই কাজের সিদ্ধান্ত হল: অর্ধ-পর্যবেক্ষিত শ্রেণীবিভাগ পরিস্থিতিতে, বাস্তব সোর ডোমেইন ইতিবাচক ট্রান্সফার অর্জনের জন্য প্রয়োজনীয় নয়।

NAF মূলত তিনটি কাজ করেছে

পেপারে প্রদত্ত জেনারালাইজেশন বাউন্ডের ভিত্তিতে, NAF ট্রেনিং লক্ষ্যকে তিনটি অংশে বিভক্ত করে।

কম সংখ্যক বাস্তব লেবেল শিখুন

টার্গেট ডোমেইন এনকোডার বাস্তব নমুনাগুলিকে শেয়ার্ড রিপ্রেজেন্টেশন স্পেসে ম্যাপ করে, এবং ক্লাসিফায়ার কম সংখ্যক লেবেলযুক্ত নমুনার উপর ভিত্তি করে ক্রস-এনট্রপি লস গণনা করে। এই অংশটি সাধারণ সুপারভাইজড লার্নিংয়ের সাথে একই, যা শব্দ শ্রেণী এবং বাস্তব শ্রেণীর মধ্যে সেতুবন্ধন তৈরি করে।

আবার শব্দকে স্পষ্ট শ্রেণীবদ্ধ করুন

নয়েজ প্রজেক্টর র‍্যান্ডম ভেক্টরগুলিকে একই রিপ্রেজেন্টেশন স্পেসে ম্যাপ করে, যখন ক্লাসিফায়ার পূর্বনির্ধারিত ক্লাস নম্বর অনুযায়ী এই নয়েজগুলিকে চিহ্নিত করে। প্রশিক্ষণের পর, একই শ্রেণির নয়েজগুলি ধীরে ধীরে একত্রিত হয়, এবং বিভিন্ন শ্রেণির নয়েজগুলি পরস্পর থেকে পৃথক হয়।

শেষে দুই পাশ সাজান

NAF এছাড়াও শব্দ ডোমেইন এবং লক্ষ্য ডোমেইনের মধ্যে বিন্যাসের পার্থক্য গণনা করে। বিন্যাস সামঞ্জস্য মডিউলটির কোনো নির্দিষ্ট বাস্তবায়ন সীমাবদ্ধ করা হয়নি; পেপারটি বিভিন্ন পদ্ধতির তুলনা করেছে এবং পরীক্ষায় অভিজ্ঞতাজনিতভাবে নেগেটিভ ডোমেইন সামঞ্জস্য (Negative Domain Similarity, NDS) কে ডিফল্ট মেকানিজম হিসেবে গ্রহণ করা হয়েছে। NDS দুটি ডোমেইনের গ্লোবাল গড় এবং প্রতিটি ক্লাসের গড়কে একসাথে তুলনা করে এবং কসাইন সামঞ্জস্য ব্যবহার করে এগুলিকে একে অপরের কাছাকাছি নিয়ে আসে। অপ্রতিষ্ঠিত লক্ষ্য নমুনাগুলির ক্লাসের গড়গুলি মডেল দ্বারা উত্পাদিত পিউডো-লেবেলগুলির মাধ্যমে পুনরাবৃত্তভাবে অনুমান করা হয়।

সম্পূর্ণ লক্ষ্যটি লেখা যেতে পারে

কম্পিউটার দৃষ্টি

। যার মধ্যে

কম্পিউটার দৃষ্টি

প্রকৃত, কম পরিমাণে লেবেলযুক্ত লক্ষ্য নমুনার শ্রেণীবিভাগ দায়িত্ব নিন।

কম্পিউটার দৃষ্টি

শব্দ বর্গীকরণের দায়িত্বে রয়েছে,

কম্পিউটার দৃষ্টি

লক্ষ্য ডোমেইন এবং শব্দ ডোমেইনের বণ্টন সামঞ্জস্য করা। পেপারটিতে দেওয়া সাধারণীকরণ সীমা এই তিনটির সাথে সামঞ্জস্যপূর্ণ: লক্ষ্য ডোমেইনের অভিজ্ঞতাজনিত ত্রুটি, শব্দ ডোমেইনের অভিজ্ঞতাজনিত ত্রুটি, এবং শেয়ারড রিপ্রেজেনটেশন স্পেসে দুটি ডোমেইনের বণ্টনের পার্থক্য।

CIFAR থেকে ImageNet পর্যন্ত, শব্দ সবসময় উপকার আনে

মূল পরীক্ষাটি 8টি ভিজুয়াল ডেটাসেট এবং 1টি টেক্সট ক্লাসিফিকেশন ডেটাসেট কভার করে। ImageNet-1K ছাড়া, ভিজুয়াল টাস্কগুলিতে প্রতিটি ক্লাসের জন্য 4টি লেবেলযুক্ত নমুনা ব্যবহার করা হয়, বাকি ট্রেনিং নমুনাগুলিকে অলেবেলযুক্ত ডেটা হিসাবে বিবেচনা করা হয়।

ResNet-18-এ, NAF-এর তুলনায় ERM-এর Top-1 উন্নতি যথাক্রমে: CIFAR-10+12.35, CIFAR-100+7.61, DTD-47+4.38, Caltech-101+2.74 পার্সেন্ট পয়েন্ট।

কম্পিউটার দৃষ্টি

সূক্ষ্ম শ্রেণীবিভাগও কার্যকর। ResNet-18 ব্যবহার করে, NAF যথাক্রমে CUB-200, Oxford Flowers-102 এবং Stanford Cars-196-এ ERM-এর তুলনায় 8.94, 5.51 এবং 7.74 পার্সেন্টপয়েন্ট বৃদ্ধি করে।

ImageNet-1K-এর বড় স্কেলে, গবেষণা দল প্রতিটি শ্রেণির জন্য 100টি লেবেলযুক্ত নমুনা সংরক্ষণ করে। NAF 37.10% সঠিকতা অর্জন করে, যা ERM-এর চেয়ে 0.99 পার্সেন্টপয়েন্ট বেশি। AG News-4 টেক্সট টাস্কে, BERT ব্যবহার করে NAF 82.82% অর্জন করে, যা ERM-এর 78.64% এর চেয়ে 4.18 পার্সেন্টপয়েন্ট বেশি।

NAF-কে বিদ্যমান অর্ধ-পর্যবেক্ষিত পদ্ধতিগুলিতে সরাসরি এমবেড করা যায়। পেপারটি এটিকে UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM এবং SA-FixMatch-এর সাথে যুক্ত করে, যার ফলে সবগুলিতেই উন্নতি দেখা যায়। CIFAR-10-এর 20 রাউন্ডের প্রশিক্ষণের ফলাফলের উদাহরণস্বরূপ, UDA এবং FixMatch-এ NAF যোগ করার পর, সঠিকতা যথাক্রমে 20.83 এবং 9.91 পয়েন্ট বৃদ্ধি পায়।

বাস্তবিকভাবে উপযোগী হয় এলোমেলো নয়, বরং কাঠামো

কেন শব্দ সাহায্য করে? পেপারের অ্যাবলেশন পরীক্ষাগুলি একই কারণের দিকে ইঙ্গিত করে: ক্লাসগুলির মধ্যে কি পৃথককরণযোগ্য কাঠামো রয়েছে?

টিম প্রথমে সমস্ত শ্রেণীর শব্দকে একই বিন্দুতে চাপিয়ে দেয়। এর ফলে শব্দ ডোমেইন সম্পূর্ণরূপে পার্থক্যমূলক কাঠামো হারায়, NAF কোনও লাভ প্রদান করে না, বরং প্রায়শই স্পষ্ট নেতিবাচক স্থানান্তর দেখা যায়। CIFAR-10-এর সঠিকতা ERM-এর 58.15% থেকে হ্রাস পেয়ে 33.34% হয়, আর CIFAR-100-এর ক্ষেত্রে 42.24% থেকে হ্রাস পেয়ে 6.79% হয়।

অন্যদিকে, শোরগোলের শ্রেণীর কেন্দ্রগুলির মধ্যে দূরত্ব ধাপে ধাপে বাড়ানোর সাথে সাথে CIFAR-100 সঠিকতা 43.80% থেকে বেড়ে 49.78% হয়। এটি নির্দেশ করে যে শোরগোলের শ্রেণীগুলি যত বেশি চিহ্নিত করা যায়, তত বেশি সংগঠনগত নির্দেশনা প্রদান করতে পারে।

শব্দের পরিমাণ এতটাই গুরুত্বপূর্ণ নয়। প্রতিটি শ্রেণির শব্দ 10 থেকে 100-এ বাড়ানোর সাথে সাথে সঠিকতা প্রায় 50% এ স্থির থাকে; 200-এ বাড়ানোর পর এটি কিছুটা কমে যায়। পেপারটি এটি থেকে উপসংহারে পৌঁছায় যে, যদি পৃথককরণযোগ্য প্যাটার্ন গঠন করা যায়, তবে কম শব্দই যথেষ্ট।

কম্পিউটার দৃষ্টি

গবেষণা দল শব্দ ডোমেইনকে প্রতিটি শ্রেণির জন্য একটি কেন্দ্র বিন্দুতে সরলীকরণ করেছে। যাইহোক, কেন্দ্র স্থির বা শিক্ষযোগ্য হোক না কেন, ফলাফল ERM-এর চেয়ে উচ্চতর; শিক্ষযোগ্য কেন্দ্রগুলি স্থির কেন্দ্রগুলির চেয়ে ভালো, তবে পূর্ণাঙ্গ NAF-এর চেয়ে কম।

অ্যামাজন থেকে Caltech-10-এর মাইগ্রেশন পরীক্ষায়, বাস্তব সোর ডেটা এখনও সামান্য বেশি ভালো ফলাফল দেয়, কিন্তু নয়েসি সোর ডোমেইনটি ERM-এর 83.51% থেকে প্রায় 88% থেকে 89% পর্যন্ত সঠিকতা বাড়িয়েছে। এটি আরও বাস্তবসম্মত অবস্থান প্রদান করে: যখন বাস্তব সোর ডেটা পাওয়া যায় না, তখন সিনথেটিক নয়েস একটি খুবই কম খরচের বিকল্প হিসেবে কাজ করতে পারে।

এটি সাধারণ ডেটা অগমেন্টেশন থেকেও ভিন্ন। ডেটা অগমেন্টেশন সাধারণত বাস্তব নমুনার কাছাকাছি ঘূর্ণন, কাটিয়া, ইন্টারপোলেশন বা জেনারেশন করে; এর বিপরীতে, SSNA প্রথমে একটি স্বাধীন নয়েজ ডোমেইন তৈরি করে, তারপর রিপ্রেজেন্টেশন স্পেসে ক্রস-ডোমেইন অ্যালাইনমেন্ট সম্পন্ন করে।

সারাংশ: অর্থহীন হলেও, কাঠামো এখনও স্থানান্তরিত হতে পারে

এই কাজটি মিগ্রেশন লার্নিং-এর জন্য একটি অত্যন্ত অপ্রত্যাশিত দৃষ্টিভঙ্গি প্রদান করে: সোর ডেটা টার্গেট টাস্ককে সহায়তা করতে পারে, এবং এটি অবশ্যই তার প্রকৃত অর্থের উপর নির্ভরশীল হতে হবে না; প্রতিনিধিত্বমূলক স্পেসে গঠিত ক্লাস স্ট্রাকচারও সম্ভবত স্থানান্তরযোগ্য জ্ঞান হতে পারে।

NAF এই বিষয়টির উপর ভিত্তি করে এলোমেলো শব্দকে শেয়ার করা প্রতিনিধিত্বমূলক স্পেসে পার্থক্যমূলক কাঠামো হিসেবে গঠন করে, এবং তারপর কিছু লেবেলযুক্ত নমুনার মাধ্যমে এটিকে বাস্তব ডেটাতে প্রেরণ করে। পরীক্ষার ফলাফলগুলি দেখায় যে, যদিও সোর ডোমেইনে বাস্তব ছবি, টেক্সট বা অডিও না থাকে, তবুও যদি উপযুক্ত শ্রেণির কাঠামোটি বজায় রাখা হয়, তবে এটি লক্ষ্য কাজের জন্য ইতিবাচকভাবে প্রভাব ফেলতে পারে।

অর্থাৎ, মিগ্রেশন লার্নিং যা স্থানান্তরিত হয়, তা শুধু “ডেটা কী বলছে” নয়, বরং “ডেটা কিভাবে রিপ্রেজেন্টেশন স্পেসে সংগঠিত হয়” তাও অন্তর্ভুক্ত করে। এটি গোপনীয়তা সীমাবদ্ধ, কপিরাইট সংবেদনশীল বা বাস্তব সোর ডেটা পাওয়া কঠিন পরিস্থিতিতে একটি নতুন গবেষণা পথ প্রদান করে।

পেপারের শিরোনাম: সেমি-সাপারভাইজড নয়েজ অ্যাডাপটেশন: নয়েজ ডোমেইন থেকে জ্ঞান স্থানান্তর

পেপারের লিঙ্ক: https://arxiv.org/pdf/2606.00558

সোর্স কোড লিঙ্ক: https://github.com/AIResearch-Group/SSNA

ভিডিও ব্যাখ্যা: https://www.bilibili.com/video/BV1UV7h61EvW/

এই লেখাটি ওয়েইচ্যান গিটহাব অ্যাকাউন্ট "Quantum Bit" থেকে এসেছে, লেখক: SSNA টিম

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।