২০১২ সালে, আলেক্সনেট একটি যুগকে পরাজিত করে শেষ করে। এর আগে, চিত্র শনাক্তকরণের জন্য মানুষ হাতে হাতে বিভিন্ন বৈশিষ্ট্য বের করার প্রক্রিয়া ডিজাইন করত; আলেক্সনেট একটি বিষয় প্রমাণ করে, যা পরবর্তীতে বারবার যাচাই করা হয়েছে: সম্পূর্ণ কাজটিকে একটি মডেলের উপর সম্পূর্ণভাবে ছেড়ে দিলে, এটি প্রায়ই মানুষের দ্বারা পরিকল্পিত ধাপে ধাপে প্রবাহকে পরাজিত করে।
চিত্র শ্রেণীবিভাগ থেকে লক্ষ্য শনাক্তকরণের মধ্যে দিয়ে চিত্র বিভাজন পর্যন্ত, গভীর শিক্ষার প্রতিটি প্রগতির পিছনে একই কথা: এটিকে নিজেই একসাথে শেখান।
একমাত্র ক্ষেত্র যা সর্বদা ব্যতিক্রম: জেনারেটিভ মডেল।
আজকের সবচেয়ে শক্তিশালী এবং সবচেয়ে বেশি স্কেলযোগ্য জেনারেটিভ মডেল (যেকোনো অটোরিগ্রেসিভ বা ডিফিউশন মডেল) এন্ড-টু-এন্ড নয়।
তাদের প্রশিক্ষণের সময় শুধুমাত্র একটি ছোট পদক্ষেপ পূর্বাভাস দেওয়ার জন্য শেখানো হয়েছিল, কিন্তু উপসংহারের সময় এই পদক্ষেপটিকে হাজার হাজারবার পুনরাবৃত্তি করতে হয়, যেমনটি একটি রিকারেন্ট নেটওয়ার্কের মতো।
ট্রেনিং এবং ইনফারেন্সের জন্য একই নমুনা পদ্ধতি ব্যবহার করা হয় না। এই বিচ্ছিন্নতা একটি পুরনো সমস্যা তৈরি করে: প্রতিটি ধাপের ত্রুটি পরবর্তী ধাপে প্রবেশ করে, ইনপুট ধীরে ধীরে ট্রেনিংয়ের সময় দেখা বিন্যাস থেকে বিচ্যুত হয়ে যায়, এবং ত্রুটি স্তরে স্তরে জমা হয়। এটিকে শিক্ষাগতভাবে "এক্সপোজার বায়াস" (exposure bias) বলা হয়।
অন্যভাবে বললে, দশকের পর দশক ধরে ডিপ লার্নিং-এর সবচেয়ে মৌলিক অভিজ্ঞতা, "এন্ড-টু-এন্ড ভালো", কখনও জেনারেটিভ মডেলগুলিতে বাস্তবায়িত হয়নি।
এবং সাম্প্রতিক সময়ে, UIUC এবং হার্ভার্ড বিশ্ববিদ্যালয়ের একটি গবেষণাপত্র এই শেষ পাজলের টুকরোটি পূরণ করার চেষ্টা করেছে।

লেখক এই নতুন প্যারাডাইমের নাম দিয়েছেন এক্সপ্লোরেটিভ মডেলিং (Explorative Modeling), যার সংক্ষিপ্ত রূপ XM। এর ধারণাটি প্রায় সরল এবং সহজ, কিন্তু একটি সাহসী উপসংহারের দিকে নিয়ে যায়: জেনারেটিভ মডেলগুলির প্যারামিটার এবং ডেটার পাশাপাশি, আসলে তিনটি বৃহত্তরকরণযোগ্য অক্ষ রয়েছে।

প্রকল্পের ওয়েবসাইট: https://explorative-modeling.github.io
পেপারের ঠিকানা: https://arxiv.org/abs/2607.27372
কোড রিপোজিটরি: https://github.com/alexiglad/XM
সমস্যার মূল কারণ: মডেল শুধুমাত্র 'গড় নেয়'
এই পেপারটি কী সমাধান করছে তা বুঝতে হলে প্রথমে বুঝতে হবে যে জেনারেশন কেন এত কঠিন।
সাধারণ সুপারভাইজড লার্নিং (যেমন শ্রেণীবিভাগ) এর প্রতিটি ইনপুটের জন্য প্রায়শই একটিমাত্র সঠিক উত্তর থাকে, এবং মডেলটি একটি নির্দিষ্ট ম্যাপিং শিখলেই যথেষ্ট।
কিন্তু জেনারেট করা ভিন্ন। আপনি মডেলকে "একটি কুকুর জেনারেট করুন" বলেছেন, সঠিক উত্তর হতে পারে অসীম সংখ্যক। এই বৈধ আউটপুটগুলি হল ডেটা ডিস্ট্রিবিউশনের প্রতিটি mode (অর্থাৎ, ডিস্ট্রিবিউশনের প্রতিটি স্বতন্ত্র শীর্ষ)। জেনারেট করা কঠিন, কারণ এই সব mode-গুলি একসাথে ধরে রাখতে হয়।
সমস্যা হলো, প্রধান জেনারেটিভ মডেলগুলি পুনর্গঠন ক্ষতি (যেমন বর্গ ত্রুটি) ব্যবহার করে প্রশিক্ষিত হয়। যখন একটি ইনপুটকে অনেকগুলি বৈধ লক্ষ্যের সাথে র্যান্ডমভাবে জোড়া দেওয়া হয়, তখন পুনর্গঠন ক্ষতির জন্য সর্বোত্তম সমাধান হয় এই লক্ষ্যগুলির গড়। এবং বেশিরভাগ ডেটার জন্য, গড়টি ডেটা ম্যানিফোল্ডের উপর নয়, বরং কয়েকটি mode-এর মধ্যে পড়ে, যা কোনোটিই মিলে যায় না।
পেপারের সেই চিত্রটি খুব স্পষ্ট: কোনো কৌশল ছাড়াই মডেলকে সরাসরি এন্ড-টু-এন্ড রিগ্রেশন করতে দিলে, তিনটি পয়েন্টের স্ক্যাটার প্লট এটি মধ্যবর্তী একটি পয়েন্টে পূর্বাভাস করবে, একটি কুকুরের ছবি একটি ধুঁধু করে যাবে, এবং একটি বাক্য শুধুমাত্র 'the' শব্দটিকে বারবার পুনরাবৃত্তি করে অবনতি ঘটাবে। এটিই 'মোড ব্লারিং' (mode blurring), অর্থাৎ সর্বোত্তম সমাধানটি হলো বাস্তব ডেটার সবচেয়ে কমই মিলে যাওয়া উত্তর।

বর্তমান মডেলগুলি কীভাবে এটি এড়িয়ে যায়? উত্তরটি হলো, "জেনারেট" করার প্রক্রিয়াটিকে ছোট ছোট অংশে ভাগ করা। স্বয়ংসম্পূর্ণভাবে একবারে শুধুমাত্র একটি উপাদান পূর্বানুমান করা হয়, ডিফিউশনে একবারে শুধুমাত্র কিছুটা নয়াস সরিয়ে ফেলা হয়, প্রতিটি ছোট পদক্ষেপের লক্ষ্যকে প্রায় একক mode-এর সমান করে দেওয়া হয়, ফলে পুনর্গঠনের ক্ষতি আর গড় নেয়া হয় না।
এই «বিভাজন প্রক্রিয়া» হল যে প্রক্রিয়া যার কারণে ডিফিউশন এবং স্ব-পুনরাবৃত্তি উচ্চ মানের নমুনা তৈরি করতে পারে, কিন্তু এটিই হল যে কারণে মডেলটি এন্ড-টু-এন্ড হতে পারে না।
লেখক এই প্রশ্নটি তুলে ধরেন: একটি জেনারেটিভ মডেলের কাছে শুধু দুটি জিনিসই বিশ্লেষণযোগ্য—এটি কীভাবে তৈরি হয় এবং কীভাবে প্রশিক্ষিত হয়।
যদি এই পথটি বিভক্ত করে এন্ড-টু-এন্ডকে ধ্বংস করে, তাহলে কেন প্রশিক্ষণটি বিভক্ত করা যায় না?

একটি for লুপ: এক্সপ্লোরেটরি মডেলিংয়ের সম্পূর্ণ কোর
এক্সপ্লোরেটিভ মডেলিং হল প্রশিক্ষণ চক্রটিকেই বিশ্লেষণ করা।
এটির কার্যপ্রণালী একটি বাক্যে ব্যাখ্যা করা যায়: প্রতিটি প্রশিক্ষণ পদক্ষেপে, মডেল শুধুমাত্র একটি নমুনা উত্পাদন করে লক্ষ্যের সাথে জোর করে মেলানোর পরিবর্তে Kটি প্রস্তাবিত নমুনা উত্পাদন করে, এবং তারপর বাস্তব ডেটার সবচেয়ে কাছাকাছি একটিকে বেছে নিয়ে প্রশিক্ষণ এবং গ্রেডিয়েন্ট ফিরিয়ে দেয়। পেপারটিতে এটিকে 3 থেকে 5 লাইনের একটি for-লুপ হিসাবে বাস্তবায়ন করা হয়েছে, যা এতটাই সহজ যে এটি সন্দেহজনকও মনে হয় (অ্যালগরিদম 1)।

এটি কেন mode-এর অস্পষ্টতা সমাধান করে?
জীবনের একটি অন্য পরিস্থিতি কল্পনা করুন: ডার্টের পড়ার স্থান অনুমান করুন। যদি আপনাকে শুধু একবার অনুমান করতে দেওয়া হয়, তাহলে আপনার সেরা কৌশল হবে সমস্ত ডার্টের গড় অবস্থানটি অনুমান করা, কিন্তু সেটি প্রায়শই লক্ষ্যবস্তুতে কয়েকটি ডার্টই পড়েনি এমন একটি জায়গা। কিন্তু যদি আপনাকে K বার অনুমান করতে দেওয়া হয় এবং শুধুমাত্র সবচেয়ে কাছাকাছি অনুমানটিকেই স্কোর হিসেবে গণ্য করা হয়, তাহলে সেরা কৌশলটি তৎক্ষণাৎ পরিবর্তিত হয়ে যায়: আপনি এই Kটি অনুমানকে বিভিন্নভাবে ছড়িয়ে দেবেন, যাতে প্রতিটি অনুমান ভিন্ন ভিন্ন পড়ার ক্লাস্টারগুলিকে কভার করতে পারে।

মডেলটিও একইভাবে কাজ করে। যখন এটিকে Kটি প্রত্যাশিত মান অন্বেষণের অনুমতি দেওয়া হয়, তখন বিভিন্ন ইনপুট শব্দ প্রতিটি আলাদা মোডকে 'দাবি' করে, এবং সবগুলো কেন্দ্রের দিকে গড় নেওয়ার জন্য জমা হয় না। কতবার অন্বেষণ করা হয়, মডেলটি ততগুলো মোডকে স্থিরভাবে ধরে রাখতে পারে।

লেখক এই দীর্ঘকাল অবহেলিত ক্ষমতার নাম দিয়েছেন: জেনারেটিভ এক্সপ্রেসিভিটি, এবং বলেছেন যে এটি প্রশিক্ষণ লক্ষ্য দ্বারা নির্ধারিত, আপনি যতই প্যারামিটার এবং ডেটা জমা দিন, এটি নিজে থেকে বাড়বে না।

এটি একটি পরিচিত অদ্ভুত ঘটনাকেও ব্যাখ্যা করে: আজকের সেরা মডেলগুলি কেন এতটাই 'গাইডেন্স' প্রযুক্তির উপর নির্ভরশীল।
অ্যাক্লাসিফায়ার-ফ্রি গাইডেন্স বলতে মূলত পূর্বাভাসকে সেই অস্পষ্ট গড় থেকে দূরে ঠেলে দেওয়া। কিন্তু যদি মডেলটিই নিজে অস্পষ্ট না হয়, তবে এটিকে ঠেলাঠেলি করার কী দরকার? গাইডেন্স কার্যকর হওয়ার কারণটি হলো, mode-এর অস্পষ্টতাই এই সমস্যার মূল কারণ।
পেপারটি দুটি অনুসন্ধান দিক প্রস্তাব করে: ফরওয়ার্ড এবং রিভার্স। প্রথমটি একটি বাস্তব লক্ষ্যকে স্থির রাখে এবং নিজের জেনারেটেড আউটপুটের মধ্যে সবচেয়ে কাছাকাছি একটি খুঁজে বের করে, যা «সমস্ত মোড কভার করা»-এর দিকে ঝুঁকে; দ্বিতীয়টি একটি জেনারেটেড আউটপুটকে স্থির রাখে এবং বাস্তব ডেটার মধ্যে সবচেয়ে কাছাকাছি একটি খুঁজে বের করে, যা «সঠিকতা»-এর দিকে ঝুঁকে, এবং প্রায় কোনও কম্পিউটেশনাল ওভারহেড যোগ করে না, তবে এর মূল্য হলো কয়েকটি মোডেই সংকুচিত হয়ে যাওয়া। উভয়ই পরস্পরকে পূরক, এবং এগুলি একসাথে ব্যবহার করা যেতে পারে।


তৃতীয় অক্ষ: যত বেশি জুম করবেন, তত বেশি আয়
এই পেপারের সবচেয়ে গুরুত্বপূর্ণ উপসংহার হলো, যে এটি «অন্বেষণ»কে একটি প্রকৃত স্কেলিং অক্ষ হিসেবে প্রমাণ করেছে।
লেখক ডিফিউশন/ফ্লো মডেল, জাম্পি মডেল এবং মাস্কড ডিফিউশন ল্যাঙ্গুয়েজ মডেলে অন্বেষণ যোগ করেছেন, যেখানে চিত্র, ভিডিও এবং ভাষা—এই তিনটি মোডালিটিতে একইভাবে পারফরম্যান্সের একমুখী উন্নতি দেখা গেছে। আরও গুরুত্বপূর্ণ বিষয় হলো, স্কেলের সাথে লাভের প্রবণতা: যত বড় করা হয়, তত বেশি লাভ।
পেপারে উল্লিখিত সংখ্যাগুলি হল: ডেটা সাইজ বৃদ্ধির সাথে অন্বেষণের লাভ 7% থেকে বেড়ে 36% হয়; মডেল বড় হওয়ার সাথে সাথে 13% থেকে 23% পর্যন্ত বৃদ্ধি পায়; যখন কম্পিউটিং পাওয়ার তিনগুণ হয়, তখন দক্ষতার লাভ দ্বিগুণেরও বেশি হয়ে যায়।
দক্ষতার ক্ষেত্রে, এটি FLOP দক্ষতা 4.1 গুণ, নমুনা দক্ষতা 6.2 গুণ এবং প্যারামিটার দক্ষতা 47% বৃদ্ধি করেছে। চিত্র তৈরিতে, এটি বর্তমানের সর্বোত্তম RAE পদ্ধতিকে ImageNet-এ অনুপ্রেরণাহীন 1.43 FID-এ আরও এগিয়ে নিয়ে গেছে, যা শিল্পের সেরা স্তরের কাছাকাছি।

একটি 5টি মোড অন্বেষণ করে এমন একটি বড় মডেল, যা 47% বেশি প্যারামিটার সহ কিন্তু অন্বেষণ না করা XLarge মডেলকেও পরাজিত করতে পারে।

এই প্রবণতার অর্থ ছোট নয়। লেখকের ব্যাখ্যা হল: ছোট স্কেলে, মডেলটি মূলত প্যারামিটার এবং ডেটা দ্বারা বাধাগ্রস্ত হয়, এবং জেনারেটিভ এক্সপ্রেসিভিটি এখনও বাধা নয়; কিন্তু যখন প্যারামিটার এবং ডেটা এমন স্তরে বাড়িয়ে তোলা হয় যে তারা আর বাধা নয়, তখন জেনারেটিভ এক্সপ্রেসিভিটি ধীরে ধীরে প্রকৃত বাধায় পরিণত হয়। এবং এটিই হল সেই বিষয়, যা সরাসরি বাড়ানোর অনুসন্ধান।
বর্তমানে প্রকৃত বেস মডেল ট্রেনিংয়ের জন্য ব্যবহৃত কম্পিউটিং পাওয়ার এই পেপারের সর্বাধিক পরীক্ষার চেয়ে প্রায় চারটি ক্ষমতার মাত্রা বেশি, তাই লেখক মনে করেন যে পেপারে উল্লিখিত এই সংখ্যাগুলি সম্ভবত বড় স্কেলে লাভের নিম্নসীমা।
সত্যিকারের এন্ড-টু-এন্ড জেনারেশন
যদি অনুসন্ধানকে সর্বোচ্চ পর্যায়ে নিয়ে যাওয়া হয়, তাহলে কী ঘটবে? উত্তরটি প্রারম্ভিক রহস্যের দিকে ফিরে আসে: জেনারেটিভ মডেলগুলি এখন শেষ থেকে শেষ পর্যন্ত সক্ষম।
লেখক একটি স্বাধীন এন্ড-টু-এন্ড মডেল হিসাবে XM ব্যবহার করেছেন রোবট নিয়ন্ত্রণ কাজের জন্য। বিহেভিয়ার ক্লোনিং-এ, তাদের এক্সপ্লোরেটিভ পলিসি শুধুমাত্র একবার নেটওয়ার্ক ফরওয়ার্ড ব্যবহার করে ১০০ বার ফরওয়ার্ড প্রয়োজন করা ডিফিউশন পলিসিকে সমান বা অতিক্রম করেছে; লক্ষ্য-ভিত্তিক বিশ্ব মডেলিং-এ, এক্সপ্লোরেটিভ ওয়ার্ল্ড মডেল ডিফিউসারের চেয়ে ১৬ থেকে ২৫৬ গুণ কম ইনফারেন্স কম্পিউটিং শক্তি ব্যবহার করে ভালো গড় পারফরম্যান্স অর্জন করেছে।


এই পার্থক্যের উৎস স্পষ্ট: ডিফিউশন মডেলগুলি প্রকাশের জন্য ইনফারেন্সের সময় শত শত ধাপ ব্যবহার করে, যেখানে এন্ড-টু-এন্ড XM এই খরচটিকে ট্রেনিংয়ের সময় অনুসন্ধানের উপর স্থানান্তরিত করে, যার ফলে ইনফারেন্সের জন্য শুধুমাত্র একবার ফরওয়ার্ড পাসের প্রয়োজন হয়। "একাধিক মোড প্রক্রিয়াকরণ" এই একই কাজটি বা তো ইনফারেন্সের সময় ধীরে ধীরে ভাঙা হয়, অথবা ট্রেনিংয়ের সময় একবারেই সম্পূর্ণভাবে অনুসন্ধান করা হয়; এই পেপারটি দ্বিতীয়টির পক্ষে বেছে নিয়েছে।
লেখকের পরিচয়
প্রথম লেখক আলেক্সি গ্ল্যাডস্টোন কোনো অপরিচিত চেহারা নন। ২০২৫ সালের জুলাইয়ে, তিনি পরিচালিত Energy-Based Transformers (EBT) সামাজিক মাধ্যমে ব্যাপক আলোচনার সৃষ্টি করেছিল।

এই কাজটি প্রথমবারের মতো একাধিক মাত্রায় স্ট্যান্ডার্ড ফিডফরওয়ার্ড Transformer-এর স্কেলিং কার্ভকে "পার" করেছে এবং "সিস্টেম 2 চিন্তা"কে যেকোনো মোডে প্রসারিত করার চেষ্টা করেছে। মেশিন জিন্সের রিপোর্টটি দেখুন: "নতুন প্যারাডাইম এসেছে! নতুন এনার্জি মডেল Transformer++ স্কেলিং সীমানা ভাঙল, ট্রেনিং স্কেলিং রেট 35% দ্রুত।"

এক্সপ্লোরেটিভ মডেলিং তার সর্বদা অনুসরণ করা চিন্তাধারার সাথে সামঞ্জস্যপূর্ণ: এটি সবসময় প্রশ্ন করে যে, "মডেলটি কি কোনো অনুসন্ধান বা অনুসন্ধানের মাধ্যমে একবারের ফরওয়ার্ড পাসে অসম্ভব কিছু করতে পারে?" এই পেপারটি আরও বেশি ভিত্তি করে তাঁর সহযোগীদের (ইলুন ডু এবং হেং জি) অন্য একটি তত্ত্ব—মোড ফোর্সিং-এর উপর। পেপারটিতে স্বীকার করা হয়েছে যে, সেই তত্ত্বটির অস্তিত্বের কারণে, XM-এর বেশিরভাগ ফলাফলকে প্রথমে তত্ত্বগতভাবে ভবিষ্যদ্বাণী করা হয়েছিল, এবং তারপরই পরীক্ষামূলকভাবে যাচাই করা হয়েছিল, যা "পরীক্ষা শেষে ব্যাখ্যা" করার প্রচলিত পদ্ধতির গভীর শিক্ষা-সম্প্রদায়ে খুবই দুর্লভ।

লেখক স্বীকার করেছেন যে সীমাবদ্ধতা রয়েছে: best-of-K ধারণাটি নতুন নয়, এটি আগেও অনেকবার করা হয়েছে; তাদের প্রকৃত অবদান হল এই সহজ চক্রটি কী করছে তা পরিষ্কারভাবে বুঝতে পারা: এটি উত্পাদন প্রক্রিয়াকে বিভক্ত না করে সরাসরি উত্পাদনের প্রকাশক্ষমতা বাড়িয়েছে।
এছাড়াও, বর্তমানে স্ব-পুনরাবৃত্তিমূলক ভাষা মডেলগুলি এখনও সবচেয়ে কঠিন সমস্যা, এবং শুধুমাত্র এন্ড-টু-এন্ড ফরওয়ার্ড XM অত্যন্ত বহু-মোড বিন্যাসে (যেমন চিত্র উত্পাদন) এখনও খুব ব্যয়বহুল, যা পরবর্তী কাজের জন্য রেখে দেওয়া হয়েছে।
দশকের পর দশক ধরে, আমরা জেনারেটিভ মডেলকে সামঞ্জস্য করতে দুটি ক্রমানুসারে ব্যবহার করেছি: এটিকে আরও বড় করা এবং এটিকে আরও বেশি ডেটা দেওয়া।
এই পেপারে প্রস্তাবিত তৃতীয় নকশা খুবই সাধারণ: মডেলকে কয়েকবার অনুমান করতে দিন এবং শুধুমাত্র সেরাটি রাখুন। কিন্তু যদি এটি যে প্রবণতা প্রকাশ করে তা সত্যি হয়, তাহলে যখন স্কেল বাড়তে থাকবে, তখন প্রথম দুটি নকশা অবশ্যই শেষ পর্যন্ত ঘুরে যাবে, আর তৃতীয়টি তখনও শুধুমাত্র শুরু হয়েছে।
রেফারেন্স লিঙ্ক
https://x.com/AlexiGlad/status/2083230922196107288
এই পোস্টটি ওয়েইচ্যাট গ্রুপ "মেশিন সিন্টিস" (ID: almosthuman2014) থেকে এসেছে, লেখক: Panda
