গুগল ডিপমাইন্ড একটি পেপার প্রকাশ করেছে যা ভাষা মডেলগুলির টেক্সট প্রসেসিং পদ্ধতিকে চুপচাপ পরিবর্তন করতে পারে। এই প্রযুক্তিটির নাম “রিসারকুলেশন”, যা ট্রান্সফরমারের গভীর স্তরগুলির এক্টিভেশনগুলিকে উপসংহারের সময় এর পৃষ্ঠস্তরগুলিতে ফিরিয়ে আনে। অস্টিন, টেক্সাস বিশ্ববিদ্যালয়ের গবেষকদের সহযোগিতায় লেখা এই পেপারটি দেখিয়েছে যে এই হালকা রিকারেন্ট সংযোগটি পুরোপুরি ফাইন-টিউনিংয়ের সমতুল্য, এবং কিছুক্ষেত্রে তা অতিক্রমও করে। কোনও পুনরায় ট্রেনিংয়ের প্রয়োজন নেই। কোনও বড় আর্কিটেকচারাল সার্জারিরও প্রয়োজন নেই।
পুনরায় প্রবাহিত করা কী করে
পুনরায় প্রবাহ ট্রান্সফরমার প্রক্রিয়াকরণের একদিকের প্রবাহকে ভাঙে। মডেলের গভীর স্তরগুলিতে গণনা করা সক্রিয়করণের একটি অংশ টোকেন উত্পাদনের সময় কম গভীর স্তরগুলিতে ফিরিয়ে দেওয়া হয়। মডেলটি মূলত নিজের অভ্যন্তরীণ প্রতিনিধিত্বগুলি বুঝতে দ্বিতীয়বারের মতো সুযোগ পায়, যা এটিকে একাধিক ধাপে কাগজটি যা “বিশ্বাসের অবস্থা” বলে উল্লেখ করেছে, তা উন্নত করতে দেয়।
চেইন-অফ-থought প্রম্পটিং বা লুপড ট্রান্সফরমার আর্কিটেকচারের মতো বিদ্যমান পদ্ধতিগুলির থেকে পুনঃপ্রবাহের মূল পার্থক্য হলো যে এটি অতিরিক্ত যুক্তি টোকেন বা অতিরিক্ত আর্কিটেকচারাল গভীরতা প্রয়োজন করে না। এটি মডেলটির নিজস্ব পুনঃডিজাইন নয়, বরং ইনফারেন্স চালানোর পদ্ধতিতে একটি যোগ করা পরিবর্তন।
সংখ্যাগুলি উপেক্ষা করা কঠিন
ডিপমাইন্ড দলটি গেমা3 মডেল পরিবারের মধ্যে, যার মধ্যে 1B, 4B এবং 12B প্যারামিটার ভেরিয়েন্ট অন্তর্ভুক্ত, পুনঃপ্রবাহ পরীক্ষা করেছে। বেসিক পুনঃপ্রবাহ নয়টি ভাষা মডেলিং ডেটাসেটে প্রায় 8.5% পারপ্লেক্সিটি হ্রাস করেছে, যেখানে জেনারেশনের সময় শূন্য অতিরিক্ত ল্যাটেন্সি রয়েছে।
অ্যাডাপ্টিভ রিসার্কুলেশনকে আরও এগিয়ে নিয়ে যাওয়া হয়েছে, যার ফলে একই নয়টি ডেটাসেটের মধ্যে পারপ্লেক্সিটির গড় ২৩% হ্রাস পেয়েছে। প্রসঙ্গ হিসেবে, পূর্ণাঙ্গ ফাইন-টিউনিং কেবলমাত্র ২১.৬% হ্রাস করতে সক্ষম হয়েছিল। যুক্তিগত কাজগুলিতে, GSM8K বেঞ্চমার্কে অ্যাডাপ্টিভ রিসার্কুলেশনের সাহায্যে সঠিকতার আপেক্ষিক ২১% বৃদ্ধি দেখা গেছে।
একটি বিনিময় রয়েছে। প্রিফিল প্রসেসিং, যে পর্যায়ে মডেল প্রাথমিক প্রম্পটকে গ্রহণ করে, পুনরাবৃত্তির অধীনে সিরিয়াল হয়ে যায়, যা একটি প্রম্পট প্রসেস করার প্রাথমিক খরচ বাড়িয়ে দেয়।
কেন এআই সম্প্রদায় মনোযোগ দিচ্ছে
arXiv:2608.17981 হিসাবে তালিকাভুক্ত এই পেপারটি ইতিমধ্যেই স্বাধীনভাবে পুনরুৎপাদন করা হয়েছে। GitHub-এর বাস্তবায়নগুলি Gemma পরিবারের বাইরের মডেলগুলিতে, যার মধ্যে Llama 3.2 1B অন্তর্ভুক্ত, লাভগুলি নিশ্চিত করেছে। X এবং চীনা টেক মিডিয়া প্ল্যাটফর্মগুলিতে গবেষণা সম্প্রদায়ের মধ্যে আলোচনা ছড়িয়ে পড়েছে।
রিসার্কুলেশন এক্টিভেশন লেভেলে কাজ করে, যা টোকেন-জেনারেশন সারফেসের নিচে অবস্থিত, যার ফলে এটি চেইন-অফ-থought রিজনিংয়ের মতো প্রম্পটিং প্রযুক্তির সাথে প্রতিদ্বন্দ্বী নয়, বরং পূরক, যেগুলো আউটপুট টোকেন খরচ করে এবং ল্যাটেন্সি যোগ করে।
