একটি এআইকে কাজ করে কোড লেখার শিক্ষা দেওয়া এক বিষয়। কিন্তু এটিকে দ্রুত কাজ করে কোড লেখার শিক্ষা দেওয়া, প্রত্যক্ষভাবে, সম্পূর্ণ ভিন্ন একটি বিষয়।
জুলাই ২৯ তারিখে প্রকাশিত মেটা এআই-এর এফএআইআর দলের একটি নতুন পেপারে দেখানো হয়েছে যে, কোডের সঠিকতা থেকে কোডের গতি অপ্টিমাইজেশনে শক্তিশালী শিক্ষার প্রসার ঘটিয়েছে এমন সমস্যাগুলি যা স্ট্যান্ডার্ড পদ্ধতিগুলি সহজেই প্রতিহত করতে পারে না। দোষীদের: শব্দযুক্ত সময় পরিমাপ, বিরল পুরস্কার, এবং যেসব অ্যালগরিদম আপনি যখন শুধুমাত্র সঠিকতা নয়, বরং পারফরম্যান্সের দিকেও মনোযোগ দেওয়ার জন্য জিজ্ঞাসা করেন, তখন তারা ভেঙে পড়ে।
গতির সমস্যা
যখন আপনি পরীক্ষা করেন যে কোডটি সঠিক উত্তর দিচ্ছে কিনা, তখন আপনি একটি পরিষ্কার বাইনারি সংকেত পান। কিন্তু কোডটি কত দ্রুত চলছে তা পরিমাপ করা জটিল। একই মেশিনে একই কোড দুইবার চালানোর ফলে আপনি সামান্য ভিন্ন এক্সিকিউশন সময় পাবেন। ব্যাকগ্রাউন্ড প্রসেস, সিপিইউ স্কেডিউলিং, মেমোরি আবণ্টন—সবকিছুই টাইমিং পরিমাপে শব্দ যোগ করে।
মেটা টিম পায় যে, রিইনফোর্সমেন্ট লার্নিং টুলকিটের একটি স্ট্যান্ডার্ড অ্যালগরিদম জেনারালাইজড রিইনফোর্সমেন্ট পলিসি অপ্টিমাইজেশন, বা GRPO, এই ধরনের নয়েজি স্পিড মেজারমেন্ট দিয়ে ফিড করলে অস্থির হয়ে পড়ে।
পুরস্কারের দুর্বলতা সমস্যাটিকে জটিল করে তোলে। বেশিরভাগ কোড অপ্টিমাইজেশন কেবল অল্প গতি বৃদ্ধি দেয়, যার অর্থ মডেলটি প্রায়ই একটি শক্তিশালী ইতিবাচক সংকেত পায় না যা বলে “হ্যাঁ, এই পরিবর্তনটি জিনিসগুলিকে দ্রুততর করেছে।”
DMC-Optim: একটি নতুন সমস্যার জন্য একটি নতুন বেঞ্চমার্ক
এই চ্যালেঞ্জগুলি মোকাবেলা করার জন্য, গবেষকদের একটি ক্যালিব্রেটেড স্যান্ডবক্স পরিবেশ এবং একটি বিশেষায়িত প্রশিক্ষণ পাইপলাইন সহ DMC-Optim বেঞ্চমার্ক তৈরি করেছেন। সিস্টেমটি একটি অফলাইন সিমুলেটরের মধ্যে সঠিকতা এবং বাস্তবায়ন গতির জন্য পুরস্কারগুলিকে একত্রিত করে, যা মূলত একটি নিয়ন্ত্রিত পরিবেশ তৈরি করে যেখানে সময়সীমা নয়াসকে উপেক্ষা করা নয়, বরং পরিচালনা করা যায়।
ফলাফলগুলির বিরুদ্ধে যুক্তি করা কঠিন। Qwen 2.5 7B-এর পাস হার 18.0% থেকে বেড়ে 31.3% হয়েছে, যা প্রায় 74% আপেক্ষিক উন্নতি। CWM 32B-এর পাস হার 30.7% থেকে বেড়ে 50.4% হয়েছে, যা 64% আপেক্ষিক বৃদ্ধি। LCB বেঞ্চমার্কে, এই পদ্ধতিতে প্রশিক্ষিত CWM 32B, যাচাইযোগ্য পুরস্কার দিয়ে স্ট্যান্ডার্ড রিইনফোর্সমেন্ট লার্নিং দিয়ে প্রশিক্ষিত মডেলগুলির মধ্যম গতির তুলনায় 83% সময় বেশি দক্ষতা দেখিয়েছে।
অপ্রতুল সময় অবস্থার অধীনে, যেখানে পরিমাপের শব্দ ইচ্ছাকৃতভাবে বৃদ্ধি করা হয়, DMC-Optim বেঞ্চমার্কটি স্ট্যান্ডার্ড পদ্ধতির তুলনায় 100% থেকে 200% পর্যন্ত পারফরম্যান্স উন্নতি দেখিয়েছে।
পেপারটি লিখেছেন পিয়ের শামবন, কুনহাও জেং, জুলিয়েত ডেকুগিস, বেনোয়িত স্যাগোট এবং গ্যাব্রিয়েল সিন্নাভ, যারা সবাই মেটা এআই-এর।
