মেটা এআই কোড স্পিড অপ্টিমাইজেশনের জন্য রিইনফোর্সমেন্ট লার্নিংয়ে চ্যালেঞ্জগুলি শনাক্ত করে

iconCryptoBriefing
শেয়ার
AI summary iconসারাংশ
মেটা এআই-এর এফএআইআর দলের এআই এবং ক্রিপ্টো সংবাদ অনুযায়ী, কোড স্পিড অপ্টিমাইজেশনে রিইনফোর্সমেন্ট লার্নিং বাধার সম্মুখীন হচ্ছে নয়াজি টাইমিং, স্পার্স পুরস্কার এবং অস্থিরতার কারণে। দলটি DMC-Optim নামক একটি বেঞ্চমার্ক চালু করেছে, যা সঠিকতা এবং গতি একত্রিত করে, Qwen 2.5 7B এবং CWM 32B মডেলগুলির পাস রেট বাড়িয়েছে। এআই-এর উন্নতি ট্র্যাক করছেন এমন ট্রেডারদের জন্য নতুন টোকেন লিস্টিং এখনও একটি প্রধান ফোকাস।

একটি এআইকে কাজ করে কোড লেখার শিক্ষা দেওয়া এক বিষয়। কিন্তু এটিকে দ্রুত কাজ করে কোড লেখার শিক্ষা দেওয়া, প্রত্যক্ষভাবে, সম্পূর্ণ ভিন্ন একটি বিষয়।

জুলাই ২৯ তারিখে প্রকাশিত মেটা এআই-এর এফএআইআর দলের একটি নতুন পেপারে দেখানো হয়েছে যে, কোডের সঠিকতা থেকে কোডের গতি অপ্টিমাইজেশনে শক্তিশালী শিক্ষার প্রসার ঘটিয়েছে এমন সমস্যাগুলি যা স্ট্যান্ডার্ড পদ্ধতিগুলি সহজেই প্রতিহত করতে পারে না। দোষীদের: শব্দযুক্ত সময় পরিমাপ, বিরল পুরস্কার, এবং যেসব অ্যালগরিদম আপনি যখন শুধুমাত্র সঠিকতা নয়, বরং পারফরম্যান্সের দিকেও মনোযোগ দেওয়ার জন্য জিজ্ঞাসা করেন, তখন তারা ভেঙে পড়ে।

গতির সমস্যা

যখন আপনি পরীক্ষা করেন যে কোডটি সঠিক উত্তর দিচ্ছে কিনা, তখন আপনি একটি পরিষ্কার বাইনারি সংকেত পান। কিন্তু কোডটি কত দ্রুত চলছে তা পরিমাপ করা জটিল। একই মেশিনে একই কোড দুইবার চালানোর ফলে আপনি সামান্য ভিন্ন এক্সিকিউশন সময় পাবেন। ব্যাকগ্রাউন্ড প্রসেস, সিপিইউ স্কেডিউলিং, মেমোরি আবণ্টন—সবকিছুই টাইমিং পরিমাপে শব্দ যোগ করে।

বিজ্ঞাপন

মেটা টিম পায় যে, রিইনফোর্সমেন্ট লার্নিং টুলকিটের একটি স্ট্যান্ডার্ড অ্যালগরিদম জেনারালাইজড রিইনফোর্সমেন্ট পলিসি অপ্টিমাইজেশন, বা GRPO, এই ধরনের নয়েজি স্পিড মেজারমেন্ট দিয়ে ফিড করলে অস্থির হয়ে পড়ে।

পুরস্কারের দুর্বলতা সমস্যাটিকে জটিল করে তোলে। বেশিরভাগ কোড অপ্টিমাইজেশন কেবল অল্প গতি বৃদ্ধি দেয়, যার অর্থ মডেলটি প্রায়ই একটি শক্তিশালী ইতিবাচক সংকেত পায় না যা বলে “হ্যাঁ, এই পরিবর্তনটি জিনিসগুলিকে দ্রুততর করেছে।”

DMC-Optim: একটি নতুন সমস্যার জন্য একটি নতুন বেঞ্চমার্ক

এই চ্যালেঞ্জগুলি মোকাবেলা করার জন্য, গবেষকদের একটি ক্যালিব্রেটেড স্যান্ডবক্স পরিবেশ এবং একটি বিশেষায়িত প্রশিক্ষণ পাইপলাইন সহ DMC-Optim বেঞ্চমার্ক তৈরি করেছেন। সিস্টেমটি একটি অফলাইন সিমুলেটরের মধ্যে সঠিকতা এবং বাস্তবায়ন গতির জন্য পুরস্কারগুলিকে একত্রিত করে, যা মূলত একটি নিয়ন্ত্রিত পরিবেশ তৈরি করে যেখানে সময়সীমা নয়াসকে উপেক্ষা করা নয়, বরং পরিচালনা করা যায়।

ফলাফলগুলির বিরুদ্ধে যুক্তি করা কঠিন। Qwen 2.5 7B-এর পাস হার 18.0% থেকে বেড়ে 31.3% হয়েছে, যা প্রায় 74% আপেক্ষিক উন্নতি। CWM 32B-এর পাস হার 30.7% থেকে বেড়ে 50.4% হয়েছে, যা 64% আপেক্ষিক বৃদ্ধি। LCB বেঞ্চমার্কে, এই পদ্ধতিতে প্রশিক্ষিত CWM 32B, যাচাইযোগ্য পুরস্কার দিয়ে স্ট্যান্ডার্ড রিইনফোর্সমেন্ট লার্নিং দিয়ে প্রশিক্ষিত মডেলগুলির মধ্যম গতির তুলনায় 83% সময় বেশি দক্ষতা দেখিয়েছে।

অপ্রতুল সময় অবস্থার অধীনে, যেখানে পরিমাপের শব্দ ইচ্ছাকৃতভাবে বৃদ্ধি করা হয়, DMC-Optim বেঞ্চমার্কটি স্ট্যান্ডার্ড পদ্ধতির তুলনায় 100% থেকে 200% পর্যন্ত পারফরম্যান্স উন্নতি দেখিয়েছে।

পেপারটি লিখেছেন পিয়ের শামবন, কুনহাও জেং, জুলিয়েত ডেকুগিস, বেনোয়িত স্যাগোট এবং গ্যাব্রিয়েল সিন্নাভ, যারা সবাই মেটা এআই-এর।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।