source avatarMinty

শেয়ার

হারনেসগুলি কি আরও শক্তিশালী এআই সিস্টেমগুলি আনলক করতে পারে? গবেষকরা একটি নতুন হারনেস তৈরি করেছেন যা বিদ্যমান মডেলগুলিকে দীর্ঘতর এবং জটিলতর ওয়ার্কফ্লো পরিচালনা করতে দেয়। রিকার্সিভ ল্যাঙ্গুয়েজ মডেল (RLM) বড় ফাইল এবং ডেটাসেটগুলিকে মূল মডেলের কনটেক্সটের বাইরে রাখে। মডেলটি কোড ব্যবহার করে প্রাসঙ্গিক অংশগুলি নির্বাচন করে, প্রতিটিকে একটি আলাদা মডেল অনুরোধের মধ্যে পাঠায় এবং ফলাফলগুলি একত্রিত করে। এটি সাধারণ সেশনগুলির থেকে ভিন্ন, যেখানে ফাইল, টুলের আউটপুট এবং ফলাফলগুলি একটি কনটেক্সটে জমা হয়। যতক্ষণ কনটেক্সটটি বাড়তে থাকে, মডেলগুলি গুরুত্বপূর্ণ বিস্তারিতগুলির সাথে পথ হারাতে শুরু করতে পারে। এই কাঠামোটিরও শিক্ষা উন্নতির পরীক্ষা করতে, গবেষকরা RL-এর সহায়তায় Qwen3-30B-কে একটি নির্দিষ্ট RLM হারনেসের ভিতরে, শুধুমাত্র ছোট কাজগুলির মধ্যে প্রশিক্ষণ দিয়েছিলেন, এবং 8–32x-এরও বেশি দীর্ঘতর কাজগুলিতে এটির মূল্যায়ন করেছিলেন। দীর্ঘতর মূল্যায়নগুলিতে, RLM-প্রশিক্ষিত মডেলটি উল্লেখযোগ্যভাবে উন্নতি দেখিয়েছিল, while the same model trained without the harness generally showed little progress. In separate experiments, it also applied the same strategies in new domains that required similar underlying steps.

No.0 picture
দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।