মেটা এআই এবং ইলিনয় বিশ্ববিদ্যালয় আর্বানা-শ্যামপেইনের গবেষকরা একটি নতুন পেপার প্রকাশ করেছেন, যাতে EvoHarness-RL নামক একটি ট্রেনেবল কোঅর্ডিনেশন লেয়ার পরিচয় করিয়ে দেওয়া হয়েছে, যা বড় ভাষা মডেল এজেন্টগুলিকে তাদের নিজস্ব বাহ্যিক অবস্থা তৈরি, অ্যাক্সেস এবং পরিচালনা করতে দেয়। ফলাফল: বেসলাইন মডেলটি এটি ছাড়া চালানোর সময় 47.9% থেকে 96.9% সফলতার হার।
EvoHarness-RL বাস্তবে কী করে
LLM এজেন্টগুলির সীমিত প্রেক্ষাপট জানালা থাকে। যখন একটি কাজ অনেকগুলি ধাপে বিস্তৃত হয়, যা ডাইনামিক API কানেকশন, সার্ভার লগ, অপেক্ষমান উপ-লক্ষ্য এবং ত্রুটি পুনরুদ্ধার অন্তর্ভুক্ত করে, তখন মডেলের অভ্যন্তরীণ মেমোরি যথেষ্ট নয়। এটির বিশ্ব সম্পর্কে এটি কী বিশ্বাস করে, এটি কতটা অগ্রগতি করেছে এবং অতীতের ভুলগুলির মধ্যে এটি কী শিখেছে, তা ট্র্যাক করার জন্য একটি বাহ্যিক স্ক্যাফোল্ডের প্রয়োজন।
ফ্রেমওয়ার্কটি তিনটি উপাদানের চারপাশে একটি সংগঠিত বাহ্যিক অবস্থা প্রবর্তন করে: বিলিফ, প্রোগ্রেস এবং এক্সপেরিয়েন্স, যাদের একসাথে BPE বলা হয়। বিলিফ এজেন্টের পরিবেশের বর্তমান বোঝাপড়াকে ধারণ করে। প্রোগ্রেস সম্পন্ন এবং অপেক্ষমান সাবগোলগুলি ট্র্যাক করে যাতে এজেন্ট ধাপগুলি লাফিয়ে যায় না বা কাজ পুনরাবৃত্তি করে। এক্সপেরিয়েন্স ত্রুটির পাঠ সংরক্ষণ করে, যেমন API রেট লিমিটের কারণে API একটি ব্যাচকে অস্বীকার করে, যাতে এজেন্ট তার পদ্ধতি খাপ খাইয়ে নিতে পারে।
প্রশিক্ষণ দুটি পর্যায়ে ঘটে। প্রথমে, বিশেষজ্ঞদের প্রদর্শন ব্যবহার করে সুপারভাইজড ফাইন-টিউনিং মডেলকে হারনেসের সাথে কীভাবে মিথস্ক্রিয়া করতে হয় তা শেখায়। তারপর, গ্রুপ রিলেটিভ পলিসি অপ্টিমাইজেশন, বা GRPO নামক একটি খরচ-সচেতন অপ্টিমাইজেশন প্রযুক্তি হারনেস কলের গণনাগত খরচের বিপরীতে কাজের কর্মক্ষমতা ভারসাম্যপূর্ণভাবে বজায় রাখতে এজেন্টের আচরণকে পরিশোধিত করে।
গবেষকদের এই পদ্ধতি পরীক্ষা করা হয়েছে ALFWorld-এ Qwen3-8B মডেল ব্যবহার করে, যা এমবডিড এআই-এর জন্য একটি বেঞ্চমার্ক যেখানে এজেন্টগুলিকে একাধিক ধাপে পারিবারিক কাজ সম্পন্ন করতে হয়। পরিচিত পরিবেশে 96.9% সফলতার হার নিজেই অসাধারণ, কিন্তু সম্ভবত আরও বেশি গুরুত্বপূর্ণ হলো অপরিচিত পরিবেশে 86.6% সফলতার হার।
দুটি আচরণ যা গবেষকদের প্রত্যক্ষভাবে প্রোগ্রাম করা হয়নি
কাগজটি প্রশিক্ষণের সময় উঠে আসা দুটি উত্থিত ঘটনাকে উল্লেখ করে, যেগুলির কোনোটিই সরাসরি প্রকল্পিত হয়নি।
প্রথমটি হল “হারনেস অ্যানিলিং।” সময়ের সাথে সাথে, এজেন্ট ধীরে ধীরে রুটিন হারনেস অপারেশনগুলি অভ্যন্তরীণকরণ শুরু করে, যার ফলে এটি বাহ্যিক অবস্থা পরামর্শ করার কম প্রয়োজনীয়তা দেখায়। হারনেস কলগুলি কমে যায় কারণ সিস্টেমটি ক্ষয়প্রাপ্ত হচ্ছে না, বরং মডেলটি প্যাটার্নগুলি শোষণ করেছে।
দ্বিতীয়টি হল “প্রগতির ব্যবহার।” এজেন্ট যখন প্রশিক্ষণ নেয়, তখন এটি তার বাহ্যিক অবস্থাকে সংকুচিত করে এবং নির্দিষ্ট কাজের ধরনের জন্য উপযুক্ত একটি আরও সংক্ষিপ্ত ফরম্যাটে পুনর্গঠন করে। BPE প্রতিনিধিত্বটি মানুষের হস্তক্ষেপ ছাড়াই আরও সংক্ষিপ্ত এবং বিশেষায়িত হয়ে ওঠে।
পূর্বের কাজের উপর ভিত্তি করে
EvoHarness-RL হল Meta-Harness-এর উপর ভিত্তি করে তৈরি, যা মার্চ 2026-এর একটি আগের প্রকল্প ছিল যা এজেন্টিক অনুসন্ধান পদ্ধতির মাধ্যমে হারনেস কোডকে অপ্টিমাইজ করার উপর ফোকাস করেছিল। যেখানে Meta-Harness হারনেসকে অনুসন্ধানের মাধ্যমে উন্নত করার জন্য কোড হিসাবে বিবেচনা করেছিল, সেখানে EvoHarness-RL সম্পূর্ণ সমন্বয় স্তরকে এমন কিছু হিসাবে বিবেচনা করে যা মডেলটি নিজেই গঠন এবং পরিমার্জন করতে শিখতে পারে।
পেপারটিতে বিদ্যমান এজেন্ট ফ্রেমওয়ার্কগুলির মতো SkillOS এবং SkillRL-এর তুলনায় অপরিচিত কাজগুলিতে উন্নতির কথাও উল্লেখ করা হয়েছে। EvoHarness-RL-এর জন্য পরিচিত এবং নতুন পরিবেশের মধ্যে কর্মক্ষমতার পার্থক্য প্রায় 10 শতাংশ, যা প্রতিদ্বন্দ্বী পদ্ধতিগুলির তুলনায় অনেক বেশি পড়ে।
এন্টারপ্রাইজ এআই বাস্তবায়নের জন্য এটির অর্থ কী
নিয়ন্ত্রিত পরিস্থিতিতে ৪৮% থেকে ৯৭% পর্যন্ত সফলতার হার বৃদ্ধি পাওয়া একটি ক্ষুদ্র উন্নতি নয়। ৮৬.৬% সাধারণীকরণ হারও গুরুত্বপূর্ণ, কারণ বাস্তব জগতের প্রতিষ্ঠানগত কাজগুলি প্রায় কখনই প্রশিক্ষণ ডেটার মতো হয় না।
GRPO প্রশিক্ষণ পর্যায়ে নির্মিত খরচ-সচেতন অপ্টিমাইজেশনটি একটি ব্যবহারিক চিন্তাকেও সমাধান করে। বাহ্যিক হ্যারনেস কলগুলি বিনামূল্যে নয়। এগুলি কম্পিউট ব্যবহার করে এবং ল্যাটেন্সি যোগ করে। হ্যারনেস অ্যানিলিংয়ের মাধ্যমে এজেন্টকে অপ্রয়োজনীয় কলগুলি কমানোর জন্য প্রশিক্ষিত করে, ফ্রেমওয়ার্কটি সময়ের সাথে সাথে সঠিকতা বজায় রেখে আরও দক্ষ হয়ে ওঠে।
