মেটা এবং ইলিনয় বিশ্ববিদ্যালয় ইভোহারনেস-আরএল বিকাশ করেছে, যা এআই এজেন্টের সাফল্যের হার ৯৬.৯% বাড়িয়েছে

iconCryptoBriefing
শেয়ার
AI summary iconসারাংশ
মেটা এবং ইলিনয় বিশ্ববিদ্যালয়ের গবেষকরা EvoHarness-RL তৈরি করেছেন, যা এআই এজেন্টের জন্য একটি স্ব-বিকাশশীল রানটাইম লেয়ার। এই সিস্টেমটি একটি স্ট্যান্ডার্ড বেঞ্চমার্কে ৪৭.৯% থেকে বেড়ে ৯৬.৯% সফলতার হার অর্জন করেছে। এই ফ্রেমওয়ার্কটি জটিল কাজগুলি পরিচালনা করতে Belief, Progress, এবং Experience (BPE) নামক একটি সংগঠিত বাহ্যিক অবস্থা ব্যবহার করে। এটি harness annealing এবং বিকাশের মতো উত্থিত আচরণ দেখায়। এই উন্নতি CFT প্রচেষ্টাকে প্রভাবিত করতে পারে এবং ক্রিপ্টো বাজারে তরলতা উন্নত করতে পারে।

মেটা এআই এবং ইলিনয় বিশ্ববিদ্যালয় আর্বানা-শ্যামপেইনের গবেষকরা একটি নতুন পেপার প্রকাশ করেছেন, যাতে EvoHarness-RL নামক একটি ট্রেনেবল কোঅর্ডিনেশন লেয়ার পরিচয় করিয়ে দেওয়া হয়েছে, যা বড় ভাষা মডেল এজেন্টগুলিকে তাদের নিজস্ব বাহ্যিক অবস্থা তৈরি, অ্যাক্সেস এবং পরিচালনা করতে দেয়। ফলাফল: বেসলাইন মডেলটি এটি ছাড়া চালানোর সময় 47.9% থেকে 96.9% সফলতার হার।

EvoHarness-RL বাস্তবে কী করে

LLM এজেন্টগুলির সীমিত প্রেক্ষাপট জানালা থাকে। যখন একটি কাজ অনেকগুলি ধাপে বিস্তৃত হয়, যা ডাইনামিক API কানেকশন, সার্ভার লগ, অপেক্ষমান উপ-লক্ষ্য এবং ত্রুটি পুনরুদ্ধার অন্তর্ভুক্ত করে, তখন মডেলের অভ্যন্তরীণ মেমোরি যথেষ্ট নয়। এটির বিশ্ব সম্পর্কে এটি কী বিশ্বাস করে, এটি কতটা অগ্রগতি করেছে এবং অতীতের ভুলগুলির মধ্যে এটি কী শিখেছে, তা ট্র্যাক করার জন্য একটি বাহ্যিক স্ক্যাফোল্ডের প্রয়োজন।

ফ্রেমওয়ার্কটি তিনটি উপাদানের চারপাশে একটি সংগঠিত বাহ্যিক অবস্থা প্রবর্তন করে: বিলিফ, প্রোগ্রেস এবং এক্সপেরিয়েন্স, যাদের একসাথে BPE বলা হয়। বিলিফ এজেন্টের পরিবেশের বর্তমান বোঝাপড়াকে ধারণ করে। প্রোগ্রেস সম্পন্ন এবং অপেক্ষমান সাবগোলগুলি ট্র্যাক করে যাতে এজেন্ট ধাপগুলি লাফিয়ে যায় না বা কাজ পুনরাবৃত্তি করে। এক্সপেরিয়েন্স ত্রুটির পাঠ সংরক্ষণ করে, যেমন API রেট লিমিটের কারণে API একটি ব্যাচকে অস্বীকার করে, যাতে এজেন্ট তার পদ্ধতি খাপ খাইয়ে নিতে পারে।

প্রশিক্ষণ দুটি পর্যায়ে ঘটে। প্রথমে, বিশেষজ্ঞদের প্রদর্শন ব্যবহার করে সুপারভাইজড ফাইন-টিউনিং মডেলকে হারনেসের সাথে কীভাবে মিথস্ক্রিয়া করতে হয় তা শেখায়। তারপর, গ্রুপ রিলেটিভ পলিসি অপ্টিমাইজেশন, বা GRPO নামক একটি খরচ-সচেতন অপ্টিমাইজেশন প্রযুক্তি হারনেস কলের গণনাগত খরচের বিপরীতে কাজের কর্মক্ষমতা ভারসাম্যপূর্ণভাবে বজায় রাখতে এজেন্টের আচরণকে পরিশোধিত করে।

বিজ্ঞাপন

গবেষকদের এই পদ্ধতি পরীক্ষা করা হয়েছে ALFWorld-এ Qwen3-8B মডেল ব্যবহার করে, যা এমবডিড এআই-এর জন্য একটি বেঞ্চমার্ক যেখানে এজেন্টগুলিকে একাধিক ধাপে পারিবারিক কাজ সম্পন্ন করতে হয়। পরিচিত পরিবেশে 96.9% সফলতার হার নিজেই অসাধারণ, কিন্তু সম্ভবত আরও বেশি গুরুত্বপূর্ণ হলো অপরিচিত পরিবেশে 86.6% সফলতার হার।

দুটি আচরণ যা গবেষকদের প্রত্যক্ষভাবে প্রোগ্রাম করা হয়নি

কাগজটি প্রশিক্ষণের সময় উঠে আসা দুটি উত্থিত ঘটনাকে উল্লেখ করে, যেগুলির কোনোটিই সরাসরি প্রকল্পিত হয়নি।

প্রথমটি হল “হারনেস অ্যানিলিং।” সময়ের সাথে সাথে, এজেন্ট ধীরে ধীরে রুটিন হারনেস অপারেশনগুলি অভ্যন্তরীণকরণ শুরু করে, যার ফলে এটি বাহ্যিক অবস্থা পরামর্শ করার কম প্রয়োজনীয়তা দেখায়। হারনেস কলগুলি কমে যায় কারণ সিস্টেমটি ক্ষয়প্রাপ্ত হচ্ছে না, বরং মডেলটি প্যাটার্নগুলি শোষণ করেছে।

দ্বিতীয়টি হল “প্রগতির ব্যবহার।” এজেন্ট যখন প্রশিক্ষণ নেয়, তখন এটি তার বাহ্যিক অবস্থাকে সংকুচিত করে এবং নির্দিষ্ট কাজের ধরনের জন্য উপযুক্ত একটি আরও সংক্ষিপ্ত ফরম্যাটে পুনর্গঠন করে। BPE প্রতিনিধিত্বটি মানুষের হস্তক্ষেপ ছাড়াই আরও সংক্ষিপ্ত এবং বিশেষায়িত হয়ে ওঠে।

পূর্বের কাজের উপর ভিত্তি করে

EvoHarness-RL হল Meta-Harness-এর উপর ভিত্তি করে তৈরি, যা মার্চ 2026-এর একটি আগের প্রকল্প ছিল যা এজেন্টিক অনুসন্ধান পদ্ধতির মাধ্যমে হারনেস কোডকে অপ্টিমাইজ করার উপর ফোকাস করেছিল। যেখানে Meta-Harness হারনেসকে অনুসন্ধানের মাধ্যমে উন্নত করার জন্য কোড হিসাবে বিবেচনা করেছিল, সেখানে EvoHarness-RL সম্পূর্ণ সমন্বয় স্তরকে এমন কিছু হিসাবে বিবেচনা করে যা মডেলটি নিজেই গঠন এবং পরিমার্জন করতে শিখতে পারে।

পেপারটিতে বিদ্যমান এজেন্ট ফ্রেমওয়ার্কগুলির মতো SkillOS এবং SkillRL-এর তুলনায় অপরিচিত কাজগুলিতে উন্নতির কথাও উল্লেখ করা হয়েছে। EvoHarness-RL-এর জন্য পরিচিত এবং নতুন পরিবেশের মধ্যে কর্মক্ষমতার পার্থক্য প্রায় 10 শতাংশ, যা প্রতিদ্বন্দ্বী পদ্ধতিগুলির তুলনায় অনেক বেশি পড়ে।

এন্টারপ্রাইজ এআই বাস্তবায়নের জন্য এটির অর্থ কী

নিয়ন্ত্রিত পরিস্থিতিতে ৪৮% থেকে ৯৭% পর্যন্ত সফলতার হার বৃদ্ধি পাওয়া একটি ক্ষুদ্র উন্নতি নয়। ৮৬.৬% সাধারণীকরণ হারও গুরুত্বপূর্ণ, কারণ বাস্তব জগতের প্রতিষ্ঠানগত কাজগুলি প্রায় কখনই প্রশিক্ষণ ডেটার মতো হয় না।

GRPO প্রশিক্ষণ পর্যায়ে নির্মিত খরচ-সচেতন অপ্টিমাইজেশনটি একটি ব্যবহারিক চিন্তাকেও সমাধান করে। বাহ্যিক হ্যারনেস কলগুলি বিনামূল্যে নয়। এগুলি কম্পিউট ব্যবহার করে এবং ল্যাটেন্সি যোগ করে। হ্যারনেস অ্যানিলিংয়ের মাধ্যমে এজেন্টকে অপ্রয়োজনীয় কলগুলি কমানোর জন্য প্রশিক্ষিত করে, ফ্রেমওয়ার্কটি সময়ের সাথে সাথে সঠিকতা বজায় রেখে আরও দক্ষ হয়ে ওঠে।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।