"প্রক্রিয়াকরণ" থেকে "নেতৃত্ব দেওয়া" পর্যন্ত, দীর্ঘমেয়াদী এজেন্টের কী কম?
আজকের দ্রুত বিকাশশীল এজেন্ট পরিস্থিতিতে, হারনেস বড় মডেলগুলিকে বাস্তব বিশ্বের সাথে যুক্ত করেছে, যাতে এগুলি টুল কল করতে, কোড পরিবর্তন করতে এবং পরীক্ষা চালাতে পারে। কিন্তু যখন কাজ কয়েক মিনিট থেকে কয়েক দিনে বাড়ে, তখনও সিস্টেমটির জন্য একজন মানুষকে দীর্ঘদিন পর্দার সামনে বসে থাকতে হয় যাতে পরবর্তী পদক্ষেপটি কোথায় নেওয়া হবে তা বিচার করা যায়।
এই বাধার মূল কারণ শুধু মডেলের ক্ষমতার অভাব নয়, বরং বর্তমানে বেশিরভাগ এজেন্ট শুধুমাত্র "কার্যক্রম"কে স্বয়ংক্রিয় করেছে, কিন্তু কার্যক্রমের উপরের "নিয়ন্ত্রণ"কে সত্যিকারভাবে স্বয়ংক্রিয় করেনি। Harness মডেলকে কার্যক্রমের ক্ষমতা দেয়, মানুষ মডেলকে সিদ্ধান্ত নেওয়ার ক্ষমতা দেয়। একবার মানুষ চলে গেলে, প্রকল্পটিও থেমে যায়। এছাড়াও, ঘনঘন পুরস্কারের ফিডব্যাক না থাকলে, এজেন্টের কার্যক্রম ও প্রতিক্রিয়াও ধীর ও অসহজ হয়ে পড়ে।
এই সমস্যার সমাধানে, মাইক্রোসফট, শাংহাই জিয়াওটং বিশ্ববিদ্যালয় ইত্যাদি প্রতিষ্ঠানগুলি Argus-কে ওপেন-সোর্স করেছে, যা দীর্ঘমেয়াদী গবেষণা কার্যের জন্য একটি সাধারণ এজেন্ট রিজনিং রানটাইম, এবং একটি প্রযুক্তিগত রিপোর্ট প্রকাশ করেছে। সিস্টেমটি প্রমাণ-ভিত্তিক, স্ব-বিকাশশীল, বহু-এজেন্ট সহযোগিতা, কোর এবং বিশেষায়িত ডোমেইনের বিচ্ছিন্নতা ইত্যাদি ডিজাইনের মাধ্যমে, এজেন্টগুলিকে ঘনঘন মানক ফিডব্যাক ছাড়াই কয়েকদিন ধরে বহু-ক্ষেত্রে সমন্বিত গবেষণা করতে সক্ষম করে।
রিপোর্টটি ২৭টি ক্যাম্পেইন এবং ১,৫৪৮ ঘন্টা ঘড়ির সময় কভার করে। গড়ে প্রতি ৪০.৭ ঘন্টা পর একবার মানব হস্তক্ষেপের প্রয়োজন হয়; রিপোর্টের কাজের ডিউটি সাইকেল ৯৫.১%~৯৮.৭%। এই Argus ডেলিভারি শুধুমাত্র উচ্চ-স্কোর বেঞ্চমার্ক নয়, বরং একটি সম্পূর্ণ প্রডাকশন-লেভেল রেজাল্ট বুক। টিমটি AI4AI, GPU Kernel, মডেল ট্রেনিং, AI4Science, চিপ ডিজাইন, AI4math, AI4System সহ বিস্তৃত টাস্কগুলিতে ফলাফল দিয়েছে, যা Argus-এর সাধারণীকরণ এবং বাস্তব গবেষণা-স্তরের বুদ্ধিমত্তাকে প্রতিফলিত করে।

চিত্র 1: আর্গাস রানটাইম, ক্ষমতা বেঞ্চমার্ক এবং ডেলিভারি ফলাফলের সারসংক্ষেপ।

- প্রবন্ধের শিরোনাম: আর্গাস: কে দিনগুলির জন্য হারনেস চালায়?
- পেপার: https://arxiv.org/abs/2608.05144
- কোড: https://github.com/lbx154/Argus
- প্রকল্পের হোমপেজ: https://argusbot.cn/
- প্রকল্প ফলাফল ওপেন সোর্স লাইব্রেরি: https://github.com/Argus-AiTeam
- প্রোজেক্ট ম্যাথ সলভিং লাইভস্ট্রিম: https://open.argusbot.cn/#counterexample-live
01
লক্ষ্য-প্রবর্তিত থেকে প্রমাণ-প্রবর্তিতে স্থানান্তরিত:
এজেন্টের পরবর্তী পদক্ষেপ কে নির্ধারণ করে?
গত দুই বছরে, এজেন্ট ইঞ্জিনিয়ারিংয়ের প্রধান অগ্রগতি হারনেসে কেন্দ্রীভূত হয়েছিল: স্বয়ংচালিত গাড়ির FSD-এর সাথে তুলনা করলে, মডেলটি ইঞ্জিনের মতো, হারনেসটি ট্রান্সমিশন সিস্টেমের মতো, কিন্তু গাড়িটি কোথায় যাবে তা নির্ধারণ করে এখনও স্ক্রিনের সামনে বসা মানুষ। সংক্ষিপ্ত কাজগুলিতে, যেমন সাধারণ অটো-পার্কিং, কাজটি নিজেই স্পষ্ট ফিডব্যাক প্রদান করে; কিন্তু যখন কাজটি কয়েকদিনের বেশি বাড়িয়ে দেওয়া হয়, তখন গবেষণা সমস্যাগুলির প্রায়শই স্থিতিশীল পুরস্কার থাকে না, এবং শুরু থেকেই সংজ্ঞায়িত লক্ষ্যও থাকে না। বর্তমান এজেন্টগুলির এইভাবেই প্রকৃত বাধা প্রকাশিত হয়েছে: তারা এখনও কাজগুলি সম্পন্ন করতে পারে, কিন্তু অনিশ্চয়তার মধ্যে ধারাবাহিকভাবে বিচার করতে পারে না।

চিত্র ২: আর্গাস অটো-রিসার্চের মাধ্যমে স্বয়ংসম্পূর্ণ গবেষণা বাস্তবায়ন করে মানুষের ভূমিকা চলন্ত ড্রাইভিং সিট থেকে সহচর ড্রাইভিং সিটে পরিবর্তন করে।
আর্গাস হারনেসের উপরে এই অ্যাটোমেশনহীন অবস্থানটিকে ড্রাইভার বলে অভিহিত করে। এর কাজ হলো, পরিকল্পনা এবং বাস্তবতার মধ্যে সংঘাত হলেও প্রমাণের ভিত্তিতে নিয়ন্ত্রণ বজায় রাখা। গবেষণা শুরুতে লেখা লক্ষ্যগুলি শুধুমাত্র সবচেয়ে কম তথ্যযুক্ত পর্যায়ের প্রাথমিক ধারণা; যদি এজেন্টটি শুধুমাত্র লক্ষ্য-প্রবর্তিতভাবে পূর্বনির্ধারিত শেষবিন্দুর দিকে ছোটে, এমনকি অসম্ভব লক্ষ্যগুলিতে বারবার টোকেন ব্যয় করে, তবে লক্ষ্য-কঠিনতা ঘটবে। এবং Evidence-Driven পদ্ধতিটি নিয়ন্ত্রণের যুক্তিকে উল্টিয়ে দেয়: পরবর্তী পদক্ষেপটি পরিকল্পনার প্রাথমিক ধারণার পরিবর্তে, বিদ্যমান প্রমাণগুলির দ্বারা নির্ধারিত হয়। চলমান প্রক্রিয়ায় সমস্ত ফলাফলই পথপরিবর্তনের জন্য কার্যকরী প্রমাণ; সিস্টেমটি ঠিকই প্রমাণ-প্রবর্তিত। বিশদভাবে, Driver-এর বর্তমান প্রমাণগুলির ভিত্তিতে নিম্নলিখিত চারটি প্রশ্নের উত্তর পুনরাবৃত্তি করতে হবে:
কি এই কাজটি সম্পন্ন হয়ে গেছে এবং এর গুণগত মান যথেষ্ট ভালো?
2. বর্তমান প্রমাণের সাথে মিলিয়ে, পরবর্তী সবচেয়ে মূল্যবান পদক্ষেপটি কী?
৩. এই রাউন্ডে প্রাপ্ত অভিজ্ঞতা দিয়ে পরবর্তী সিস্টেমের আচরণ কীভাবে পরিবর্তন করা উচিত?
৪. বাকি প্রশ্নগুলি কি মানুষের কাছে নির্ণয়যোগ্য বিষয় সম্পর্কিত?
02
একটি সাধারণ কাস্টমাইজড দীর্ঘস্থায়ী রানটাইম সেটআপ করুন
আর্গাস দীর্ঘমেয়াদী প্রকল্পগুলিকে স্থায়ী ক্যাম্পেইনে সংগঠিত করে এবং তারপর সেগুলিকে স্পষ্টভাবে সীমাবদ্ধ মিশনে বিভক্ত করে। এর মূল বন্দনা হলো: ম্যানেজার → প্ল্যানার → ইঞ্জিনিয়ার ⇄ রিভিউয়ার → ম্যানেজার:
OpenAI Codex-এর /goal মোডের সাথে তুলনা করে আর্গাসের ডিজাইন প্রবণতা আরও স্পষ্টভাবে চিহ্নিত করা যায়। /goal হল একটি এজেন্টের একক চক্রকে একটি গোল অবস্থার সাথে দীর্ঘস্থায়ী চক্রে পরিণত করা; আর্গাস হল গবেষণা প্রকল্পগুলিকে একাধিক ভূমিকা, একাধিক harness এবং স্থায়ী জ্ঞানের সাথে দীর্ঘস্থায়ী রানটাইমে সংগঠিত করা। প্রথমটি উত্তর দেয় “এজেন্টকে কিভাবে বন্ধ না করা যায়”, আর দ্বিতীয়টি উত্তর দেয় “এজেন্ট বন্ধ না হলে, কিভাবে এটি কার্যকরভাবে কাজ করবে”। এটিই Run-time-এর স্তরে Goal-Driven-এর থেকে Evidence-Driven-এ স্থানান্তরের প্রতিফলন।
1. ম্যানেজার স্টেজ ট্রানজিশন, প্রক্রিয়া অনুমোদন এবং গ্লোবাল স্ট্র্যাটেজি নিয়ন্ত্রণ করে;
2. প্ল্যানার বর্তমান প্রমাণের ভিত্তিতে নির্দিষ্ট কাজ পরিকল্পনা করে;
3. ইঞ্জিনিয়ার বাস্তব কোড রিপোজিটরি, পরীক্ষা এবং বাস্তবায়নে প্রবেশ করে;
4. রিভিউয়ার স্বতন্ত্রভাবে আর্টিফ্যাক্ট পরীক্ষা করে উদ্ভাবনী ও কার্যক্ষমতা যাচাই করে, ম্যানেজারকে রিপোর্ট করে বা ইঞ্জিনিয়ারকে ফেরত দেয়।
এখানে মূল বিষয় হল একাধিক ভূমিকা নিজেই নয়, বরং প্রেক্ষাপটকে বিভক্ত করা — একাধিক ভূমিকা পরস্পরের সাথে সমন্বয় করে এজেন্টকে শুধুমাত্র স্থানীয় আরোহণ টুলে পরিণত হতে থাকতে দেয় না, প্রতিটি ভূমিকার নিজস্ব অনন্য প্রেক্ষাপট থাকে কিন্তু কাজের ক্ষেত্রটি শেয়ার করে, যাতে পরিকল্পনা, বাস্তবায়ন এবং যাচাইকরণের সমস্ত দায়িত্ব একটি এজেন্টের উপর ন্যস্ত না হয়, যা token-এর দক্ষতা বাড়ায়। এইজন্যই, Argus-এর একটি কাজের মধ্যে Pi, Codex, Claude Code-এর সাথে একসাথে সক্ষম করা যায়, ডিপসিক হারনেস বিভিন্ন হারনেস ব্যবহার করে উচ্চ কাস্টমাইজেশন নিশ্চিত করা হয়।
সিস্টেম একটি সম্পূর্ণ আর্টিফ্যাক্ট সংরক্ষণ করে; কেবলমাত্র প্রমাণের সীমানা পার হওয়া অভিজ্ঞতাই Wiki এবং Skill-এ প্রবেশ করে এবং পরবর্তী টাস্কগুলির জন্য Project, Vertical বা Global স্কোপ অনুযায়ী পুনঃব্যবহারযোগ্য হয়।
এর সাথে সাথে, Core এবং Vertical একে অপরের থেকে বিচ্ছিন্ন থাকে: Core ভূমিকা অনুমতি, প্রমাণ জমা এবং মানুষের সীমানা পরিচালনা করে, যখন Vertical ক্ষেত্রবিশেষজ্ঞদের দ্বারা গণিত, GPU, উপাদান ইত্যাদি কাজে কী প্রমাণের মানদণ্ড নির্ধারণ করা হয় এবং সংশ্লিষ্ট মানুষের দক্ষতা ও জ্ঞান সংজ্ঞায়িত হয়; Vertical গবেষণা কাজের গুণগত মান উল্লেখযোগ্যভাবে উন্নত করতে পারে, একইসাথে মানুষের বিশেষজ্ঞদের এবং agent-এর সহ-বিকাশ, কাস্টমাইজড কাজের প্রবাহের জন্যও ইন্টারফেস প্রদান করে।

চিত্র 3: আরগাসের দীর্ঘমেয়াদী কার্যপ্রণালী। চারটি ভূমিকা স্থায়ী অবস্থার চারপাশে ঘুরে বেড়ায়, এবং ক্যাম্পেইনটি আটটি গবেষণা পর্যায়ের মধ্যে এগিয়ে যেতে বা পিছনে ফিরতে পারে।
03
১৫৪৮ ঘন্টার পর, আর্গাস কী রেখে গেল?
দীর্ঘমেয়াদি এজেন্টের সফলতা নির্ভর করে সময়কে বাস্তব গবেষণামূলক ফলাফলে রূপান্তর করা যায় কিনা। আরগাস ওপেন-সোর্স হওয়ার এক মাসেরও কম সময়ের মধ্যে, এটি অবকাঠামো, উপকরণ, চিপ, গণিত এবং AI সিস্টেম গবেষণায় অসাধারণ অবদান রেখেছে। আমরা প্রথম দল যে সম্পূর্ণ এন্ড-টু-এন্ড গাণিতিক অনুমান সমাধানের ফিল্টারিং লগ প্রকাশ করেছে, এবং সমস্ত রানিং ট্র্যাজেক্টরি সেশনগুলি খোলা রেখেছি। নিচে আরগাসের ওপেন-সোর্সিংয়ের পরের সমস্ত অবদানের সংক্ষিপ্তসার:

চিত্র 4: আরগাসের প্রতিনিধিত্বকারী গবেষণামূলক ফলাফল, মূল সূচক এবং গ্রহণযোগ্যতার ভিত্তি
উপরের টেবিলে দেখানো হয়েছে, আরগাস প্রথমে AI4System & Infra-এ স্থায়ী চালুকে গ্রহণযোগ্য বাস্তব ডেলিভারি হিসেবে রূপান্তরিত করে, যা স্পষ্ট ইঞ্জিনিয়ারিং ফলাফলের মাধ্যমে স্বয়ংক্রিয় কার্যক্রম থেকে স্বাধীন গবেষণার প্রথম পদক্ষেপ সম্পন্ন করে; তারপর, কাজটি AI ইনফ্রাস্ট্রাকচার থেকে AI4Science, AI4Hardware, AI4Math-এ বিস্তৃত হয়, এবং মূল্যায়ন মানদণ্ডও “নির্ধারিত কাজ সম্পন্ন হয়েছে কিনা” থেকে “অনির্ণীত বাস্তব গবেষণা সমস্যা অনুসন্ধান করা যাচ্ছে কিনা”-এ পরিবর্তিত হয়, যার ফলে স্বয়ংক্রিয় গবেষণা স্বয়ংক্রিয় ডেলিভারি থেকে স্বয়ংক্রিয় অনুসন্ধানের দিকে এগিয়ে যায়; এই ভিত্তির উপর, আরগাস AI4AI-এর দিকে একক ফলাফল থেকে সম্পূর্ণ গবেষণা প্রক্রিয়ায় বিস্তৃত হয়, প্রমাণের মাধ্যমে কাজগুলির অগ্রগতি চলতে থাকে, মানুষকে সবসময় স্ক্রিনের সামনে বসে থাকতে হয়না, এভাবে বাস্তব ডেলিভারি, ক্রস-ডোমেইন অনুসন্ধান, এবং পুরোপুরি স্বয়ংক্রিয় গবেষণা—এই তিনটির একটি পদক্ষেপবদ্ধ পথ গড়ে ওঠে।

চিত্র 5: আর্গাসের পুরো পেপার উৎপাদন প্রক্রিয়ায় ডেলিভারি ফলাফল।
উপরের ফলাফলগুলি এক মাসের মধ্যে অর্জন করা হয়েছে, এই সাফল্যগুলিকে একসাথে যুক্ত করলে, আর্গাস একটি ধাপে ধাপে গভীরতর মূল্য শৃঙ্খল হয়ে উঠেছে: স্বয়ংক্রিয়করণের বিষয়বস্তু একবারের কার্যক্রম থেকে প্রমাণ-চালিত গবেষণা প্রগতিতে বিস্তৃত হয়েছে, যা গবেষণা প্রগতিকে অনেক দ্রুত করেছে, এবং এটিই “মনুষ্য স্ক্রিন থেকে চলে গেলে, এজেন্টকে কে চালাবে” –এর সবচেয়ে সরাসরি উত্তর।
শেষ কথা
স্ক্রিন নিভে গেলেও প্রোজেক্ট শূন্যে ফিরে যায়নি
লং-রেঞ্জ ইন্টেলিজেন্স হল টোকেনকে ইন্টেলিজেন্সে রূপান্তরিত করা এবং সেই ইন্টেলিজেন্স ব্যবহার করে একটি গবেষণা প্রকল্পকে অবিরামভাবে এগিয়ে নিয়ে যাওয়া, যাতে বাস্তব মূল্য উৎপাদিত হয়। আরগাস মডেলগুলির মধ্যে পূর্বে বিচ্ছিন্ন কলগুলিকে একটি অবিরাম কার্যক্রমের গবেষণা সিস্টেমে সংগঠিত করে, যাতে Evidence-Driven পদ্ধতি দিয়ে দিকনির্দেশনা নিয়ন্ত্রিত হয় এবং স্ব-উন্নয়নের মাধ্যমে অভিজ্ঞতা ক্ষমতায় রূপান্তরিত হয়।
আর্গাস শুধু একটি দীর্ঘস্থায়ী এজেন্ট দেখায় না, বরং গবেষণা সংগঠনের একটি নতুন পদ্ধতি: হারনেস মডেল কীভাবে কাজ করবে তা সমাধান করে, ড্রাইভার সিস্টেমকে কীভাবে অবিরত এগিয়ে নিয়ে যাবে তা নির্ধারণ করে, এবং গবেষণার গতি আর মানুষের কাজ ও বিনোদনের সময়ের উপর নির্ভর করে না। এটি সম্ভবত গবেষণার ত্বরান্বিত যুগের শুরুকে ইঙ্গিত করছে। স্ক্রিন বন্ধ হয়ে যাওয়ার পরও গবেষণা চলতে থাকবে।
লেখকের পরিচয়
আরগাস মাইক্রোসফট এবং শাংহাই জিয়াওটং বিশ্ববিদ্যালয়ের গবেষকদের নেতৃত্বে এবং অনেক বিশ্ববিদ্যালয়ের গবেষকদের সহযোগিতায় এগিয়ে নেওয়া হচ্ছে।
এই প্রবন্ধটি ওয়েইচ্যাট গিটহাব "মেশিন মাইন্ড" থেকে এসেছে
