হুয়াওয়ে নোয়ার্স আর্ক ল্যাব মাল্টি-স্ট্র্যাটেজি রোবট সমন্বয়ের জন্য রোবোহারনেস সিস্টেম চালু করেছে

iconMetaEra
শেয়ার
AI summary iconসারাংশ
হুয়াওয়ে নোয়ার্স আর্ক ল্যাব রোবোহারনেস সিস্টেম প্রকাশ করেছে, যা ভিএলএ, ওয়াম, আরএল এবং ট্যাম্পের মতো বহু কৌশলকে দীর্ঘ-সময়কালীন কাজের জন্য সমন্বিত করার জন্য ডিজাইন করা হয়েছে। এই সিস্টেমটি বোঝাপড়া, মেমোরি এবং বিবর্তনকে একত্রিত করে, যার মধ্যে একটি মেমোরি ব্রিজ মডিউল রয়েছে যা কৌশলের সংক্রমণকে উন্নত করে। পরীক্ষাগুলিতে ৮৬% সফলতার হার দেখা গেছে। যেহেতু টিএ ক্রিপ্টোতে জনপ্রিয়তা পাচ্ছে, এই নবায়নগুলি ক্রিপ্টো কৌশলে মূল্যভিত্তিক বিনিয়োগকে প্রভাবিত করতে পারে।
হুয়াওয়ে নোয়া আর্ক ল্যাব রোবোহারনেস সিস্টেম প্রকাশ করেছে, যা কোডিং এজেন্টের মাধ্যমে VLA, WAM, RL, TAMP ইত্যাদি হেটারোজিনিয়াস স্ট্র্যাটেজিগুলিকে সমন্বয় করে জিরো-শট দীর্ঘ-সময়কালের কাজ সম্পন্ন করে। সিস্টেমটি বুঝতে, মনে রাখতে এবং উন্নত করতে তিনটি দক্ষতা অন্তর্ভুক্ত করে, যার Memory Bridge মডিউলটি স্ট্র্যাটেজি পরিবর্তনের সময় স্টেট ডিস্ট্রিবিউশনের অসামঞ্জস্যতা সমাধান করে, যা পরীক্ষায় 86% সফলতার হার অর্জন করে। এই কাজটি বড়িয়েড ইন্টেলিজেন্সের একক মডেল থেকে সিস্টেম-ভিত্তিক অর্জনের দিকে বিকাশের পথ নির্দেশ করে।

লেখক এবং উৎস: লেইফেঙ্গোয়েন

একটি কাজ কল্পনা করুন: দরজা খুলুন, এর ভিতরে লুকানো ব্লকগুলি খুঁজে বার করুন এবং তাদের দিয়ে একটি সেতু তৈরি করুন।

মানুষের জন্য এটি খুব সহজ, কয়েকটি ক্রিয়া স্বাভাবিকভাবে একে অপরের সাথে যুক্ত হয়, যা প্রাথমিক বিদ্যালয়ের শিশুও সহজেই সম্পন্ন করতে পারে।

কিন্তু রোবটের জন্য এই কাজটি বিভিন্ন সম্পূর্ণ ভিন্ন ক্ষমতার উপর নির্ভর করে: ব্লক খুঁজে পাওয়া, যার জন্য দৃশ্য বোঝার এবং ভাষাগত নির্দেশ অনুসরণের প্রয়োজন; ক্যাবিনেটের দরজা খোলা, যার জন্য পরিবেশের সাথে জটিল মিথস্ক্রিয়া প্রয়োজন; ব্লক সাজানো, যার জন্য জ্যামিতিক পরিকল্পনা এবং সঠিক নিয়ন্ত্রণের পাশাপাশি পরিবেশের পরিবর্তন অনুমান করা প্রয়োজন।

আরও জটিলতা হলো, এই ক্ষমতাগুলি বিভিন্ন “পরম্পরা” এর মডেলগুলিতে বিভক্ত—VLA (ভিজুয়াল-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল), WAM (ওয়ার্ল্ড-অ্যাকশন মডেল), RL পলিসি (রিইনফোর্সমেন্ট লার্নিং), TAMP (টাস্ক অ্যান্ড মোশন প্ল্যানিং)। এগুলি প্রতিটি নিজস্ব শক্তি রাখে, কিন্তু পরস্পরের সাথে বিচ্ছিন্ন, এদের প্রশিক্ষণের পদ্ধতি, ইনপুট ফরম্যাট এবং স্টেট স্পেসও ভিন্ন।

আজকের রোবটিক্স ক্ষেত্রে ক্ষমতা অভাব নেই, কিন্তু সহযোগিতা অনুপস্থিত।

হুয়াওয়ে নোয়া আর্ক ল্যাব সম্প্রতি একটি পেপার প্রকাশ করেছে, যাতে বিভিন্ন স্ট্র্যাটেজির মধ্যে সহযোগিতার সমস্যা সমাধানের জন্য RoboHarness নামক একটি সিস্টেম প্রস্তাব করা হয়েছে। এই কাজের চারপাশে, পেপারের লেখকরা আমাদের (লেইফেঙ্গনেট) সাথে আলোচনা করেছেন।

এজেন্ট শরীরবাদী বিশ্বের দিকে: ভাষাগত বুদ্ধিমত্তা থেকে রোবটের "মস্তিষ্ক কমান্ডার"

পেপার: https://arxiv.org/abs/2607.18060

প্রকল্পের হোমপেজ: https://www.robo-harness.com/

01 সর্বজনীন মডেলের ভ্রম এবং বাস্তবতার ব্যবধান

এই গ্রীষ্মকালে, হারনেসকে কেন্দ্র করে রোবোটিক্স গবেষণার ক্ষেত্রে কয়েকটি ঘটনা ঘটেছে, যা একটি বোধকে নির্দেশ করে: বড় মডেল দিয়ে সবকিছু সমাধান করা এখনও সম্ভব নয়, রোবোটগুলির একটি বাস্তবায়ন সংগঠন প্রয়োজন।

জুলাইয়ে, তসিংহুয়া বিশ্ববিদ্যালয়ের প্রফেসর ইউ চাওয়ের দল Harness VLA প্রকাশ করে, যা ডিজিটাল বুদ্ধিতে প্রচুর ব্যবহৃত Harness Layer-কে বড়ি বুদ্ধিতে চালু করে, যাতে একটি ফ্রিজড VLA ঘন সংস্পর্শযুক্ত হস্তক্ষেপের মতো তার সবচেয়ে ভালো দক্ষতায় ফোকাস করতে পারে, একইসাথে Harness লেয়ারটি শিখে যে কখন, কিভাবে এটি কল করতে হবে, এবং VLA-এর ব্যর্থতার পরে কিভাবে রিসেট করতে হবে এবং পুনরায় চেষ্টা করতে হবে। LIBERO-Pro বিচলন মূল্যায়নে, এই সিস্টেমটি সফলতার হার 50% থেকে 82.4% পর্যন্ত বাড়িয়েছে।

ধারণাগতভাবে, Harness VLA একটি মডেলকে বিতরণের বাইরের বিক্ষিপ্তির অধীনে স্থিতিশীলভাবে কাজ করার সমস্যা সমাধান করে। এর সমস্যা হল একক কৌশলের স্থিতিশীলতা।

হুয়াওয়ে নোয়া আর্ক ল্যাবের রোবোহারনেস সামনে রয়েছে অন্য একটি সমস্যা: যখন কোনো মডেলের ক্ষমতার সীমানা অতিক্রম করে কাজ শেষ হয়, তখন কী করবেন?

উভয়কেই হারনেস বলা হয়, উভয়ের জন্যই কোডিং এজেন্ট সংগঠন স্তর হিসাবে ব্যবহার করা হয়, কিন্তু এগুলি ভিন্ন মাত্রার চ্যালেঞ্জগুলির সমাধান করে। প্রথমটি একজন বিশেষজ্ঞকে আরও স্থিতিশীল করে তোলে, আর দ্বিতীয়টি বিভিন্ন দক্ষতাসম্পন্ন বিশেষজ্ঞদের একসাথে কাজ করতে সহায়তা করে। রোবটের কাজের জটিলতা বাড়তে থাকার সাথে সাথে, এই দ্বিতীয় সমস্যাটি এখন আরও বেশি অবহেলা করা যায়না।

এই প্রশ্নের মূল কারণ হল বিভিন্ন মডেলের ক্ষমতার সীমাবদ্ধতা।

ভিএলএ মডেলের সুবিধা হল খোলা ভাষাগত নির্দেশ বুঝতে পারা এবং নতুন পরিবেশে সাধারণীকরণ করা, কিন্তু এটির এন্ড-টু-এন্ড ক্রিয়া উৎপাদনের পদ্ধতি দীর্ঘকালীন ক্রমানুসারে কাজে সামঞ্জস্য বজায় রাখতে কঠিন; শক্তিশালী শিক্ষা কৌশলগুলি নির্দিষ্ট প্রশিক্ষণ পরিস্থিতিতে স্থিতিশীল বন্ধ চক্রের আচরণ বিকশিত করতে পারে, কিন্তু এই স্থিতিশীলতা প্রশিক্ষণের বণ্টনের উপর অত্যন্ত নির্ভরশীল, পরিবেশের ক্ষুদ্রতম পরিবর্তনেই এটি ব্যর্থ হয়ে যেতে পারে; TAMP সাংকেতিক যুক্তি এবংজ্যামিতিক সীমাবদ্ধতায় দক্ষ, কিন্তু এটির আগেই ক্রিয়ার প্রাইমিটিভগুলি সংজ্ঞায়িত করতে হয়, খোলা পরিস্থিতি এবংঅস্পষ্ট লক্ষ্যের সম্মুখীন হলে পরিকল্পনাকারীদের দ্রুতই সমস্যায় পড়তে হয়; WAMভবিষ্যৎ অবস্থা ভবিষ্যদ্বাণীর মাধ্যমেদীর্ঘকালীনসিদ্ধান্তগ্রহণকেসহায়তা করতেপারে,কিন্তুভবিষ্যৎপরিসরবৃদ্ধিরসঙ্গেসঙ্গেএটিরত্রুটিরসঞ্চয়হওয়ারসম্ভাবনাওবেশি।

জটিল বাস্তব কাজগুলি একসাথে বৈচিত্র্য বোঝার, জ্যামিতিক পরিকল্পনার, বন্ধ লুপ নিয়ন্ত্রণের, দীর্ঘ সময়কালের যুক্তিবিদ্যার এবং পরিবেশের পরিবর্তন অনুমানের প্রয়োজন করে, যেগুলির প্রশিক্ষণের লক্ষ্যগুলি ভিন্ন এবং কখনও কখনও পরস্পরবিরোধী। প্রতিটি ক্ষমতা থেকে আলাদাভাবে উত্তীর্ণ হওয়া থেকে একটি একক মডেলের দ্বারা খোলা পরিবেশে দীর্ঘস্থায়ীভাবে সমস্ত ক্ষমতা সমন্বয় করা—এই দুটির মধ্যে এখনও পর্যন্ত পার হওয়া হয়নি এমন একটি গভীর বিদীর্ণতা রয়েছে।

রোবোহারনেসের মূল ধারণা হলো: এই বিচ্ছিন্নতা পূরণ হওয়ার জন্য অপেক্ষা করার পরিবর্তে, ইতিমধ্যে বিদ্যমান এবং প্রতিটির নিজস্ব শক্তি রাখা মডেলগুলিকে প্রকৃতপক্ষে সমন্বিতভাবে কাজ করানো উচিত। লেখক মনে করেন, যতক্ষণ না একটি মডেল অন্য সমস্ত মডেলকে সম্পূর্ণভাবে অধিকার করে নেয় এবং পরম শাসন প্রদর্শন করে, ততক্ষণ এই সংগঠনামূলক কাঠামোটি অত্যন্ত গুরুত্বপূর্ণ।

এই কাজটি হঠাৎ করে তৈরি হয়নি। লেখক আমাদের বলেছেন (LeiFeng.com), রোবোহারনেসের প্রাথমিক সংস্করণটি গতবছর BEHAVIOR Challenge নামক বিশ্বব্যাপী রোবোটিক্স চ্যালেঞ্জে অংশগ্রহণের অভিজ্ঞতা থেকে জন্ম নেয়। সেই চ্যালেঞ্জের টাস্কগুলি দীর্ঘ এবং কঠিন ছিল, এবং টিমটি দেখেছিল যে VLA-কে এন্ড-টু-এন্ড ট্রেন করা বা বিহেভিয়ার ক্লোনিং-এর মতো মডেলগুলি ব্যবহার করেও টাস্কের জটিলতা পূরণ করা সম্ভব হয়নি। এই ব্যর্থতা, তবুও, টিমকে সত্যিকারের সমস্যাটির দিকে নিয়ে যায়।

02 মস্তিষ্ক কীভাবে সিদ্ধান্ত নেয় কে মাঠে নামবে

RoboHarness-এর মূল ধারণা হল ভিএলএ, ওয়েম, আরএল কৌশল, ট্যাম্প ইত্যাদি স্বতন্ত্রভাবে বিকশিত নিয়ন্ত্রণ ব্যবস্থাগুলিকে এককভাবে সমন্বিত করা যায় এমন এজেন্টিক দক্ষতায় প্যাকেজ করা, যা কোডিং এজেন্ট দ্বারা উচ্চস্তরের সিদ্ধান্ত গ্রহণের জন্য দায়ী।

এই ডিজাইনের একটি গুরুত্বপূর্ণ পূর্বশর্ত হল: যেকোনো অধীনস্থ কৌশলকে পরিবর্তন বা পুনর্প্রশিক্ষিত করা হবে না। প্রতিটি কৌশল তার মূল বাস্তবায়ন বজায় রাখবে, মডেল স্ট্রাকচার, অ্যাকশন স্পেস বা প্রশিক্ষণ ডেটা শেয়ার করার প্রয়োজন হবে না। RoboHarness শুধুমাত্র এগুলির উপরে একটি সংগঠনমূলক সক্ষমতা যোগ করে।

সঠিক কৌশল বাছাই করা এতটাই সহজ নয়।

একটি কোডিং এজেন্টের জন্য, শুধুমাত্র মূল ছবির ইনপুট দিয়ে এই কাজটি কার কাছে পাঠানো উচিত তা নির্ভরযোগ্যভাবে বিচার করা কঠিন। কারণ এই সিদ্ধান্তের পেছনে অনেকগুলি পরিমাণগত প্রশ্ন লুকিয়ে আছে যেগুলি ভাষা মডেলের বৈচিত্র্যবোধের মাধ্যমে উত্তর দেওয়া সম্ভব নয়। এটি একটি গ্লাসকে প্লেটের উপরে রাখতে পারে, কিন্তু RGB ছবি থেকে বর্তমান পরিস্থিতির সাথে কোনও কৌশলের প্রশিক্ষণ বিতরণের সাদৃশ্য গণনা করতে পারে না, এবং এখনকার সেন্সর ডেটা-এর নির্ভরযোগ্যতা মূল্যায়নও করতে পারে না।

এই সমস্যার সমাধানের জন্য, সিস্টেম তিনটি সহায়ক দক্ষতা ডিজাইন করেছে যা কোডিং এজেন্টের জন্য বিচারের জন্য প্রয়োজনীয় তথ্য বের করে আনতে সহায়তা করে।

এজেন্ট শরীরবাদী বিশ্বের দিকে: ভাষাগত বুদ্ধিমত্তা থেকে রোবটের "মস্তিষ্ক কমান্ডার"

স্কিল বুঝতে পারা, মূল ইনপুটকে পরিমাপযোগ্য সংকেতে রূপান্তরিত করার দায়িত্ব নেয়, যেমন: চিত্র এম্বেডিং এবং বিভিন্ন কৌশলের প্রশিক্ষণ ডেটার সাদৃশ্য, সময়ের জন্য বস্তুর অবস্থানের স্থিতিশীলতা, বর্তমান আলোকের এবং চিত্রের গুণগত মান কি পর্যাপ্ত কিনা ইত্যাদি। এই মাপদণ্ডগুলিই কৌশল রাউটিংয়ের প্রকৃত ভিত্তি। লেখক মনে করেন, এই মডিউলটির মূল স্বভাব হলো, প্রতিটি কৌশলকে বহুমাত্রিকভাবে পরিমাপ করা যেন এটি বর্তমান কাজের জন্য উপযুক্ত কিনা।

মেমোরি স্কিলস, ইতিহাসের কার্যক্রমের অভিজ্ঞতা পুনরুদ্ধার করে স্ট্র্যাটেজি নির্বাচনের জন্য রেফারেন্স প্রদান করে এবং মেমোরি ব্রিজের মাধ্যমে স্ট্র্যাটেজির মধ্যে স্টেট ডিস্ট্রিবিউশনের অসামঞ্জস্যতা প্রক্রিয়াকরণ করে—এটিই সিস্টেমের সবচেয়ে গুরুত্বপূর্ণ ডিজাইন, যা নীচে আলাদাভাবে বিস্তারিত করা হয়েছে।

Evolution Skills, অনলাইন ফিডব্যাক ব্যবহার করে স্ট্র্যাটেজির মেটাডেটা এবং অর্কেস্ট্রেশন লজিক নিয়মিত আপডেট করে, যাতে সিস্টেম প্রতিটি বাস্তবায়ন থেকে শেখে, প্রতিবার নতুন পরিস্থিতির সম্মুখীন হলে শূন্য থেকে বিচার না করে।

তিনটি দক্ষতার তথ্য প্রবাহ পরস্পরের সাথে মিথস্ক্রিয়া করে কোডিং এজেন্টের সিদ্ধান্ত গ্রহণে সহায়তা করে। বাস্তব বাস্তবায়নে, এই কাঠামোটি মূলত দুটি স্তরে কাজ করে: প্রথমত, কাজের বিভাজন, যেখানে দীর্ঘ নির্দেশাবলীকে বিভিন্ন কৌশলের জন্য উপযুক্ত উপ-কাজে বিভক্ত করা হয়; দ্বিতীয়ত, গতিশীল স্যুইচিং, যখন বর্তমান কৌশলটি ধীরে ধীরে এর ক্ষমতার সীমানা পৌঁছায়, তখন সিস্টেমটি সময়মতো আরও উপযুক্ত কৌশলে স্যুইচ করে, যাতে বিভিন্ন কৌশলগুলির মধ্যে ক্ষমতার পরস্পরপূরকতা অর্জন করা যায়।

একটি অ্যাবলেশন পরীক্ষার সেট ব্যবহার করে পেপারটি এই দুটি স্তরের প্রতিটির অবদান ব্যাখ্যা করে: শুধুমাত্র ভাষাগত মডেল ব্যবহার করে pi0.5 কে কাজটি বিভক্ত করে পাঠানোর মাধ্যমেই সফলতার হার উল্লেখযোগ্যভাবে বৃদ্ধি পেয়েছে; এই ভিত্তির উপর বিভিন্ন হেটারোজিনিয়াস স্ট্র্যাটেজি যোগ করার পরে, সফলতার হার আরও প্রচুরভাবে বৃদ্ধি পেয়েছে। সঠিকভাবে বিভক্ত করা প্রথম ধাপ, সঠিকভাবে প্রেরণ করা দ্বিতীয় ধাপ, এবং উভয়টিরই অপরিহার্য।

কিন্তু তৃতীয় একটি সমস্যা আছে, যা সবচেয়ে কঠিন এবং শুধুমাত্র স্ট্র্যাটেজি বাছাই করে সমাধান করা যায় না।

03 রিলে দৌড়ের বিজয় নির্ধারিত হয় বদলানোর মুহূর্তে।

দুটি স্বতন্ত্রভাবে প্রশিক্ষিত কৌশল সাধারণত তাদের নিজ নিজ ডেটা বিশ্বে বাস করে। তাদের ইনপুট ফরম্যাট ভিন্ন এবং রোবটের অবস্থার অভিজ্ঞতার বণ্টনও ভিন্ন। TAMP অপারেশন সম্পন্ন করে যে অবস্থানে থামে, সেটি খুব সম্ভবত VLA-এর কখনও প্রক্রিয়াকরণ করা হয়নি এবং যেখানে স্থিতিশীলভাবে শুরু করা যায়না এমন অবস্থা স্পেসের মধ্যেই পড়ে।

এটি হেটারোজিনিয়াস স্ট্র্যাটেজি অর্কেস্ট্রেশনের অনন্য চ্যালেঞ্জ।

অতএব, দুটি স্ট্র্যাটেজির স্থিতিশীল হস্তান্তর নিশ্চিত করার জন্য দায়িত্বপ্রাপ্ত মেমোরি ব্রিজকে লেখক রোবোহারনেসের সবচেয়ে গুরুত্বপূর্ণ মডিউল হিসাবে চিহ্নিত করেছেন। তিনি স্বীকার করেছেন যে, ভবিষ্যতে যদি কোনও সাধারণ মডেল সমস্ত স্টেট স্পেসকে পূর্ণাঙ্গভাবে কভার করতে পারে, তবে মেমোরি ব্রিজ হয়তো অপ্রয়োজনীয় হয়ে যাবে; কিন্তু বর্তমান অবস্থায়, যেকোনও মডেলই হস্তান্তরের মুহূর্তে সহজেই ক্ষমতার বিতরণের বাইরে পড়ে যায়।

এজেন্ট শরীরবাদী বিশ্বের দিকে: ভাষাগত বুদ্ধিমত্তা থেকে রোবটের "মস্তিষ্ক কমান্ডার"

মেমোরি ব্রিজের কাজ তিনটি ধাপে বিভক্ত।

অনুসন্ধান: পরবর্তী উপ-কাজ এবং বর্তমান পর্যবেক্ষণের ভিত্তিতে, টেক্সট এবং ভিজুয়াল সাদৃশ্যের মাধ্যমে মাল্টিমোডাল মেমোরি ব্যাঙ্ক থেকে লক্ষ্য কৌশলের সাথে সাদৃশ্যপূর্ণ শীর্ষ-কে ট্রাজেক্টরি খুঁজে বার করুন, এবং রোবটের অবস্থা হিসাবে এন্ড-এফেক্টর পজিশন, জয়েন্ট কোণ ইত্যাদি প্রাপ্ত করুন।

মডেলিং: ট্রেজেক্টরির মধ্যে বিভিন্ন অবস্থার আপেক্ষিক প্রগতির ভিত্তিতে সুপারভাইজড সিগন্যাল প্রদান করা হয়, যার মাধ্যমে অনলাইন রিগ্রেশনের মাধ্যমে লক্ষ্য স্ট্র্যাটেজির “স্বাভাবিকভাবেই গ্রহণযোগ্য” অবস্থার পরিসরকে বাস্তবসময়ে ফিট করা হয়।

ব্রিজিং: লক্ষ্য কৌশলের আরামদায়ক অঞ্চলে প্রবেশের আত্মবিশ্বাস এবং গতিক খরচ উভয়কেই বিবেচনায় রেখে প্রার্থী অবস্থাগুলি নমুনা এবং স্কোর করুন, সবচেয়ে উপযুক্ত ব্রিজিং লক্ষ্যটি নির্বাচন করুন এবং সংক্রমণ ট্রাজেক্টরি তৈরি করুন; রোবট এই অবস্থায় পৌঁছানোর পর, নিয়ন্ত্রণটি পরবর্তী কৌশলের হাতে হস্তান্তর করুন।

এই মেকানিজমটি সম্পূর্ণরূপে ইতিহাসগত বাস্তবায়ন ডেটার উপর নির্ভর করে অনলাইনে শেখে, যা যেকোনো স্ট্র্যাটেজির জন্য প্লাগ-অ্যান্ড-প্লে করে, নীচের বাস্তবায়ন পরিবর্তন করার প্রয়োজন নেই এবং সহযোগিতামূলক প্রশিক্ষণেরও প্রয়োজন নেই।

অ্যাবলেশন পরীক্ষায়, মেমোরি ব্রিজ সরিয়ে ফেলার পর কাজের প্রগতি বেশি কমেনি, যা নির্দেশ করে যে কৌশল বাছাই এখনও প্রায় সঠিক ছিল, তবে সম্পূর্ণ সফলতার হার 86.0% থেকে হঠাৎ করে 60.4% এ নেমে আসে। অনেকগুলি কাজ শেষ ধাপে পৌঁছায়, কিন্তু হস্তান্তরের অবস্থা অসঙ্গতির কারণে ব্যর্থ হয়, যা মেমোরি ব্রিজের মূল্যকে প্রমাণ করে।

04 দুটি প্রযুক্তিগত পরিপ্রেক্ষ্য, একটি চুপচাপ ঘটছে এমন সংযোগ

এই পেপার থেকে দূরে সরে যাই, আমরা আরও বড় একটি এমবডিড টেকনোলজির চিত্র বর্ণনা করতে চাই।

রোবোহারনেসের লেখক দেখেছেন যে, গত তিন বছরে ভিএলএ-এর দ্রুত উন্নয়নের প্রেক্ষাপটে, প্রাচীন TAMP এবং স্তরবদ্ধ পরিকল্পনা খোলা পরিস্থিতিতে এন্ড-টু-এন্ড ভিএলএ-এর তুলনায় স্পষ্টভাবে কম সাধারণীকরণ ক্ষমতা দেখানোর কারণে সম্প্রদায়ের দৃষ্টি থেকে ধীরে ধীরে অপসারিত হয়েছিল। তবে, এই বছর এজেন্টিক সিস্টেম এবং কোডিং এজেন্টগুলির দ্রুত অগ্রগতির সাথে, স্তরবদ্ধ আর্কিটেকচারটি পুনরায় নতুন জীবনলাভ করেছে: উচ্চস্তরের এজেন্টগুলি সংযোজ্য দক্ষতা ব্যবহার করে কাজগুলির বিভাজন, টুল কল এবং ডাইনামিক পরিকল্পনা করতে পারে, যা প্রাচীন স্তরবদ্ধ পদ্ধতির সাধারণীকরণ ক্ষমতা এবং অভিযোজনক্ষমতা উল্লেখযোগ্যভাবে বৃদ্ধি করে। ফলস্বরূপ, শিক্ষাগত সম্প্রদায়টি আবারও মনোযোগ দিচ্ছে, এবং শক্তিশালীভাবে সাধারণীকরণকারী উচ্চস্তরের যুক্তি এবং বিষম নিম্নস্তরের নীতির সংমিশ্রণকে কীভাবে অন্তর্ভুক্ত করা যায়, তা অনুসন্ধানের দিকে এগিয়েছে।

এই নিবন্ধের লেখকগুলি কানাডার পূর্বাঞ্চলের বিভিন্ন বিশ্ববিদ্যালয় এবং গবেষণা প্রতিষ্ঠান থেকে এসেছেন। লেখক লক্ষ্য করেছেন যে, উত্তর আমেরিকার রোবোটিক্স গবেষণায় দীর্ঘদিন ধরে দুটি স্পষ্ট শিক্ষাগত উৎস সম্পন্ন প্রযুক্তিগত পথ বিদ্যমান: যেখানে মার্কিন পশ্চিম তীর, স্ট্যানফোর্ড, বার্কলি ইত্যাদির প্রতিনিধিত্ব করে, সেখানে learning এবং scaling-এর উপর বেশি জোর দেওয়া হয়, যা এন্ড-টু-এন্ড শিক্ষা, ডেটা স্কেল এবং মডেলের সাধারণীকরণের দিকে মনোযোগ দেয়; অন্যদিকে, মার্কিন উত্তর-পূর্ব এবং কানাডা, MIT, টরন্টো বিশ্ববিদ্যালয়, MILA ইত্যাদির প্রতিনিধিত্বে, দীর্ঘদিন ধরে স্তরবদ্ধ আর্কিটেকচার, সিম্বলিক রিজনিং, লজিক্যাল প্ল্যানিং এবং স্ট্রাকচারড ডিসিশন-এর উপর বেশি গুরুত্ব দেওয়া হয়।

রোবোহারনেসের লেখকদের এই ধারার পরবর্তী অংশে অবস্থান করছে।

একটি শরীরবাদী বুদ্ধিমত্তার প্রযুক্তিগত পথের বিভাজন শিল্পে স্পষ্ট ছাপ রেখেছে। গত কয়েক বছরে দ্রুত বিকাশ লাভকারী দলগুলি ধীরে ধীরে foundation model scaling থেকে agentic hierarchy পর্যন্ত একটি প্রযুক্তিগত পরিসর গড়ে তুলেছে: একটি দল সাধারণ শরীরবাদী ফাউন্ডেশন মডেল, VLA এবং world model-এর উপর বেশি জোর দেয়, একক মডেল, ডেটা আকার এবং মডেল ক্ষমতা বৃদ্ধির মাধ্যমে সাধারণীকরণের সীমানা নিয়মিতভাবে প্রসারিত করে; অন্যদিকে, অন্য একটি দল পুনঃব্যবহারযোগ্য অপারেশনাল দক্ষতা এবং স্তরবদ্ধ আর্কিটেকচারের উপর বেশি জোর দেয়, যা কাজের পরিকল্পনা, দক্ষতা সংমিশ্রণ এবং নিম্নস্তরের নিয়ন্ত্রণের সমন্বয়ের মাধ্যমে জটিল কাজগুলি সম্পন্ন করে। চীনে, Zhiyuan-এর মতো দলগুলি প্রথমটির কাছাকাছি, যখন Sudo Tech, Magic Atom-এর মতোদলগুলি দ্বিতীয়টির উপর বেশি জোর দেয়; বিদেশে, Physical Intelligence-এর pi-সিরিজ long-term scaling-এর পথকে প্রতিনিধিত্ব করেছে, while Gemini Robotics, “উচ্চস্তরের推理এবংপরিকল্পনা +নিম্নস্তরেরদক্ষতারঅনুষ্ঠান”-এরস্তরবদ্ধপ্রচলনকেঅনুসরণকরছে।

আকর্ষণীয় বিষয় হলো, এই প্রযুক্তিগত বংশাবলীর বিভাজন স্থির বিপরীতধর্মী নয়, বরং এটি পরিপূরকভাবে বিকশিত হচ্ছে। গত কয়েক মাসে, দুটি প্রযুক্তিগত পথের মধ্যে স্পষ্ট একীভবনের লক্ষণ দেখা যাচ্ছে। উদাহরণস্বরূপ, Physical Intelligence pi0.7-এ নিয়ন্ত্রণযোগ্যতা এবং দক্ষতা সমন্বয়কে আরও কেন্দ্রীয় ভূমিকায় স্থান দিয়েছে; একইসাথে, NVIDIA-এর মতো দলগুলি ক্রমাগতভাবে আরও স্তরবদ্ধ robot agentic systems চালু করছে, যেগুলিতে মৌলিক মডেলের বুঝতে এবং যুক্তি দিয়েছে VLA-এর সাথে যুক্ত। সামগ্রিকভাবে, foundation model scaling এবং agentic hierarchy ধীরে ধীরে দুটি আপেক্ষিকভাবে স্বাধীন প্রযুক্তিগত পথ থেকে একই রোবট সিস্টেমের মধ্যে পরিপূরক ক্ষমতায় রূপান্তরিত হচ্ছে।

05 পরিকল্পনার মাধ্যমে আরও সাধারণ বুদ্ধিমত্তার দিকে এগিয়ে যান

RoboHarness-এর নিজস্ব সীমাবদ্ধতা রয়েছে: এটি শুধুমাত্র ইতিমধ্যে বিদ্যমান কৌশলগুলির সমন্বয় করতে পারে, সমস্ত কৌশলই যা করতে পারে না তা সমাধান করতে পারে না। Memory Bridge-এর বিশ্বস্ততা যথেষ্ট ইতিহাসগত বাস্তবায়ন ডেটার উপর নির্ভর করে, এবং নতুনভাবে যোগ করা কৌশলগুলির প্রাথমিক পর্যায়ে ক্ষমতা মূল্যায়নে বড় অনিশ্চয়তা থাকে।

প্রবন্ধের মূল যুক্তি হল একক বড় মডেলের প্রয়োজনীয়তাকে অস্বীকার করা নয়।

লেখক বলেন যে, দীর্ঘকালীন কাজের সমন্বয় শুধুমাত্র বিদ্যমান ক্ষমতাগুলির সংমিশ্রণ নয়, এটি নিজেই এমন একটি ক্রস-ক্ষমতা এবং ক্রস-পরিস্থিতি বাস্তবায়ন ডেটা তৈরি করে যা একক মডেল স্বতন্ত্রভাবে অর্জন করতে পারে না। এই ডেটা বিভিন্ন কৌশলের মধ্যে স্যুইচিং, সংযোগ, ব্যর্থতা থেকে পুনরুদ্ধার এবং সহযোগিতার প্রক্রিয়াগুলি রেকর্ড করে, যা পরবর্তী প্রজন্মের সাধারণ রোবট মডেল প্রশিক্ষণের জন্য গুরুত্বপূর্ণ উৎস হতে পারে। এই ধারণার ভিত্তিতে, RoboHarness দলও মিশ্র কৌশল সমন্বয় এবং বাস্তবায়নের সময় উৎপন্ন ডেটা পুনরায় নিম্নস্তরের কৌশল প্রশিক্ষণের জন্য ব্যবহারের দিকে অগ্রসর হচ্ছে, যা বিষম সমন্বয়ের বাস্তবায়নের অভিজ্ঞতা মডেলের মৌলিক ক্ষমতা উন্নয়নের জন্য আবারও ফিরে আসছে।

সবচেয়ে শক্তিশালী মডেল খোঁজা থেকে সবচেয়ে উপযুক্ত ক্ষমতা সংগঠন পর্যন্ত, এমবডিড ইন্টেলিজেন্সের প্রতিযোগিতা ধীরে ধীরে সিস্টেম লেভেলের ডিজাইনে বিস্তৃত হচ্ছে। হেটারোজিনিয়াস স্ট্র্যাটেজি অর্কেস্ট্রেশন এবং ইউনিফাইড লার্জ মডেল, দুটি ভিন্ন পাহাড়ের শীর্ষে পথ চলা এর মতো, যা চূড়ান্তভাবে একই দূরবর্তী লক্ষ্যের দিকে নিয়ে যায়: রোবটগুলিকে আরও সাধারণ এবং বেশি বিশ্বস্ত বুদ্ধিমত্তা দেওয়া।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।