[পরিচিতি] VLA মডেল এখন কাজ করতে পারে, কিন্তু বাস্তব রোবট এখনও ধীর! PolicyTrim হল একটি VLA রোবটের কার্যক্ষমতা অপ্টিমাইজ করার পদ্ধতি, যা পুনর্প্রশিক্ষণের প্রয়োজন ছাড়াই বিশ্বস্ত কার্যক্রমের ধারাকে প্রসারিত করে এবং অপ্রয়োজনীয় ধাপগুলি কমিয়ে রোবটকে কাজটি আরও সরাসরি সম্পন্ন করতে সাহায্য করে, যার ফলে সামগ্রিক গতি বৃদ্ধি পায়।
ভিজন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ভিজুয়াল অবজারভেশন, ভাষাগত নির্দেশ এবং রোবট অ্যাকশনকে একটি পলিসি মডেলে একীভূত করে, যার ফলে রোবট প্রাকৃতিক ভাষার মাধ্যমে জটিল অপারেশন কাজগুলি সম্পন্ন করতে পারে।
OpenVLA, OpenVLA-OFT থেকে π0.5, GR00T পর্যন্ত, এই মডেলগুলি বডি-এমবুডিড ইন্টেলিজেন্সের একটি গুরুত্বপূর্ণ প্রযুক্তিগত পথ হয়ে উঠছে।
কিন্তু যখন VLA মডেল প্রকৃতপক্ষে রোবটে ডিপ্লয় করা হয়, তখন একটি গুরুত্বপূর্ণ বাধা তাৎক্ষণিকভাবে প্রকাশ পায়: রোবট কাজটি সম্পন্ন করতে মোট সময় শুধুমাত্র প্রতিটি ইনফারেন্স কতটা দ্রুত হয় তার উপর নির্ভর করে না, বরং কতবার স্ট্র্যাটেজি ইনফারেন্স এবং কতগুলি বাস্তব ভৌত ক্রিয়াকলাপ প্রয়োজন হয় তারও উপর।

একই টাস্কের বহুবার রোলআউটে, ভিএলএ মডেলের কার্যক্রমের ধাপের সংখ্যায় উল্লেখযোগ্য পরিবর্তন দেখা যায়, যা নির্দেশ করে যে সফলতার জন্য সংক্ষিপ্ত ও সরাসরি পথগুলি অর্জনযোগ্য, কিন্তু বর্তমান কৌশলগুলি প্রায়শই এগুলি দৈবভাবেই খুঁজে পায়।
ক্রিয়া চাঙ্কের শেষাংশ অবিশ্বস্ত: মডেল একসাথে একাধিক ক্রিয়া পূর্বানুমান করে, কিন্তু পিছনের ক্রিয়াগুলির ত্রুটি সঞ্চয় হওয়ার সম্ভাবনা বেশি, ফলে সিস্টেমকে প্রায়শই পুনর্নকশা করতে হয়। ক্রিয়ার দৈর্ঘ্য জোর করে বাড়ানো সফলতার হার কমিয়ে দেয় এবং ভৌত পদক্ষেপের সংখ্যা বাড়ায়।
অত্যধিক শারীরিক ক্রিয়াকলাপ: যদিও কাজটি চূড়ান্তভাবে সফল হয়, তবুও ট্রাজেক্টরিতে অসংখ্য সংশোধন, পিছনে ফিরে আসা এবং পুনরাবৃত্তির ক্রিয়াকলাপ থাকতে পারে।
অতএব, VLA ডিপ্লয়মেন্ট দক্ষতা শুধুমাত্র প্রতিটি ধাপের ইনফারেন্স ল্যাটেন্সি দেখে নয়, বরং পলিসি দক্ষতা (policy efficiency) দেখে: একটি পূর্বানুমানে কতগুলি ক্রিয়াকে নিরাপদে বাস্তবায়ন করা যায়? কাজটি সম্পন্ন করতে মোট কতগুলি বাস্তব ভৌত ধাপ প্রয়োজন?
পূর্ববর্তী পদ্ধতিগুলি প্রায়শই গণনামূলক দিক থেকে শুরু হয়, যেমন দৃশ্যমান টোকেন কাটিয়ে ফেলা, কোয়ান্টাইজেশন, KV-ক্যাশে পুনর্ব্যবহার, ডিস্টিলেশন বা ইনফারেন্স ইঞ্জিন অপ্টিমাইজেশন। এই পদ্ধতিগুলি একক ইনফারেন্স ল্যাটেন্সি কমাতে পারে, কিন্তু যদি কৌশলটি এখনও অসংখ্য অপ্রয়োজনীয় ভৌত ধাপ প্রয়োজন করে, তবে বাস্তব কাজের সময় এখনও দীর্ঘ থাকে।
দীর্ঘ অ্যাকশন চাঙ্ক সরাসরি ফিক্সড এক্সিকিউশনও বিশ্বস্ত নয়।
পেপারের পরীক্ষাগুলি দেখায় যে, ক্রিয়ার দৈর্ঘ্য বাড়ানোর সাথে সাথে সাফল্যের হার হ্রাস পেতে পারে এবং ভৌত পদক্ষেপের সংখ্যা বৃদ্ধি পেতে পারে। এটি নির্দেশ করে যে কম মানের শেষ পূর্বানুমান ত্রুটিগুলিকে ভৌত বিশ্বে প্রবেশ করায়, যার ফলে রোবটকে আরও বেশি সংশোধনমূলক ক্রিয়াকলাপ করতে হয়।
প্রধান প্রশ্ন: কি সম্ভব যে একটি বিদ্যমান VLA কৌশলকে পোস্ট-ট্রেনিংয়ের মাধ্যমে স্বয়ংক্রিয়ভাবে শেখানো যায় যেন এটি কাজের সফলতার হার কমানোর ঝুঁকি না নিয়ে কম ভৌত পদক্ষেপে কাজটি সম্পন্ন করতে পারে?
সিচুয়ান বিশ্ববিদ্যালয়ের প্রফেসর লেই ইনজিয়ের নেতৃত্বে দলটি PolicyTrim প্রস্তাব করেছে—একটি কৌশল দক্ষতার জন্য তৈরি দুই-পর্যায়ের শক্তিশালী শিক্ষা পরবর্তী প্রশিক্ষণ কাঠামো। এটি VLA আর্কিটেকচারকে পরিবর্তন করে না এবং বিশেষজ্ঞ ডেটা পুনরায় সংগ্রহ করে না, বরং ইতিমধ্যে প্রশিক্ষিত কৌশলের উপর ভিত্তি করে রোবটের বাস্তব কার্যক্রমকে আরও অপটিমাইজ করে।

প্রকল্পের হোমপেজ: https://inceptionwang.github.io/PolicyTrim/
পেপার লিঙ্ক: https://arxiv.org/abs/2606.22540
কোড লিঙ্ক: https://github.com/INCEPTIONwang/PolicyTrim
মডেল লিঙ্ক: https://huggingface.co/INCEPTIONwang/PolicyTrim
নতুন পদ্ধতিটি বাস্তবায়িত হয়েছে:
- 3× অ্যাকশন চাঙ্ক ব্যবহার, দীর্ঘতর হরাইজনে নির্ভরযোগ্য বাস্তবায়ন;
- 51.4% শারীরিক পদক্ষেপ কমানো হয়েছে, অপ্রয়োজনীয় সংশোধন ক্রিয়াগুলি সংকুচিত করা হয়েছে;
- 5.83× প্রান্ত থেকে প্রান্তে সর্বোচ্চ গতিবৃদ্ধি, LIBERO Object/π0.5;
আরও দ্রুত গণনা করা থেকে আরও দ্রুত কাজ করা
PolicyTrim-এর মূল লক্ষ্য হল গণনা পাশের ত্বরণকে প্রতিস্থাপন করা নয়, বরং অন্য একটি উপেক্ষিত দিক পূরণ করা: কাজ সম্পন্ন করতে প্রয়োজনীয় ফরওয়ার্ড ইনফারেন্সের সংখ্যা কমানো। এটি নীতির দক্ষতাকে দুটি অপটিমাইজেশনযোগ্য লক্ষ্যে বিভক্ত করে: প্রথমে নির্ভরযোগ্য অ্যাকশন চাঙ্কগুলি বিস্তার করুন, তারপর অপ্রয়োজনীয় ভৌত ধাপগুলি সংকুচিত করুন।

1. রিলায়াবল অ্যাকশন চাঙ্ক এক্সটেনশন (Reliable Action Chunk Extension)
বর্তমানে অনেক VLA কৌশল ক্রিয়া চাঙ্কের মাধ্যমে ক্রিয়া অনুক্রম আউটপুট দেয়, তবে বাস্তবায়নের সময় প্রায়শই শুধু প্রথম কয়েকটি পদক্ষেপই করা হয়। PolicyTrim-এর প্রথম পর্যায়ে ডাইনামিক এক্সিকিউশন হরাইজন এক্সপ্লোরেশন ব্যবহার করা হয়: একই সেটের রোলআউটকে ভিন্ন ভিন্ন গ্রহণযোগ্যতা অনুপাত দেওয়া হয়, যাতে মডেলটি সংক্ষিপ্ত, মধ্যম এবং দীর্ঘ উইন্ডোতে সমান্তরালভাবে নির্ভরযোগ্য সীমানা অনুসন্ধান করতে পারে।
সফলভাবে টাস্ক সম্পন্ন করা এবং দীর্ঘতর একেকটি উইন্ডোতে কাজ করা বেশি রিওয়ার্ড পায়, যা মডেলকে আগের অবিশ্বস্ত চাঙ্ক শেষের অ্যাকশনগুলিকে আরও ব্যবহারযোগ্য করে তোলার প্রোত্সাহন দেয়।
হরাইজন রিওয়ার্ড শুধুমাত্র গ্রুপের ভিতরে সফল ট্র্যাজেক্টরি দেখা গেলে সক্রিয় হয়, যাতে মডেলটি ব্যর্থতার ক্ষেত্রে অনিয়ন্ত্রিতভাবে দীর্ঘতর চাঙ্ক দৈর্ঘ্যের দিকে আকৃষ্ট না হয়।
2. অতিরিক্ত সংবেদনশীল পদক্ষেপ হ্রাস (Redundancy-Aware Step Reduction)
যখন বিশ্বস্ত হরাইজন প্রসারিত হয়, তখন দ্বিতীয় পর্যায়ে মোট ভৌত পদক্ষেপ আরও কমে। PolicyTrim পদক্ষেপ-সঞ্চয়ী পুরস্কার চালু করে: সফল ট্রাজেক্টরি যত কম পদক্ষেপে কাজ সম্পন্ন করে, পুরস্কার তত বেশি।
step-saving reward কে সরাসরি অপ্টিমাইজেশন লক্ষ্যে “সংক্ষিপ্ত এবং সরাসরি সাফল্যের পথ” হিসাবে লিখুন।
গ্রুপ-অ্যাঙ্কর্ড নিয়মিতকরণ অনুপস্থিত স্পেকুলেটিভ শর্টকাটকে নিয়ন্ত্রণ করে, যাতে মডেলটি শুধুমাত্র সংক্ষিপ্ত পথের দিকে ঝুঁকে পড়ে সাফল্যের হারকে ক্ষতি না করে।
দুই পর্যায়ের ক্রমিক অপ্টিমাইজেশন দ্বারা «চাঙ্ক বাড়ানো» এবং «পদক্ষেপ কমানো» এই দুটি লক্ষ্যের মধ্যে পারস্পরিক হস্তক্ষেপ এড়ানো যায়, যার ফলে কাজ সম্পন্ন করতে প্রয়োজনীয় ফরওয়ার্ড ইনফারেন্সের সংখ্যা কমে।
পরীক্ষার ফলাফল
PolicyTrim কে LIBERO, ManiSkill, Meta-World এবং বাস্তব রোবট টাস্কে যাচাই করা হয়েছে এবং π0.5, OpenVLA-OFT, GR00T সহ বিভিন্ন VLA আর্কিটেকচারকে কভার করেছে। সামগ্রিক ফলাফলগুলি দেখায় যে, PolicyTrim কার্যসফলতা স্থির রেখে কার্যক্ষমতা উল্লেখযোগ্যভাবে বৃদ্ধি করে।
LIBERO-এ, π0.5 প্রাপ্ত হয় সর্বোচ্চ 5.83 গুণ এন্ড-টু-এন্ড গতিবৃদ্ধি, যখন সফলতার হার 98% এর বেশি ধরে রাখে।
ক্রস-বেঞ্চমার্ক ফলাফল অনুযায়ী, PolicyTrim ম্যানিস্কিলে সর্বোচ্চ 2.36 গুণ গতিবৃদ্ধি এবং মেটা-ওয়ার্ল্ডে 2.52 গুণ গতিবৃদ্ধি অর্জন করেছে।
ক্রস-আর্কিটেকচার ফলাফলগুলি দেখায় যে, পুরো দুই-পর্যায় প্রক্রিয়া ব্যবহার করে পুনঃপ্রশিক্ষিত OpenVLA-OFT 2.97x গতিবৃদ্ধি অর্জন করে; শুধুমাত্র দ্বিতীয় পর্যায় ব্যবহার করে OpenVLA 1.41x গতিবৃদ্ধি অর্জন করে।

গুণগত তুলনা: কম পথভ্রমণ, সরাসরি ট্র্যাজেক্টরি
র্যান্ডম স্যাম্পলড LIBERO টাস্কগুলিতে, বেসলাইন প্রায়শই অপ্রয়োজনীয় সংশোধন ক্রিয়া এবং লক্ষ্যের কাছাকাছি হেসিটেশন/জিটারিং দেখায়; PolicyTrim-এর ট্রাজেক্টরি আরও স্মুথ এবং সরাসরি, একই টাস্কটি কম ফিজিক্যাল স্টেপে সম্পন্ন করতে পারে, সাধারণত ফিজিক্যাল স্টেপগুলিকে প্রায় অর্ধেকে কমিয়ে আনে।

বাস্তব রোবট বাস্তবায়ন: সিমুলেশনে দক্ষতা লাভ পদার্থ জগতে স্থানান্তরিত হতে পারে
পেপারটি দুটি Intel RealSense D435i ক্যামেরা সহ Agilex Piper রোবট আর্মে বাস্তব রোবট কাজ, যেমন FlipMug, HangMug, TapeBox তিনটি কাজ পরীক্ষা করে। পরীক্ষাগুলি স্থির লক্ষ্য অবস্থানের স্ট্যান্ডার্ড সেটিং এবং ধরে রাখার প্রক্রিয়ায় লক্ষ্যের উপর র্যান্ডম বিক্ষিপ্ততা সহ ডায়নামিক সেটিং কভার করে।
PolicyTrim স্ট্যান্ডার্ড সেটিং এবং ডায়নামিক পার্টারবেশন সেটিং উভয়ের ক্ষেত্রেই সফলতার হার বজায় রাখে বা বাড়ায়, একইসাথে বাস্তব বাস্তবায়ন সময় উল্লেখযোগ্যভাবে কমিয়ে দেয়। স্ট্যান্ডার্ড বাস্তব রোবট সেটিংয়ে, গড়ে এন্ড-টু-এন্ড 1.86 গুণ ত্বরণ অর্জন করা হয়।


পরীক্ষামূলক ফলাফল অনুযায়ী, PolicyTrim শুধুমাত্র বেঞ্চমার্ক সূচকগুলিকে অপ্টিমাইজ করে না: ভৌত রোবটে, কাজ সম্পন্নের সময় বেসলাইনের প্রায় অর্ধেকে নেমে আসে এবং গতিশীল বিঘ্নের পরিস্থিতিতেও স্থিতিশীলতা বজায় রাখে।
PolicyTrim কেন কাজ করে?
• স্ট্র্যাটেজির নিজস্ব দক্ষতা বৃদ্ধি: এটি শুধুমাত্র একক যুক্তিসঙ্গত বিলম্ব কমানোর পরিবর্তে অপ্রয়োজনীয় ক্রিয়া এবং অপ্রয়োজনীয় পুনর্নির্ধারণ কমায়।
• শুরু থেকে ট্রেন করার প্রয়োজন নেই: একটি পোস্ট-ট্রেনিং ফ্রেমওয়ার্ক হিসাবে, এটি বিদ্যমান VLA মডেলের উপর ভিত্তি করে আরও অপ্টিমাইজ করা যায়, যা ডেটা সংগ্রহ এবং ট্রেনিং খরচ কমায়।
• গতি এবং সফলতার হার উভয়কেই বিবেচনা করুন: নির্ভরযোগ্য হরিজন সম্প্রসারণ অজ্ঞাতভাবে chunk বাড়ানো এড়ায়, স্থিতিশীলতার সীমাবদ্ধতা ছোট পথের স্পেকুলেশন এড়ায়।
• কম্পিউটেশনাল অ্যাক্সেলারেশনের সাথে সংযোজনযোগ্য: PolicyTrim ফরওয়ার্ড ইনফারেন্সের সংখ্যা অপ্টিমাইজ করে, VLA-Cache ইত্যাদি পদ্ধতি প্রতিটি ইনফারেন্সের সময় অপ্টিমাইজ করে, এই দুটি পথ অর্থোগোনাল এবং সংযুক্ত অ্যাক্সেলারেশন তৈরি করতে পারে।
পলিসিট্রিমের মূল বিষয় হল: ভিএলএ রোবটের জন্য, কার্যক্ষমতা শুধু দ্রুততর মডেল ইনফারেন্স থেকেই আসে না, বরং দক্ষ কৌশল আচরণ থেকেও আসে। রোবটকে "কম বাঁক খাওয়ানো" একইভাবে উল্লেখযোগ্য গতি বৃদ্ধি আনতে পারে।
প্রসঙ্গ: https://arxiv.org/abs/2606.22540
এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউ এআই" থেকে এসেছে, লেখক: নিউ এআই; সম্পাদক: LRST
