PolicyTrim পুনর্প্রশিক্ষণ ছাড়াই VLA রোবটের দক্ষতা 5.83x বাড়িয়েছে

icon MarsBit
শেয়ার
AI summary iconসারাংশ
মার্সবিটের প্রতিবেদন অনুযায়ী, পলিসিট্রিম পুনর্প্রশিক্ষণ ছাড়াই ভিএলএ রোবটের দক্ষতা 5.83 গুণ বাড়িয়ে দেয়। এই ফ্রেমওয়ার্কটি অপ্রয়োজনীয় ধাপগুলি কেটে ফেলে এবং নির্ভরযোগ্য কার্যক্রমের ধারাবাহিকতা বাড়িয়ে কার্যক্রমের গুণগত মান উন্নত করে। এটি LIBERO Object/π0.5-এর মতো কাজগুলিতে 98% সফলতার হার অর্জন করে। পলিসিট্রিম দুটি পর্যায়ে কাজ করে: নির্ভরযোগ্য কার্যগুলি বিস্তারিত করা এবং ভৌত ধাপগুলি সংকুচিত করা। বিদ্যমান ভিএলএ মডেলগুলির জন্য একটি খরচ-কার্যকরী আপগ্রেড প্রদানের মাধ্যমে, এই পদ্ধতিটি CFT এবং MiCA সঙ্গতির লক্ষ্যগুলির সাথে সঙ্গতিপূর্ণ। নতুন ডেটা সংগ্রহ বা পুনর্প্রশিক্ষণের প্রয়োজন হয় না।

[পরিচিতি] VLA মডেল এখন কাজ করতে পারে, কিন্তু বাস্তব রোবট এখনও ধীর! PolicyTrim হল একটি VLA রোবটের কার্যক্ষমতা অপ্টিমাইজ করার পদ্ধতি, যা পুনর্প্রশিক্ষণের প্রয়োজন ছাড়াই বিশ্বস্ত কার্যক্রমের ধারাকে প্রসারিত করে এবং অপ্রয়োজনীয় ধাপগুলি কমিয়ে রোবটকে কাজটি আরও সরাসরি সম্পন্ন করতে সাহায্য করে, যার ফলে সামগ্রিক গতি বৃদ্ধি পায়।

ভিজন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেল ভিজুয়াল অবজারভেশন, ভাষাগত নির্দেশ এবং রোবট অ্যাকশনকে একটি পলিসি মডেলে একীভূত করে, যার ফলে রোবট প্রাকৃতিক ভাষার মাধ্যমে জটিল অপারেশন কাজগুলি সম্পন্ন করতে পারে।

OpenVLA, OpenVLA-OFT থেকে π0.5, GR00T পর্যন্ত, এই মডেলগুলি বডি-এমবুডিড ইন্টেলিজেন্সের একটি গুরুত্বপূর্ণ প্রযুক্তিগত পথ হয়ে উঠছে।

কিন্তু যখন VLA মডেল প্রকৃতপক্ষে রোবটে ডিপ্লয় করা হয়, তখন একটি গুরুত্বপূর্ণ বাধা তাৎক্ষণিকভাবে প্রকাশ পায়: রোবট কাজটি সম্পন্ন করতে মোট সময় শুধুমাত্র প্রতিটি ইনফারেন্স কতটা দ্রুত হয় তার উপর নির্ভর করে না, বরং কতবার স্ট্র্যাটেজি ইনফারেন্স এবং কতগুলি বাস্তব ভৌত ক্রিয়াকলাপ প্রয়োজন হয় তারও উপর।

রোবট

একই টাস্কের বহুবার রোলআউটে, ভিএলএ মডেলের কার্যক্রমের ধাপের সংখ্যায় উল্লেখযোগ্য পরিবর্তন দেখা যায়, যা নির্দেশ করে যে সফলতার জন্য সংক্ষিপ্ত ও সরাসরি পথগুলি অর্জনযোগ্য, কিন্তু বর্তমান কৌশলগুলি প্রায়শই এগুলি দৈবভাবেই খুঁজে পায়।

ক্রিয়া চাঙ্কের শেষাংশ অবিশ্বস্ত: মডেল একসাথে একাধিক ক্রিয়া পূর্বানুমান করে, কিন্তু পিছনের ক্রিয়াগুলির ত্রুটি সঞ্চয় হওয়ার সম্ভাবনা বেশি, ফলে সিস্টেমকে প্রায়শই পুনর্নকশা করতে হয়। ক্রিয়ার দৈর্ঘ্য জোর করে বাড়ানো সফলতার হার কমিয়ে দেয় এবং ভৌত পদক্ষেপের সংখ্যা বাড়ায়।

অত্যধিক শারীরিক ক্রিয়াকলাপ: যদিও কাজটি চূড়ান্তভাবে সফল হয়, তবুও ট্রাজেক্টরিতে অসংখ্য সংশোধন, পিছনে ফিরে আসা এবং পুনরাবৃত্তির ক্রিয়াকলাপ থাকতে পারে।

অতএব, VLA ডিপ্লয়মেন্ট দক্ষতা শুধুমাত্র প্রতিটি ধাপের ইনফারেন্স ল্যাটেন্সি দেখে নয়, বরং পলিসি দক্ষতা (policy efficiency) দেখে: একটি পূর্বানুমানে কতগুলি ক্রিয়াকে নিরাপদে বাস্তবায়ন করা যায়? কাজটি সম্পন্ন করতে মোট কতগুলি বাস্তব ভৌত ধাপ প্রয়োজন?

পূর্ববর্তী পদ্ধতিগুলি প্রায়শই গণনামূলক দিক থেকে শুরু হয়, যেমন দৃশ্যমান টোকেন কাটিয়ে ফেলা, কোয়ান্টাইজেশন, KV-ক্যাশে পুনর্ব্যবহার, ডিস্টিলেশন বা ইনফারেন্স ইঞ্জিন অপ্টিমাইজেশন। এই পদ্ধতিগুলি একক ইনফারেন্স ল্যাটেন্সি কমাতে পারে, কিন্তু যদি কৌশলটি এখনও অসংখ্য অপ্রয়োজনীয় ভৌত ধাপ প্রয়োজন করে, তবে বাস্তব কাজের সময় এখনও দীর্ঘ থাকে।

দীর্ঘ অ্যাকশন চাঙ্ক সরাসরি ফিক্সড এক্সিকিউশনও বিশ্বস্ত নয়।

পেপারের পরীক্ষাগুলি দেখায় যে, ক্রিয়ার দৈর্ঘ্য বাড়ানোর সাথে সাথে সাফল্যের হার হ্রাস পেতে পারে এবং ভৌত পদক্ষেপের সংখ্যা বৃদ্ধি পেতে পারে। এটি নির্দেশ করে যে কম মানের শেষ পূর্বানুমান ত্রুটিগুলিকে ভৌত বিশ্বে প্রবেশ করায়, যার ফলে রোবটকে আরও বেশি সংশোধনমূলক ক্রিয়াকলাপ করতে হয়।

প্রধান প্রশ্ন: কি সম্ভব যে একটি বিদ্যমান VLA কৌশলকে পোস্ট-ট্রেনিংয়ের মাধ্যমে স্বয়ংক্রিয়ভাবে শেখানো যায় যেন এটি কাজের সফলতার হার কমানোর ঝুঁকি না নিয়ে কম ভৌত পদক্ষেপে কাজটি সম্পন্ন করতে পারে?

সিচুয়ান বিশ্ববিদ্যালয়ের প্রফেসর লেই ইনজিয়ের নেতৃত্বে দলটি PolicyTrim প্রস্তাব করেছে—একটি কৌশল দক্ষতার জন্য তৈরি দুই-পর্যায়ের শক্তিশালী শিক্ষা পরবর্তী প্রশিক্ষণ কাঠামো। এটি VLA আর্কিটেকচারকে পরিবর্তন করে না এবং বিশেষজ্ঞ ডেটা পুনরায় সংগ্রহ করে না, বরং ইতিমধ্যে প্রশিক্ষিত কৌশলের উপর ভিত্তি করে রোবটের বাস্তব কার্যক্রমকে আরও অপটিমাইজ করে।

রোবট

প্রকল্পের হোমপেজ: https://inceptionwang.github.io/PolicyTrim/

পেপার লিঙ্ক: https://arxiv.org/abs/2606.22540

কোড লিঙ্ক: https://github.com/INCEPTIONwang/PolicyTrim

মডেল লিঙ্ক: https://huggingface.co/INCEPTIONwang/PolicyTrim

নতুন পদ্ধতিটি বাস্তবায়িত হয়েছে:

  • 3× অ্যাকশন চাঙ্ক ব্যবহার, দীর্ঘতর হরাইজনে নির্ভরযোগ্য বাস্তবায়ন;
  • 51.4% শারীরিক পদক্ষেপ কমানো হয়েছে, অপ্রয়োজনীয় সংশোধন ক্রিয়াগুলি সংকুচিত করা হয়েছে;
  • 5.83× প্রান্ত থেকে প্রান্তে সর্বোচ্চ গতিবৃদ্ধি, LIBERO Object/π0.5;

আরও দ্রুত গণনা করা থেকে আরও দ্রুত কাজ করা

PolicyTrim-এর মূল লক্ষ্য হল গণনা পাশের ত্বরণকে প্রতিস্থাপন করা নয়, বরং অন্য একটি উপেক্ষিত দিক পূরণ করা: কাজ সম্পন্ন করতে প্রয়োজনীয় ফরওয়ার্ড ইনফারেন্সের সংখ্যা কমানো। এটি নীতির দক্ষতাকে দুটি অপটিমাইজেশনযোগ্য লক্ষ্যে বিভক্ত করে: প্রথমে নির্ভরযোগ্য অ্যাকশন চাঙ্কগুলি বিস্তার করুন, তারপর অপ্রয়োজনীয় ভৌত ধাপগুলি সংকুচিত করুন।

রোবট

1. রিলায়াবল অ্যাকশন চাঙ্ক এক্সটেনশন (Reliable Action Chunk Extension)

বর্তমানে অনেক VLA কৌশল ক্রিয়া চাঙ্কের মাধ্যমে ক্রিয়া অনুক্রম আউটপুট দেয়, তবে বাস্তবায়নের সময় প্রায়শই শুধু প্রথম কয়েকটি পদক্ষেপই করা হয়। PolicyTrim-এর প্রথম পর্যায়ে ডাইনামিক এক্সিকিউশন হরাইজন এক্সপ্লোরেশন ব্যবহার করা হয়: একই সেটের রোলআউটকে ভিন্ন ভিন্ন গ্রহণযোগ্যতা অনুপাত দেওয়া হয়, যাতে মডেলটি সংক্ষিপ্ত, মধ্যম এবং দীর্ঘ উইন্ডোতে সমান্তরালভাবে নির্ভরযোগ্য সীমানা অনুসন্ধান করতে পারে।

সফলভাবে টাস্ক সম্পন্ন করা এবং দীর্ঘতর একেকটি উইন্ডোতে কাজ করা বেশি রিওয়ার্ড পায়, যা মডেলকে আগের অবিশ্বস্ত চাঙ্ক শেষের অ্যাকশনগুলিকে আরও ব্যবহারযোগ্য করে তোলার প্রোত্সাহন দেয়।

হরাইজন রিওয়ার্ড শুধুমাত্র গ্রুপের ভিতরে সফল ট্র্যাজেক্টরি দেখা গেলে সক্রিয় হয়, যাতে মডেলটি ব্যর্থতার ক্ষেত্রে অনিয়ন্ত্রিতভাবে দীর্ঘতর চাঙ্ক দৈর্ঘ্যের দিকে আকৃষ্ট না হয়।

2. অতিরিক্ত সংবেদনশীল পদক্ষেপ হ্রাস (Redundancy-Aware Step Reduction)

যখন বিশ্বস্ত হরাইজন প্রসারিত হয়, তখন দ্বিতীয় পর্যায়ে মোট ভৌত পদক্ষেপ আরও কমে। PolicyTrim পদক্ষেপ-সঞ্চয়ী পুরস্কার চালু করে: সফল ট্রাজেক্টরি যত কম পদক্ষেপে কাজ সম্পন্ন করে, পুরস্কার তত বেশি।

step-saving reward কে সরাসরি অপ্টিমাইজেশন লক্ষ্যে “সংক্ষিপ্ত এবং সরাসরি সাফল্যের পথ” হিসাবে লিখুন।

গ্রুপ-অ্যাঙ্কর্ড নিয়মিতকরণ অনুপস্থিত স্পেকুলেটিভ শর্টকাটকে নিয়ন্ত্রণ করে, যাতে মডেলটি শুধুমাত্র সংক্ষিপ্ত পথের দিকে ঝুঁকে পড়ে সাফল্যের হারকে ক্ষতি না করে।

দুই পর্যায়ের ক্রমিক অপ্টিমাইজেশন দ্বারা «চাঙ্ক বাড়ানো» এবং «পদক্ষেপ কমানো» এই দুটি লক্ষ্যের মধ্যে পারস্পরিক হস্তক্ষেপ এড়ানো যায়, যার ফলে কাজ সম্পন্ন করতে প্রয়োজনীয় ফরওয়ার্ড ইনফারেন্সের সংখ্যা কমে।

পরীক্ষার ফলাফল

PolicyTrim কে LIBERO, ManiSkill, Meta-World এবং বাস্তব রোবট টাস্কে যাচাই করা হয়েছে এবং π0.5, OpenVLA-OFT, GR00T সহ বিভিন্ন VLA আর্কিটেকচারকে কভার করেছে। সামগ্রিক ফলাফলগুলি দেখায় যে, PolicyTrim কার্যসফলতা স্থির রেখে কার্যক্ষমতা উল্লেখযোগ্যভাবে বৃদ্ধি করে।

LIBERO-এ, π0.5 প্রাপ্ত হয় সর্বোচ্চ 5.83 গুণ এন্ড-টু-এন্ড গতিবৃদ্ধি, যখন সফলতার হার 98% এর বেশি ধরে রাখে।

ক্রস-বেঞ্চমার্ক ফলাফল অনুযায়ী, PolicyTrim ম্যানিস্কিলে সর্বোচ্চ 2.36 গুণ গতিবৃদ্ধি এবং মেটা-ওয়ার্ল্ডে 2.52 গুণ গতিবৃদ্ধি অর্জন করেছে।

ক্রস-আর্কিটেকচার ফলাফলগুলি দেখায় যে, পুরো দুই-পর্যায় প্রক্রিয়া ব্যবহার করে পুনঃপ্রশিক্ষিত OpenVLA-OFT 2.97x গতিবৃদ্ধি অর্জন করে; শুধুমাত্র দ্বিতীয় পর্যায় ব্যবহার করে OpenVLA 1.41x গতিবৃদ্ধি অর্জন করে।

রোবট

গুণগত তুলনা: কম পথভ্রমণ, সরাসরি ট্র্যাজেক্টরি

র‍্যান্ডম স্যাম্পলড LIBERO টাস্কগুলিতে, বেসলাইন প্রায়শই অপ্রয়োজনীয় সংশোধন ক্রিয়া এবং লক্ষ্যের কাছাকাছি হেসিটেশন/জিটারিং দেখায়; PolicyTrim-এর ট্রাজেক্টরি আরও স্মুথ এবং সরাসরি, একই টাস্কটি কম ফিজিক্যাল স্টেপে সম্পন্ন করতে পারে, সাধারণত ফিজিক্যাল স্টেপগুলিকে প্রায় অর্ধেকে কমিয়ে আনে।

রোবট

বাস্তব রোবট বাস্তবায়ন: সিমুলেশনে দক্ষতা লাভ পদার্থ জগতে স্থানান্তরিত হতে পারে

পেপারটি দুটি Intel RealSense D435i ক্যামেরা সহ Agilex Piper রোবট আর্মে বাস্তব রোবট কাজ, যেমন FlipMug, HangMug, TapeBox তিনটি কাজ পরীক্ষা করে। পরীক্ষাগুলি স্থির লক্ষ্য অবস্থানের স্ট্যান্ডার্ড সেটিং এবং ধরে রাখার প্রক্রিয়ায় লক্ষ্যের উপর র‍্যান্ডম বিক্ষিপ্ততা সহ ডায়নামিক সেটিং কভার করে।

PolicyTrim স্ট্যান্ডার্ড সেটিং এবং ডায়নামিক পার্টারবেশন সেটিং উভয়ের ক্ষেত্রেই সফলতার হার বজায় রাখে বা বাড়ায়, একইসাথে বাস্তব বাস্তবায়ন সময় উল্লেখযোগ্যভাবে কমিয়ে দেয়। স্ট্যান্ডার্ড বাস্তব রোবট সেটিংয়ে, গড়ে এন্ড-টু-এন্ড 1.86 গুণ ত্বরণ অর্জন করা হয়।

রোবট

রোবট

পরীক্ষামূলক ফলাফল অনুযায়ী, PolicyTrim শুধুমাত্র বেঞ্চমার্ক সূচকগুলিকে অপ্টিমাইজ করে না: ভৌত রোবটে, কাজ সম্পন্নের সময় বেসলাইনের প্রায় অর্ধেকে নেমে আসে এবং গতিশীল বিঘ্নের পরিস্থিতিতেও স্থিতিশীলতা বজায় রাখে।

PolicyTrim কেন কাজ করে?

• স্ট্র্যাটেজির নিজস্ব দক্ষতা বৃদ্ধি: এটি শুধুমাত্র একক যুক্তিসঙ্গত বিলম্ব কমানোর পরিবর্তে অপ্রয়োজনীয় ক্রিয়া এবং অপ্রয়োজনীয় পুনর্নির্ধারণ কমায়।

• শুরু থেকে ট্রেন করার প্রয়োজন নেই: একটি পোস্ট-ট্রেনিং ফ্রেমওয়ার্ক হিসাবে, এটি বিদ্যমান VLA মডেলের উপর ভিত্তি করে আরও অপ্টিমাইজ করা যায়, যা ডেটা সংগ্রহ এবং ট্রেনিং খরচ কমায়।

• গতি এবং সফলতার হার উভয়কেই বিবেচনা করুন: নির্ভরযোগ্য হরিজন সম্প্রসারণ অজ্ঞাতভাবে chunk বাড়ানো এড়ায়, স্থিতিশীলতার সীমাবদ্ধতা ছোট পথের স্পেকুলেশন এড়ায়।

• কম্পিউটেশনাল অ্যাক্সেলারেশনের সাথে সংযোজনযোগ্য: PolicyTrim ফরওয়ার্ড ইনফারেন্সের সংখ্যা অপ্টিমাইজ করে, VLA-Cache ইত্যাদি পদ্ধতি প্রতিটি ইনফারেন্সের সময় অপ্টিমাইজ করে, এই দুটি পথ অর্থোগোনাল এবং সংযুক্ত অ্যাক্সেলারেশন তৈরি করতে পারে।

পলিসিট্রিমের মূল বিষয় হল: ভিএলএ রোবটের জন্য, কার্যক্ষমতা শুধু দ্রুততর মডেল ইনফারেন্স থেকেই আসে না, বরং দক্ষ কৌশল আচরণ থেকেও আসে। রোবটকে "কম বাঁক খাওয়ানো" একইভাবে উল্লেখযোগ্য গতি বৃদ্ধি আনতে পারে।

প্রসঙ্গ: https://arxiv.org/abs/2606.22540

এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউ এআই" থেকে এসেছে, লেখক: নিউ এআই; সম্পাদক: LRST

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।