پالیسی ٹرِم نے ری ٹریننگ کیے بغیر VLA روبوٹ کی کارکردگی 5.83 گنا بڑھا دی ہے

icon MarsBit
بانٹیں
AI summary iconخلاصہ
مارس بٹ کی رپورٹ کے مطابق، پالیسی ٹرائم بے ری ٹریننگ کے ساتھ VLA روبوٹ کی کارکردگی کو 5.83 گنا بڑھاتا ہے۔ یہ فریم ورک غیر ضروری مراحل کو کم کرکے اور قابل اعتماد ایکشن سیکوئنسز کو وسعت دے کر انجام دینے میں بہتری لاتا ہے۔ یہ LIBERO Object/π0.5 جیسے کاموں میں 98% کامیابی کی شرح حاصل کرتا ہے۔ پالیسی ٹرائم دو مراحل میں کام کرتا ہے: قابل اعتماد ایکشنز کو وسعت دینا اور فزیکل مراحل کو دبانا۔ یہ طریقہ موجودہ VLA ماڈلز کے لیے ایک لاگت سے بچنے والا اپ گریڈ فراہم کرکے CFT اور MiCA کے مطابقت کے مقاصد کے ساتھ مماثلت رکھتا ہے۔ نئے ڈیٹا کی جمع کاری یا دوبارہ ٹریننگ کی ضرورت نہیں۔

[ہدایت] VLA ماڈل اب کام کر سکتا ہے، لیکن اصل روبوٹ اب بھی سست ہیں! PolicyTrim VLA روبوٹ کی انجام دہی کی کارکردگی کو بہتر بنانے کا ایک طریقہ ہے، جس میں دوبارہ تربیت کی ضرورت نہیں۔ یہ قابل اعتماد اقدامات کے سلسلے کو وسعت دے کر اور زائد مراحل کو کم کر کے روبوٹ کو کام کو زیادہ مستقیم طریقے سے مکمل کرنے میں مدد کرتا ہے اور مجموعی رفتار میں اضافہ کرتا ہے۔

ویژن-زبان-ایکشن (VLA) ماڈل ویژنل مشاہدات، زبانی ہدایات اور روبوٹی حرکات کو ایک ہی پالیسی ماڈل میں اکٹھا کرتا ہے، جس سے روبوٹ قدرتی زبان کے ذریعے پیچیدہ آپریشنل کاموں کو پورا کر سکتا ہے۔

اوپن ویل ای، اوپن ویل-اوافٹ سے لے کر پائی 0.5 اور جی آر 00ٹ تک، اس قسم کے ماڈلز جسمانی ذہانت کی اہم ٹیکنالوجی کے طور پر بن رہے ہیں۔

لیکن جب VLA ماڈل کو روبوٹ پر حقیقی طور پر ڈیپلوی کیا جاتا ہے، تو ایک اہم瓶颈 فوراً سامنے آ جاتا ہے: روبوٹ کے کام مکمل کرنے کا کل وقت صرف ہر انفریس کی تیزی پر منحصر نہیں ہوتا، بلکہ اس پر بھی منحصر ہوتا ہے کہ اسٹریٹجی کو کتنی بار انفریس کرنے اور کتنے حقیقی فزیکل ایکشنز کرنے پڑتے ہیں۔

روبوٹ

ایک ہی کام کے متعدد رول آؤٹس میں، VLA ماڈل کے انجام دیے جانے والے اسٹیپس میں نمایاں تبدیلیاں ہوتی ہیں، جس سے یہ ظاہر ہوتا ہے کہ مختصر اور براہ راست کامیاب راستے حاصل کردہ ہیں، لیکن موجودہ حکمت عملی اکثر صرف صدفی طور پر ان تک پہنچ پاتی ہے۔

عمل چنک کے آخر میں بھروسہ نہیں کیا جا سکتا: ماڈل ایک بار میں متعدد ایکشنز کا پیش گوئی کرتا ہے، لیکن جتنے زیادہ آخری ایکشنز ہوتے ہیں، اُن میں خطأ کا جمع ہونا زیادہ ممکن ہوتا ہے، جس کی وجہ سے سسٹم کو بار بار منصوبہ بندی دوبارہ کرنی پڑتی ہے۔ انجام کو جبری طور پر لمبا کرنا کامیابی کو کم کرتا ہے اور فزیکل اسٹپس بڑھاتا ہے۔

بہت زیادہ جسمانی حرکات کی تکرار: یہاں تک کہ اگر کام کامیاب ہو جائے، تو راستے میں بہت ساری درستگیاں، واپسیاں اور دہرائی گئی حرکات شامل ہو سکتی ہیں۔

اس لیے، VLA ڈیپلویمنٹ کی کارکردگی صرف ہر مرحلے کی استدلال تاخیر نہیں، بلکہ پالیسی کارکردگی (policy efficiency) بھی دیکھتی ہے: ایک پیشگوئی میں کتنے اقدامات پر بھروسہ کیا جا سکتا ہے؟ کام مکمل کرنے کے لیے حقیقی فزیکل اقدامات کتنے درکار ہیں؟

موجودہ طریقے زیادہ تر کمپیوٹیشنل طرف سے کام کرتے ہیں، جیسے ویژول ٹوکن کا کٹنا، کمیشن، KV-کیش کا دوبارہ استعمال، ڈسٹلیشن یا انفرینس انجن کا بہتر بنانا۔ یہ طریقے ایک بار کی انفرینس لیٹنسی کو کم کر سکتے ہیں، لیکن اگر حکمت عملی اب بھی بہت زیادہ زائد فزیکل مراحل کا مطالبہ کرتی ہے، تو اصل کام مکمل ہونے میں اب بھی لمبا وقت لگتا ہے۔

لمبے ایکشن چنک کو براہ راست فکس کرنا بھی قابل اعتماد نہیں ہے۔

تجربے میں ظاہر ہوا کہ جب ایکشن کی لمبائی کو جبری طور پر بڑھایا جاتا ہے، تو کامیابی کی شرح کم ہو سکتی ہے اور فزیکل اسٹیپس بڑھ جاتے ہیں۔ اس سے پتہ چلتا ہے کہ کم معیار کی ٹیل پرڈکشن فزیکل دنیا میں غلطیوں کو داخل کرتی ہے، جس کے نتیجے میں روبوٹ کو زیادہ ا纠错 ایکشنز کرنے پڑتے ہیں۔

اہم سوال: کیا ہم پسِ تربیت کے ذریعے موجودہ VLA اسٹریٹجی کو خودکار طور پر یہ سیکھنے دے سکتے ہیں کہ وہ مہارت کی کامیابی کو متاثر نہ کرتے ہوئے "کم سے کم اقدامات" کے ساتھ کام مکمل کرے؟

سچوان یونیورسٹی کے پروفیسر لی اینجیہ کی قیادت میں ٹیم نے پالیسی ٹرائم پیش کیا ہے — ایک دو مرحلہ تقویتی سیکھنے کا پس ٹریننگ فریم ورک جو "پالیسی کی کارکردگی" پر مبنی ہے۔ یہ VLA آرکٹیکچر کو تبدیل نہیں کرتا اور ماہر ڈیٹا دوبارہ جمع نہیں کرتا، بلکہ پہلے سے تربیت یافتہ پالیسی کے بنیاد پر روبوٹ کے حقیقی انجام دینے کے رویے کو مزید بہتر بناتا ہے۔

روبوٹ

پروجیکٹ کی ویب سائٹ: https://inceptionwang.github.io/PolicyTrim/

کاغذ کا لنک: https://arxiv.org/abs/2606.22540

کوڈ لنک: https://github.com/INCEPTIONwang/PolicyTrim

ماڈل لنک: https://huggingface.co/INCEPTIONwang/PolicyTrim

نیا طریقہ لاگو کیا گیا:

  • 3× ایکشن چنک کی استعمال کی شرح، لمبے افق کے لیے قابل اعتماد انجام؛
  • 51.4% فزیکل اسٹیپس کم، زائد اور درست کرنے والے ایکشنز کو دبایا گیا؛
  • 5.83× انتہائی اینڈ تو اینڈ تیزی، LIBERO Object/π0.5؛

اِس طرح تیز تر گنتی کرنے سے لے کر تیز تر کام کرنے تک

پالیسی ٹرائم کا مرکزی مقصد کمپیوٹیشنل ایکسلریشن کو متبادل نہیں بنانا، بلکہ ایک اور نظرانداز شدہ پہلو کو پورا کرنا ہے: کام مکمل کرنے کے لیے ضروری فارورڈ انفرنس کی تعداد کو کم کرنا۔ یہ اسٹریٹیجی کی کارکردگی کو دو قابل بہتری ہدفوں میں تقسیم کرتا ہے: پہلے قابل اعتماد ایکشن چنکس کو وسعت دیں، پھر زائد فزیکل اسٹیپس کو دبائیں۔

روبوٹ

1. قابل اعتماد ایکشن چنک ایکسٹینشن (Reliable Action Chunk Extension)

اکثر VLA اسٹریٹجیز ابھی action chunk کی شکل میں ایکشن سیکوئنس آؤٹ پٹ کرتی ہیں، لیکن ڈپلویمنٹ کے دوران عام طور پر صرف پہلے کچھ قدم ہی انجام دیے جاتے ہیں۔ PolicyTrim کا پہلا مرحلہ dynamic execution horizon exploration استعمال کرتا ہے: ایک ہی rollout کو مختلف اسٹول ریٹس دی جاتی ہیں تاکہ ماڈل مختصر، درمیانی اور لمبے ونڈوز پر متوازی طور پر قابل اعتماد حدود کا جائزہ لے سکے۔

کام کو کامیابی کے ساتھ مکمل کرنے اور زیادہ لمبے اجراء کے ونڈو کے ساتھ ٹریجکٹری کو زیادہ انعام ملتا ہے، جس سے ماڈل کو اصل میں غیر قابل اعتماد چنک کے اختتامی ایکشنز کو زیادہ استعمال کے قابل بنانے کی حوصلہ افزائی ہوتی ہے۔

ہورائزنش ری وارڈ صرف گروپ کے اندر کامیاب راستہ ظاہر ہونے پر فعال ہوتا ہے، جس سے ماڈل ناکامی کی صورت میں لمبے چنک لمبائی کی طرف بے موقع پursuit نہ کرے۔

2. زائدہ احساس کے ساتھ قدموں کا کم کرنا (Redundancy-Aware Step Reduction)

جب قابل اعتماد horizon کو وسعت دی جاتی ہے، تو دوسرے مرحلے میں کل فزیکل اسٹیپس میں مزید کمی کی جاتی ہے۔ PolicyTrim step-saving reward متعارف کراتا ہے: جتنا کم اسٹیپس استعمال کر کے کام مکمل کیا جائے، اتنا ہی زیادہ انعام ملے گا۔

step-saving reward کو براہ راست "مختصر اور براہ راست کامیابی کا راستہ" کے طور پر بہتر بنانے کے مقصد میں شامل کریں۔

گروپ-بنیادی ریگولرائزیشن غیر قابل دہرائے جانے والے سپیکولیٹو شارٹکٹس کو روکتی ہے، جس سے ماڈل صرف مختصر راستہ تلاش کرنے پر توجہ مرکوز نہیں کرتا اور کامیابی کے امکانات کو متاثر نہیں کرتا۔

دو مرحلہ ترتیبی بہتری سے "چنک کو لمبا کرنا" اور "قدموں کی تعداد کو کم کرنا" کے درمیان تنازع کو روکا جا سکتا ہے، جس سے کام مکمل کرنے کے لیے ضروری فارورڈ انفرنس کی تعداد میں کمی آتی ہے۔

تجربی نتائج

PolicyTrim کو LIBERO، ManiSkill، Meta-World اور حقیقی روبوٹ کے کاموں پر ٹیسٹ کیا گیا ہے اور π0.5، OpenVLA-OFT، GR00T جیسی مختلف VLA آرکیٹیکچرز کو کور کیا گیا ہے۔ کل مجموعی نتائج سے ظاہر ہوتا ہے کہ PolicyTrim انجام دہی کی کارکردگی میں نمایاں بہتری لاتا ہے جبکہ کام کی کامیابی کو مستحکم رکھتا ہے۔

LIBERO میں، π0.5 نے 5.83 گنا تک کا اندروں سے اندروں تک تیزی حاصل کی، جبکہ کامیابی کی شرح 98% سے زیادہ برقرار رکھی۔

کراس بینچ مارک نتائج ظاہر کرتے ہیں کہ PolicyTrim، ManiSkill پر ایک زیادہ سے زیادہ 2.36 گنا تیزی اور Meta-World پر 2.52 گنا تیزی حاصل کرتا ہے۔

کراس آرکیٹیکچر نتائج دکھاتے ہیں کہ مکمل دو مرحلہ عمل کے ساتھ دوبارہ پری ٹرینڈ OpenVLA-OFT 2.97 گنا تیزی حاصل کرتا ہے؛ صرف دوسرے مرحلے کا استعمال کرتے ہوئے OpenVLA بھی 1.41 گنا تیزی حاصل کرتا ہے۔

روبوٹ

کوالیٹیٹو کمپیریسن: کم راستے پر چلیں، راستہ زیادہ مستقیم ہے

تصادفی نمونہ لیبرو کے کاموں میں، بیس لائن عام طور پر زائد درستگی کے اقدامات اور ہدف کے قریب تھم جانا/جھٹکا دینا ظاہر کرتا ہے؛ پالیسی ٹرائم کا راستہ زیادہ چکنائی اور مستقیم ہوتا ہے، جو ایک ہی کام کو کم فزیکل اقدامات میں مکمل کر سکتا ہے اور عام طور پر فزیکل اقدامات کو تقریباً نصف تک کم کر دیتا ہے۔

روبوٹ

حقیقی روبوٹ ڈپلویمنٹ: محاکہ میں حاصل کی گئی کارکردگی کا فائدہ فزیکل دنیا میں منتقل کیا جا سکتا ہے

اس مضمون کی مزید تصدیق ایک Agilex Piper روبوٹک بازو پر دو Intel RealSense D435i کیمرے کے ساتھ کی گئی ہے، جس میں FlipMug، HangMug، اور TapeBox جیسے تین قسم کے روبوٹک کام شامل ہیں۔ تجربات میں ثابت ہدف کی پوزیشن کے ساتھ ساتھ گریپنگ کے دوران ہدف پر تصادفی اضطراب شامل ہیں۔

پالیسی ٹرائم معیاری اور ڈائنانک پرتربیٹ سیٹنگ دونوں میں کامیابی کی شرح کو برقرار رکھتا یا بہتر بناتا ہے، جبکہ حقیقی انجام کے وقت کو نمایاں طور پر کم کرتا ہے۔ معیاری حقیقی روبوٹ سیٹنگ میں، اوسطاً 1.86 گنا ایکڈی ایک اسپیڈ اپ حاصل ہوتا ہے۔

روبوٹ

روبوٹ

تجربی نتائج کے مطابق، PolicyTrim صرف بینچ مارک اشاریوں کو بہتر نہیں بناتا: فزیکل روبوٹ پر، ٹاسک مکمل کرنے کا وقت بنیادی سطح کے تقریباً نصف تک کم ہو جاتا ہے، اور ڈائنامک خلل کے ماحول میں بھی مضبوطی برقرار رکھتا ہے۔

PolicyTrim کیوں کام کرتا ہے؟

• اسٹریٹجی کی خود کاری میں اضافہ: یہ صرف ایک بار کی ریزننگ میں تاخیر کم نہیں کرتا، بلکہ زائد اقدامات اور غیر ضروری دوبارہ منصوبہ بندی کو بھی کم کرتا ہے۔

• شروع سے تربیت کی ضرورت نہیں: ایک پوسٹ ٹریننگ فریم ورک کے طور پر، یہ موجودہ VLA ماڈلز پر مبنی ہو کر مزید بہتری لائے گا، جس سے ڈیٹا جمع کرنے اور تربیت کے اخراجات کم ہو جائیں گے۔

• رفتار اور کامیابی کی شرح دونوں کو مدنظر رکھیں: قابل اعتماد horizon اسکیلنگ سے چنک کو بے جا لمبا نہ کریں، اور استحکام کے پابندیوں سے مختصر راستوں کے ٹریڈنگ سے بچیں۔

• کمپوٹیشنل ایکسلریشن کے ساتھ جمع ہو سکتا ہے: PolicyTrim فارورڈ انفرنس کی تعداد کو بہتر بناتا ہے، جبکہ VLA-Cache جیسے طریقے ہر انفرنس کے وقت کو کم کرتے ہیں، دونوں راستے آپس میں عمودی ہیں اور مجموعی ایکسلریشن پیدا کر سکتے ہیں۔

پالیسی ٹرائم کا مرکزی نقطہ نظر یہ ہے کہ VLA روبوٹس کے لیے ڈیپلومنٹ کی کارکردگی صرف تیز تر ماڈل انفرنس سے نہیں، بلکہ زیادہ موثر حکمت عملی کے رویے سے بھی حاصل ہوتی ہے۔ روبوٹ کو "کم سے کم احاطہ" کرنے سے بھی نمایاں تیزی حاصل ہو سکتی ہے۔

حوالہ جات: https://arxiv.org/abs/2606.22540

یہ مضمون ویچن گروپ "نیوزی ایوان" سے ہے، مصنف: نیوزی ایوان؛ ایڈیٹر: LRST

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔