PolicyTrim يزيد كفاءة روبوت VLA بنسبة 5.83 مرة دون إعادة التدريب

icon MarsBit
مشاركة
AI summary iconملخص
تعزز PolicyTrim كفاءة روبوت VLA بنسبة 5.83 مرات دون إعادة التدريب، وفقًا لما أفادت به MarsBit. يحسن الإطار تنفيذ المهام من خلال حذف الخطوات الزائدة وتوسيع سلاسل الإجراءات الموثوقة. ويحقق معدل نجاح بنسبة 98% في مهام مثل LIBERO Object/π0.5. تعمل PolicyTrim على مرحلتين: توسيع الإجراءات الموثوقة وضغط الخطوات المادية. يتوافق هذا الأسلوب مع أهداف الامتثال لـ CFT وMiCA من خلال تقديم ترقية فعالة من حيث التكلفة للنماذج الحالية لـ VLA. لا يتطلب أي جمع جديد للبيانات أو إعادة تدريب.

[مقدمة] لقد تعلمت نموذج VLA تنفيذ المهام، لكن الروبوتات الحقيقية لا تزال بطيئة! PolicyTrim هي طريقة لتحسين كفاءة تنفيذ الروبوتات المبنية على VLA دون الحاجة إلى إعادة التدريب. فهي تساعد الروبوتات على إكمال المهام بشكل أكثر مباشرة من خلال توسيع سلسلة الإجراءات الموثوقة وتقليل الخطوات الزائدة، مما يعزز السرعة العامة.

نموذج Vision-Language-Action (VLA) يوحد الملاحظات البصرية والتعليمات اللغوية وأفعال الروبوت في نموذج سياسة واحد، مما يمكّن الروبوت من إكمال مهام تشغيلية معقدة بناءً على اللغة الطبيعية.

من OpenVLA و OpenVLA-OFT إلى π0.5 و GR00T، تصبح هذه النماذج مسارًا تقنيًا مهمًا للذكاء المتجسد.

لكن عندما يتم نشر نموذج VLA فعليًا على الروبوت، سيظهر عائق رئيسي على الفور: الوقت الإجمالي الذي يستغرقه الروبوت لإكمال المهمة لا يعتمد فقط على سرعة كل استدلال، بل أيضًا على عدد مرات الاستدلال التي تتطلبها الاستراتيجية وعدد الحركات المادية الفعلية.

روبوت

في مرات التفريغ المتعددة للمهمة نفسها، يظهر تذبذب كبير في عدد خطوات التنفيذ لنموذج VLA، مما يشير إلى أن مسارات نجاح أقصر وأكثر مباشرة هي قابلة للتحقيق، لكن الاستراتيجية الحالية غالبًا ما تجد هذه المسارات عرضيًا فقط.

الحركات في نهاية الكتلة غير موثوقة: يتنبأ النموذج بحركات متعددة في مرة واحدة، لكن الحركات الأبعد تصبح أكثر عرضة لتراكم الأخطاء، مما يجبر النظام على إعادة التخطيط بشكل متكرر. محاولة تمديد طول التنفيذ بشكل قسري تقلل من نسبة النجاح وتزيد من عدد الخطوات المادية.

الحركات الميكانيكية زائدة بشكل كبير: حتى لو نجح المهمة في النهاية، فقد تحتوي المسار على عدد كبير من الحركات التصحيحية والرجوعية والتكرارية.

لذلك، لا يكفي تقييم كفاءة نشر VLA من خلال تأخير الاستدلال في كل خطوة، بل يجب أيضًا تقييم كفاءة السياسة (policy efficiency): كم عدد الإجراءات التي يمكن تنفيذها بثقة في تنبؤ واحد؟ كم عدد الخطوات الفعلية المطلوبة لإكمال المهمة؟

تُركز الطرق الحالية بشكل رئيسي على الجانب الحسابي، مثل تقليص رموز الرؤية، التكميم، إعادة استخدام KV-cache، التدريب المُستخلص، أو تحسين محرك الاستنتاج. يمكن لهذه الطرق تقليل تأخير الاستنتاج الفردي، ولكن إذا ظلت الاستراتيجية تتطلب عددًا كبيرًا من الخطوات الفيزيائية الزائدة، فسيظل وقت المهمة الفعلية طويلًا.

إن تنفيذ chunk إجراء أطول بشكل ثابت ليس موثوقًا أيضًا.

أظهرت التجارب في الورقة أن زيادة طول مدة تنفيذ الإجراءات بشكل إجباري قد تؤدي إلى انخفاض معدل النجاح وزيادة عدد الخطوات الفيزيائية. وهذا يشير إلى أن التنبؤات الضعيفة للطرف النهائي تنقل الأخطاء إلى العالم الفيزيائي، مما يضطر الروبوت إلى تنفيذ المزيد من الإجراءات التصحيحية.

السؤال الرئيسي: هل يمكن، من خلال التدريب اللاحق، جعل استراتيجيات VLA الموجودة تتعلم تلقائيًا "تجنب الطرق المطولة" وإنجاز المهام بخطوات فيزيائية أقل، دون التضحية بنجاح المهمة؟

فريق بقيادة البروفيسور لي يينجjie من جامعة سيتشوان قدم PolicyTrim — إطار عمل تدريب بعدي مبني على التعلم المعزز على مرحلتين موجه نحو "كفاءة الاستراتيجية". وهو لا يغيّر بنية VLA ولا يعيد جمع بيانات الخبراء، بل يُحسّن سلوك الروبوت الفعلي القائم على الاستراتيجيات المُدرَّبة مسبقًا.

روبوت

الصفحة الرئيسية للمشروع: https://inceptionwang.github.io/PolicyTrim/

رابط الورقة البحثية: https://arxiv.org/abs/2606.22540

رابط الكود: https://github.com/INCEPTIONwang/PolicyTrim

رابط النموذج: https://huggingface.co/INCEPTIONwang/PolicyTrim

تم تحقيق الطريقة الجديدة:

  • استخدام chunk بثلاثة أضعاف، تنفيذ موثوق على أفق أطول؛
  • 51.4% تقليل خطوات الفيزياء، ضغط الإجراءات التصحيحية الزائدة؛
  • 5.83× أقصى تسريع من طرف إلى طرف، LIBERO Object/π0.5؛

من "الحساب الأسرع" إلى "التنفيذ الأسرع"

الهدف الأساسي لـ PolicyTrim ليس استبدال تسريع الحسابات، بل سد بعد آخر تم تجاهله: تقليل عدد مرات الاستدلال الأمامي المطلوبة لإكمال المهمة. فهو يقسم كفاءة الاستراتيجية إلى هدفين قابلين للتحسين: توسيع كتل الإجراءات الموثوقة أولاً، ثم ضغط الخطوات الفيزيائية الزائدة.

روبوت

1. توسيع كتلة الإجراء الموثوق (Reliable Action Chunk Extension)

حاليًا، تُصدر العديد من استراتيجيات VLA سلسلة إجراءات على شكل كتل إجرائية، لكن عند النشر، غالبًا ما يُنفذ فقط الخطوات الأولى. في المرحلة الأولى، يستخدم PolicyTrim استكشاف الأفق التنفيذي الديناميكي: يتم تخصيص نسب قبول مختلفة لمجموعة واحدة من التوسيعات، مما يسمح للنموذج باستكشاف الحدود الموثوقة على النوافذ القصيرة والمتوسطة والطويلة بشكل متوازٍ.

يتم منح مكافآت أعلى للمسارات التي تُكمل المهام بنجاح مع نافذة تنفيذ أطول، مما يشجع النموذج على جعل إجراءات الأجزاء غير الموثوقة في نهاية الكتلة أكثر فائدة.

يُفعّل مكافأة horizon فقط عند ظهور مسار ناجح داخل المجموعة، لتجنب تشجيع النموذج على السعي وراء طول chunk أطول في حالات الفشل.

2. ضغط الخطوات المستند إلى التعرف على التكرار (Redundancy-Aware Step Reduction)

بعد توسيع Horizon الموثوق، تقلل المرحلة الثانية من إجمالي الخطوات الفيزيائية. تُقدّم PolicyTrim مكافأة توفير الخطوات: كلما تم إكمال المسار الناجح بعدد أقل من الخطوات، زادت المكافأة.

مكافأة توفير الخطوات: اكتب مباشرة "مسار نجاح أقصر وأكثر مباشرة" كهدف تحسين.

التنظيم المُرتكز على المجموعة يثبط المسارات الانتهازية غير القابلة للتكرار، ويمنع النموذج من السعي وراء المسارات القصيرة على حساب معدل النجاح.

يمكن للتحسين التسلسلي على مرحلتين تجنب تداخل الهدفين المتمثلين في "تمديد الشريحة" و"تقليل عدد الخطوات"، مما يقلل في النهاية من عدد مرات الاستدلال الأمامي المطلوبة لإكمال المهمة.

نتائج التجربة

تم التحقق من PolicyTrim على مهام LIBERO وManiSkill وMeta-World والروبوتات الحقيقية، مع تغطية هياكل VLA مختلفة مثل π0.5 وOpenVLA-OFT وGR00T. تُظهر النتائج العامة أن PolicyTrim تُحسّن كفاءة التنفيذ بشكل ملحوظ مع الحفاظ على استقرار معدل نجاح المهام.

في LIBERO، وصل π0.5 إلى تسريع端到端 يصل إلى 5.83 ضعفًا، مع الحفاظ على معدل نجاح يزيد عن 98%.

أظهرت النتائج عبر المعايير أن PolicyTrim حققت تسريعًا يصل إلى 2.36 مرة على ManiSkill و2.52 مرة على Meta-World.

أظهرت النتائج عبر الهياكل المختلفة أن OpenVLA-OFT المعاد تدريبه باستخدام عملية المرحلة الكاملة من مرحلتين يحقق تسريعًا بنسبة 2.97 ضعف؛ بينما يحقق OpenVLA باستخدام المرحلة الثانية فقط تسريعًا بنسبة 1.41 ضعف.

روبوت

مقارنة نوعية: تجنب الطرق المطولة، والمسار أكثر مباشرة

في مهام LIBERO المأخوذة عشوائيًا، يظهر النموذج الأساسي غالبًا حركات تصحيح زائدة وتردد/اهتزاز بالقرب من الهدف؛ بينما تكون مسارات PolicyTrim أكثر سلاسة وأكثر مباشرة، ويمكنها إكمال المهمة نفسها بخطوات فيزيائية أقل، وغالبًا ما تقلل عدد الخطوات الفيزيائية إلى حوالي النصف.

روبوت

Deployment of real robots: Efficiency gains from simulation can be transferred to the physical world

تم التحقق من الورقة أيضًا على ذراع آلي Agilex Piper مزودًا باثنين من كاميرات Intel RealSense D435i، من خلال مهام روبوتية حقيقية تشمل FlipMug و HangMug و TapeBox. تغطي التجارب الإعداد القياسي بمواقع هدف ثابتة، بالإضافة إلى الإعداد الديناميكي الذي يتضمن اضطرابات عشوائية على الهدف أثناء عملية التقاطه.

تحافظ PolicyTrim على تحسين أو رفع معدل النجاح في كل من الإعدادات القياسية والإعدادات المضطربة الديناميكية، مع تقليل ملحوظ في وقت التنفيذ الفعلي. في إعدادات الروبوتات الحقيقية القياسية، تحقق متوسط تسريع端到端 قدره 1.86 مرة.

روبوت

روبوت

من نتائج التجربة، لا يُحسّن PolicyTrim مؤشرات المرجع فقط: بل يُقلل أيضًا وقت إنجاز المهمة على الروبوتات المادية إلى حوالي نصف القيمة الأساسية، ويحافظ على الصلابة في سيناريوهات التداخل الديناميكي.

لماذا يعمل PolicyTrim؟

• تحسين كفاءة الاستراتيجية نفسها: فهو يقلل من الإجراءات الزائدة وإعادة التخطيط غير الضرورية، وليس فقط تقليل زمن الاستدلال الواحد.

• لا حاجة للتدريب من الصفر: كإطار عمل بعد التدريب، يمكنه تحسين نماذج VLA الموجودة مسبقًا، مما يقلل من تكاليف جمع البيانات والتدريب.

• التوازن بين السرعة ونجاح العملية: توسيع horizon الموثوق يتجنب التمديد العشوائي للـ chunk، وقيود الاستقرار تمنع المضاربة على المسارات القصيرة.

• يمكن دمجه مع تسريع الجانب الحسابي: يُحسّن PolicyTrim عدد مرات الاستدلال الأمامي، بينما تُحسّن طرق مثل VLA-Cache الوقت المستغرق لكل استدلال، وهاتان الطريقتان متعامدتان ويمكنهما توليد تسريع مركب.

الفكرة الأساسية لـ PolicyTrim هي أنه بالنسبة لروبوتات VLA، فإن كفاءة النشر لا تأتي فقط من استنتاج نموذج أسرع، بل أيضًا من سلوك استراتيجية أكثر كفاءة. جعل الروبوتات "تتجنب الطرق المطولة" يمكن أن يحقق تسريعًا ملحوظًا أيضًا.

المراجع: https://arxiv.org/abs/2606.22540

هذا المقال من حساب WeChat "New智元"، المؤلف: New智元؛ المحرر: LRST

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.