[परिचय] VLA मॉडल पहले से ही कार्य कर सकता है, लेकिन वास्तविक रोबोट अभी भी धीमे हैं! PolicyTrim एक ऐसी विधि है जो VLA रोबोट के कार्यान्वयन की दक्षता को बिना पुनः प्रशिक्षित किए बेहतर बनाती है। यह विश्वसनीय कार्रवाई अनुक्रम को विस्तारित करके और अतिरिक्त कदमों को कम करके रोबोट को कार्य को अधिक सीधे तरीके से पूरा करने में मदद करती है, जिससे समग्र गति में वृद्धि होती है।
विज़न-लैंग्वेज-एक्शन (VLA) मॉडल विज़ुअल ऑब्ज़र्वेशन, भाषा निर्देश और रोबोटिक एक्शन को एक ही स्ट्रेटेजी मॉडल में एकीकृत करता है, जिससे रोबोट प्राकृतिक भाषा के आधार पर जटिल ऑपरेशन कार्यों को पूरा कर सकता है।
OpenVLA, OpenVLA-OFT से लेकर π0.5, GR00T तक, इस प्रकार के मॉडल एम्बॉडिड इंटेलिजेंस के लिए एक महत्वपूर्ण तकनीकी दिशा बन रहे हैं।
लेकिन जब VLA मॉडल को वास्तविक रोबोट पर लागू किया जाता है, तो एक महत्वपूर्ण बाधा तुरंत सामने आती है: रोबोट द्वारा कार्य पूरा करने में लगने वाला कुल समय, केवल प्रत्येक निष्कर्षण कितना तेज़ है, इस पर ही निर्भर नहीं करता, बल्कि रणनीति को कितनी बार निष्कर्षण और कितने वास्तविक भौतिक क्रियाएँ करनी पड़ती हैं, इस पर भी निर्भर करता है।

एक ही कार्य के कई रोलआउट में, VLA मॉडल के निष्पादन कदमों में उल्लेखनीय भिन्नता होती है, जिससे स्पष्ट होता है कि अधिक छोटी और सीधी सफलता की राहें प्राप्त हो सकती हैं, लेकिन वर्तमान रणनीति अक्सर केवल यादृच्छिक रूप से इन्हें खोज पाती है।
अंतिम क्रियाओं की अविश्वसनीयता: मॉडल एक साथ कई क्रियाएँ भविष्यवाणी करता है, लेकिन जितनी बाद की क्रियाएँ होती हैं, उतनी ही अधिक त्रुटि जमा होती है, जिससे सिस्टम को बार-बार पुनः योजना बनानी पड़ती है। कार्यान्वयन की लंबाई को जबरन बढ़ाने से सफलता की संभावना कम हो जाती है और भौतिक चरणों की संख्या बढ़ जाती है।
भौतिक गतिविधियों में अत्यधिक अतिरिक्तता है: भले ही कार्य अंततः सफल हो जाए, ट्रैजेक्टरी में अनेक सुधार, पीछे हटने और दोहराव की क्रियाएँ शामिल हो सकती हैं।
इसलिए, VLA डिप्लॉयमेंट की दक्षता केवल प्रत्येक चरण की निष्पादन देरी को नहीं, बल्कि नीति दक्षता (policy efficiency) को भी देखती है: एक भविष्यवाणी में कितने कार्रवाईयाँ आत्मविश्वास से निष्पादित की जा सकती हैं? कार्य पूरा करने के लिए वास्तविक भौतिक चरणों की कितनी संख्या की आवश्यकता होती है?
पहले के तरीके अधिकांशतः कैलकुलेशन के पहलू से शुरू होते हैं, जैसे विजुअल टोकन प्रुनिंग, क्वांटाइजेशन, KV-कैश का पुनः उपयोग, डिस्टिलेशन या इन्फरेंस इंजन अनुकूलन। ये तरीके एकल इन्फरेंस लेटेंसी को कम कर सकते हैं, लेकिन यदि रणनीति अभी भी बहुत सारे अतिरिक्त भौतिक चरणों की आवश्यकता रखती है, तो वास्तविक कार्य का समय अभी भी लंबा रहता है।
भी लंबे action chunk को सीधे फिक्स करके निष्पादित करना भी विश्वसनीय नहीं है।
पेपर में दिए गए परीक्षणों से पता चलता है कि जब कार्रवाई की अवधि को जबरन बढ़ाया जाता है, तो सफलता की संभावना कम हो सकती है और भौतिक चरणों की संख्या बढ़ सकती है। इससे पता चलता है कि कम गुणवत्ता वाली अंतिम भविष्यवाणी त्रुटियों को भौतिक दुनिया में ले जाती है, जिसके परिणामस्वरूप रोबोट को अधिक सुधारात्मक कार्रवाइयों की आवश्यकता होती है।
मुख्य प्रश्न: क्या पोस्ट-ट्रेनिंग के माध्यम से, बिना कार्य सफलता दर को प्रभावित किए, एक पहले से मौजूद VLA नीति स्वयं को यह सीख सकती है कि "कम वक्रों से गुजरें" और कार्य पूरा करने के लिए कम भौतिक चरणों का उपयोग करें?
सिचुआन विश्वविद्यालय के प्रोफेसर लेई यिनजिए के नेतृत्व में टीम ने PolicyTrim — एक दो-चरण रीइनफोर्समेंट लर्निंग पोस्ट-ट्रेनिंग फ्रेमवर्क — प्रस्तुत किया, जो 'रणनीति की दक्षता' पर केंद्रित है। यह VLA आर्किटेक्चर को नहीं बदलता और विशेषज्ञ डेटा को पुनः एकत्रित नहीं करता, बल्कि पहले से प्रशिक्षित रणनीति पर रोबोट के वास्तविक कार्यान्वयन को अतिरिक्त अनुकूलित करता है।

प्रोजेक्ट होमपेज: https://inceptionwang.github.io/PolicyTrim/
पेपर का लिंक: https://arxiv.org/abs/2606.22540
कोड लिंक: https://github.com/INCEPTIONwang/PolicyTrim
मॉडल लिंक: https://huggingface.co/INCEPTIONwang/PolicyTrim
नयी विधि लागू की गई:
- 3× एक्शन चंक उपयोग, अधिक विश्वसनीय लंबे होराइजन निष्पादन;
- 51.4% भौतिक कदमों में कमी, अतिरिक्त सुधार गतिविधियों को संकुचित किया गया;
- 5.83× अंत से अंत तक उच्चतम त्वरण, LIBERO Object/π0.5;
अधिक तेज़ गणना से अधिक तेज़ कार्य तक
PolicyTrim का मुख्य लक्ष्य कॉम्प्यूटेशन-साइड त्वरण को प्रतिस्थापित करना नहीं है, बल्कि एक अन्य उपेक्षित आयाम को पूरा करना है: कार्य पूरा करने के लिए आवश्यक फॉरवर्ड इन्फरेंस की संख्या को कम करना। यह नीति की दक्षता को दो अनुकूलनयोग्य लक्ष्यों में विभाजित करता है: पहले विश्वसनीय क्रिया चंक को विस्तारित करें, फिर अतिरिक्त भौतिक कदमों को संपीड़ित करें।

1. विश्वसनीय क्रिया चंक विस्तार (Reliable Action Chunk Extension)
वर्तमान में, कई VLA रणनीतियाँ action chunk के रूप में कार्रवाई अनुक्रम आउटपुट करती हैं, लेकिन डिप्लॉयमेंट के समय अक्सर केवल पहले कुदमों को ही निष्पादित करने का साहस किया जाता है। PolicyTrim का पहला चरण dynamic execution horizon exploration का उपयोग करता है: एक ही rollout समूह को विभिन्न स्वीकृति अनुपात आवंटित किए जाते हैं, ताकि मॉडल छोटे, मध्यम और लंबे विंडो पर समानांतर रूप से विश्वसनीय सीमाओं का पता लगा सके।
अधिक सफलतापूर्वक कार्य पूरा करने और लंबे निष्पादन खिड़की वाले ट्रैक्टर को अधिक रिवॉर्ड मिलता है, जिससे मॉडल को मूल रूप से अविश्वसनीय चंक अंतिम क्रियाओं को अधिक उपयोगी बनाने के लिए प्रोत्साहित किया जाता है।
हॉराइजन रिवॉर्ड केवल तभी सक्रिय होता है जब समूह के भीतर सफल ट्रैजेक्टरी दिखाई देती है, जिससे मॉडल असफलता की स्थिति में लंबे chunk लंबाई की ओर अनियंत्रित रूप से आकर्षित न हो।
2. अतिरिक्त जागरूक चरण संकुचन (Redundancy-Aware Step Reduction)
जब विश्वसनीय horizon को विस्तारित किया जाता है, तो दूसरे चरण में कुल भौतिक चरणों को और कम किया जाता है। PolicyTrim step-saving reward पेश करता है: जितने कम चरणों में सफल ट्रैजेक्टरी कार्य पूरा करती है, उतनी ही अधिक पुरस्कार मिलता है।
step-saving reward को सीधे अनुकूलन लक्ष्य में "छोटा, सीधा सफलता मार्ग" लिखें।
ग्रुप-एंकर्ड नियमन अनुपलब्ध अवसरों को दबाता है और मॉडल को केवल छोटे मार्ग की ओर आकर्षित होने से रोकता है जिससे सफलता की संभावना प्रभावित हो सकती है।
दो चरणों वाला क्रमिक अनुकूलन «chunk» को लंबा करने और कदमों की संख्या को कम करने के दो लक्ष्यों के बीच अंतर्क्रिया को रोकता है, जिससे कार्य पूरा करने के लिए आवश्यक फॉरवर्ड इन्फरेंस की संख्या में कमी आती है।
परीक्षण परिणाम
PolicyTrim का परीक्षण LIBERO, ManiSkill, Meta-World और वास्तविक रोबोट कार्यों पर किया गया है, जिसमें π0.5, OpenVLA-OFT, GR00T जैसी विभिन्न VLA आर्किटेक्चर शामिल हैं। समग्र परिणाम दर्शाते हैं कि PolicyTrim टास्क सफलता दर को स्थिर रखते हुए कार्यक्षमता में महत्वपूर्ण वृद्धि करता है।
LIBERO में, π0.5 ने अधिकतम 5.83 गुना एंड-टू-एंड त्वरण प्राप्त किया, जबकि सफलता की दर 98% से अधिक बनी रही।
क्रॉस-बेंचमार्क परिणाम दर्शाते हैं कि PolicyTrim, ManiSkill पर अधिकतम 2.36 गुना और Meta-World पर 2.52 गुना तेजी लाता है।
क्रॉस-आर्किटेक्चर परिणाम दर्शाते हैं कि पूर्ण दो-चरण प्रक्रिया का उपयोग करके पुनः प्रशिक्षित OpenVLA-OFT 2.97 गुना तेजी ला सकता है; केवल दूसरे चरण का उपयोग करके OpenVLA 1.41 गुना तेजी ला सकता है।

गुणात्मक तुलना: कम भूलें, अधिक सीधा मार्ग
रैंडम सैंपल्ड LIBERO कार्यों में, बेसलाइन अक्सर अतिरिक्त सुधार गतिविधियों और लक्ष्य के आसपास हेसिटेशन/जिटरिंग दिखाता है; PolicyTrim की ट्रैजेक्टरी अधिक चिकनी और सीधी होती है, और एक ही कार्य को कम भौतिक कदमों में पूरा कर सकती है, आमतौर पर भौतिक कदमों को लगभग आधा कर देती है।

Real robot deployment: Efficiency gains from simulation can be transferred to the physical world
पेपर ने दो Intel RealSense D435i कैमरों से लैस Agilex Piper रोबोटिक आर्म पर FlipMug, HangMug, TapeBox तीन प्रकार के वास्तविक रोबोटिक कार्यों की पुष्टि की। प्रयोग में स्थिर लक्ष्य स्थिति के सामान्य सेटअप के साथ-साथ ग्रिपिंग प्रक्रिया के दौरान लक्ष्य में यादृच्छिक विक्षेपण के साथ गतिशील सेटअप शामिल हैं।
PolicyTrim निर्धारित सेटिंग और डायनामिक विक्षेप सेटिंग दोनों में सफलता की दर को बनाए रखता है या बढ़ाता है, जबकि वास्तविक निष्पादन समय को काफी कम करता है। निर्धारित वास्तविक रोबोट सेटिंग में, यह औसतन 1.86 गुना एंड-टू-एंड त्वरण प्राप्त करता है।


प्रयोगात्मक परिणामों से पता चलता है कि PolicyTrim केवल बेंचमार्क सूचकांकों को ही अनुकूलित नहीं करता: भौतिक रोबोट पर, कार्य पूरा करने का समय बेसलाइन के लगभग आधा हो जाता है और गतिशील विक्षेपण परिदृश्यों में दृढ़ता बनाए रखता है।
PolicyTrim क्यों काम करता है?
• रणनीति के स्वयं के कार्यक्षमता में सुधार: यह केवल एकल निष्कर्षण देरी को कम नहीं करता, बल्कि अतिरिक्त क्रियाओं और अनावश्यक पुनः योजना बनाने को भी कम करता है।
• शुरू से ट्रेन करने की आवश्यकता नहीं: एक पोस्ट-ट्रेनिंग फ्रेमवर्क के रूप में, यह मौजूदा VLA मॉडल पर आधारित होकर अतिरिक्त अनुकूलन कर सकता है, जिससे डेटा संग्रह और ट्रेनिंग लागत में कमी आती है।
• गति और सफलता का संतुलन: विश्वसनीय horizon विस्तार अनियंत्रित chunk बढ़ाने से बचता है, स्थिरता सीमाएं छोटे मार्गों के लिए अनुमानित लाभ को रोकती हैं।
• कॉम्प्यूटेशनल एक्सेलरेशन के साथ ओवरलैप किया जा सकता है: PolicyTrim फॉरवर्ड इन्फरेंस की संख्या को ऑप्टिमाइज़ करता है, जबकि VLA-Cache जैसी विधियाँ प्रत्येक इन्फरेंस के समय को ऑप्टिमाइज़ करती हैं, दोनों पथ लंबवत हैं और संयुक्त त्वरण पैदा कर सकते हैं।
PolicyTrim का मुख्य बिंदु यह है: VLA रोबोट के लिए, कार्यान्वयन दक्षता केवल तेज़ मॉडल निष्पादन से ही नहीं, बल्कि अधिक कुशल रणनीति व्यवहार से भी प्राप्त होती है। रोबोट को "कम वक्रों" पर जाने देना भी महत्वपूर्ण त्वरण ला सकता है।
संदर्भ: https://arxiv.org/abs/2606.22540
यह लेख वेचेन ग्रुप "न्यूज़िज़युएन" से आया है, लेखक: न्यूज़िज़युएन; संपादक: LRST
