【Panimula】 Ang VLA model ay nakakagawa na ng mga gawain, ngunit ang mga tunay na robot ay patuloy na mabagal! Ang PolicyTrim ay isang paraan upang mapabuti ang epekto ng VLA robot nang walang pagrere-train. Ito ay nagpapalawak sa mga kumpiyansa na hanay ng mga aksyon at nagpapabawas sa mga pang-ulit na hakbang, upang tulungan ang robot na mas direkta at mas mabilis na tapusin ang mga gawain.
Ang Vision-Language-Action (VLA) model ay nag-uunify ng mga visual na obserbasyon, mga panuto sa wika, at mga galaw ng robot sa isang patakaran na modelo, upang makapagawa ang robot ng mga kumplikadong gawain batay sa likas na wika.
Mula sa OpenVLA, OpenVLA-OFT hanggang sa π0.5 at GR00T, ang mga modelo na ito ay nagsisiging mahalagang teknikal na landas para sa embodied intelligence.
Ngunit kapag talagang ipinapasa ang VLA model sa robot, agad na makikita ang isang mahalagang bottleneck: ang kabuuang oras na kinakailangan ng robot upang matapos ang gawain, hindi lamang nakadepende kung gaano kabilis ang bawat inference, kundi pati na rin kung ilang beses kailangan gawin ang strategy at ilang mga totoong pisikal na galaw.

Sa maraming rollout ng parehong task, may malaking pagkakaiba sa bilang ng mga hakbang na ginagawa ng VLA model, na nagpapakita na ang mas maikli at mas direkta na landas patungo sa tagumpay ay makakamit, ngunit ang kasalukuyang estratehiya ay kadalasang nakakahanap nito nang walang inaasahang pagkakataon.
Hindi mapagkakatiwalaan ang dulo ng chunk ng aksyon: Ang modelo ay nagpapahula ng maraming aksyon nang isang beses, ngunit ang mas malalayong aksyon ay mas madaling mag-akumula ng error, kaya kailangan ng sistema na muling-plano nang madalas. Ang pagsisikap na palawigin ang haba ng pagsasagawa ay babawasan ang tagumpay at dadagdagan ang bilang ng pisikal na hakbang.
Sobrang dami ng redundant na pisikal na galaw: Kahit matagumpay ang gawain sa huli, maaaring maglaman ang trahektorya ng maraming pagkakamali, pagbabalik, at paulit-ulit na galaw.
Kaya, ang epektibong pag-deploy ng VLA ay hindi lamang nakadepende sa bawat hakbang na latency ng pag-iisip, kundi mas mahalaga ang epektibong patakaran (policy efficiency): ilang aksyon sa isang pagbibilang ang maaaring gawin nang ligtas? Ilan ang totoong pisikal na hakbang na kailangan upang matapos ang gawain?
Ang mga umiiral na paraan ay karamihan ay nagsisimula sa pagkalkula, tulad ng visual token pruning, quantization, KV-cache reuse, distillation, o optimization ng inference engine. Ang mga paraang ito ay maaaring bawasan ang latency sa isang pagkakataon ng inference, ngunit kung ang estratehiya ay nagpapalibot pa rin sa maraming redundant na pisikal na hakbang, ang tunay na oras ng gawain ay mananatiling mahaba.
Hindi rin maaasahan ang pagpapatupad nang direkta ng mas mahabang action chunk.
Ang mga eksperimento sa papel ay nagpapakita na habang pinapalawig nang pilit ang haba ng pagpapatupad ng aksyon, maaaring bumaba ang tagumpay, at dumadami ang bilang ng pisikal na hakbang. Ito ay nagpapakita na ang mahinang paghula sa dulo ay nagdadala ng kamalian sa pisikal na mundo, kaya kailangan ng robot na gawin ang higit pang mga aksyon para sa pagkorekta.
Pangunahing tanong: Maaari ba na matutunan ng mga umiiral na VLA strategy, sa pamamagitan ng post-training, ang "pag-iwas sa mga kumplikadong daan" upang matapos ang mga gawain gamit ang mas kaunting mga pisikal na hakbang, nang hindi iniiwanan ang tagumpay ng gawain?
Ang koponan na pinangunahan ni Prof. Lei Yinjie mula sa Sichuan University ay nagmungkahi ng PolicyTrim—isang dalawang-saklaw na framework para sa post-training ng reinforcement learning na nakatuon sa “efisyensiya ng patakaran.” Hindi ito nagbabago sa arkitektura ng VLA o nagre-recollect ng mga data mula sa mga eksperto, kundi patuloy na pinapabuti ang totoong pagpapatupad ng robot sa ibabaw ng mga pre-trained na patakaran.

Pahina ng proyekto: https://inceptionwang.github.io/PolicyTrim/
Link ng papel: https://arxiv.org/abs/2606.22540
Link ng code: https://github.com/INCEPTIONwang/PolicyTrim
Link ng modelo: https://huggingface.co/INCEPTIONwang/PolicyTrim
Natupad ang bagong paraan:
- 3× paggamit ng chunk ng aksyon, mas mahabang horizon ng maaasahang pagsasagawa;
- 51.4% pagbawas ng physical steps, pagsasama ng redundant correction actions;
- 5.83× pinakamataas na pagpapabilis mula sa dulo hanggang dulo, LIBERO Object/π0.5;
Mula sa “Mas Mabilis na Pagkalkula” hanggang sa “Mas Mabilis na Paggawa”
Ang pangunahing layunin ng PolicyTrim ay hindi magpalit sa pagpapabilis sa computing side, kundi punan ang isang napapalayong dimensyon: pagbawas sa bilang ng forward inference na kailangan upang matapos ang isang gawain. Ibinabahagi nito ang policy efficiency sa dalawang mapapahusay na layunin: unang palawakin ang mga kumpiyansa ng action chunk, pagkatapos ay i-press ang mga redundant na pisikal na hakbang.

1. Reliable Action Chunk Extension
Sa kasalukuyan, maraming VLA strategy na naglalabas ng sequence ng mga aksyon sa anyo ng action chunk, ngunit sa pag-deploy, karaniwang nagpapatakbo lamang ng mga unang ilang hakbang. Ang unang yugto ng PolicyTrim ay gumagamit ng dynamic execution horizon exploration: ibinibigay ang parehong set ng rollout na iba’t ibang acceptance ratio, upang ma-explor ng model ang reliable boundary sa maikling, intermediate, at mahabang window nang sabay-sabay.
Mas mataas ang reward para sa mga track na matagumpay na natapos at may mas mahabang window ng pagpapatupad, na nagpapahikayat sa modelo na gawing mas gamit ang mga galaw sa kahulugan ng chunk na dati ay hindi maaasahan.
Ang horizon reward ay aktibo lamang kapag may matagumpay na trajectory sa loob ng grupo, upang maiwasan ang modelo na magsikap nang walang direksyon ng mas mahabang chunk length sa panahon ng pagkabigo.
2. Pagpapaliit ng Hakbang na May Pagkakaroon ng Redundansi
Pagkatapos i-extend ang reliable horizon, ang pangalawang yugto ay dagdag pa sa pagbawas ng kabuuang bilang ng pisikal na hakbang. Ang PolicyTrim ay naglalakbay ng step-saving reward: mas maliit ang bilang ng mga hakbang na ginamit upang matapos ang isang tagumpay na traject, mas mataas ang reward.
step-saving reward isulat nang direkta ang “mas maikli, mas direkta na landas sa tagumpay” sa layunin ng pagpapabuti.
Ang group-anchored regularization ay nagpapahina sa hindi maaulit-ulit na mga shortcut sa spekulasyon, upang maiwasan ang paghahanap ng modelong tanging pangunahin ang maikling landas ngunit naaapektuhan ang tagumpay.
Ang dalawang-saklaw na pag-optimize ay maiiwasan ang pagkakaubos ng mga layunin na “papalawakin ang chunk” at “pabawasan ang bilang ng hakbang,” na sa huli ay nagpapababa sa bilang ng forward inference na kailangan upang matapos ang gawain.
Mga resulta ng eksperimento
Pinatunayan ng papel ang PolicyTrim sa LIBERO, ManiSkill, Meta-World, at mga tunay na robot task, at kinabibilangan ng iba’t ibang VLA arkitektura tulad ng π0.5, OpenVLA-OFT, at GR00T. Ang kabuuang resulta ay nagpapakita na ang PolicyTrim ay nagpapabuti nang malaki sa efisiyensiya ng pagpapatupad habang pinapanatili ang katatagan ng tagumpay sa task.
Sa LIBERO, ang π0.5 ay nakamit ang pinakamataas na 5.83x end-to-end acceleration, habang nananatili ang tagumpay na rate sa higit sa 98%.
Batay sa mga resulta ng cross-benchmark, ang PolicyTrim ay nakamit ng pinakamataas na 2.36x speedup sa ManiSkill at 2.52x speedup sa Meta-World.
Batay sa mga resulta sa iba't ibang arkitektura, ang OpenVLA-OFT na muling pinretrain gamit ang buong dalawang-saklaw na proseso ay nakakamit ng 2.97倍 na pagpapabilis; ang OpenVLA na gumagamit lamang ng ikalawang saklaw ay nakakamit din ng 1.41倍 na pagpapabilis.

Qualitative comparison: Mas kaunting pagkakamali, mas direkta ang track
Sa random na pinagkukunan ng LIBERO tasks, ang baseline ay madalas ay nagpapakita ng mga redundant na pagkakamali at paghuhesitasyon o jittering malapit sa layunin; ang mga trajektoriya ng PolicyTrim ay mas malinis at mas direkta, at kayang matapos ang parehong gawain sa mas kaunting pisikal na hakbang, karaniwang nakakapagpapababa ng bilang ng pisikal na hakbang sa halos kalahati.

Real robot deployment: Efficiency gains from simulation can be transferred to the physical world
Pinatotohanan ng papel ang mga tunay na robot task sa isang Agilex Piper robotic arm na may dalawang Intel RealSense D435i camera, kabilang ang mga task na FlipMug, HangMug, at TapeBox. Ang mga eksperimento ay nakakapalibot sa standard setting na may fixed target position, at dynamic setting na may random disturbance sa target habang nagpapakita.
Ang PolicyTrim ay nagpapanatili o nagpapabuti ng tagumpay sa parehong standard at dynamic perturbation settings, habang nagpapababa nang malaki ng real-world execution time. Sa standard real-robot setting, ito ay nagtataglay ng average 1.86x end-to-end acceleration.


Batay sa mga resulta ng eksperimento, hindi lang pinapabuti ng PolicyTrim ang mga benchmark metric: sa mga physical robot, nakakamit din nito ang pagkakaroon ng pagkakatapos ng gawain na kalahati lamang ng baseline, at nananatiling matatag sa mga sitwasyon na may dinamikong pagkakaiba.
Bakit epektibo ang PolicyTrim?
• Pagpapabuti sa sariling estratehiya: Ito ay nagbabawas ng mga pang-ulit na aksyon at hindi kailangang pagrereplanong muli, hindi lamang ang pagbawas sa latency ng isang pagkakataon na pag-iisip.
• Walang kailangang magsimula sa simula: Bilang isang framework para sa post-training, maaari itong i-optimize batay sa umiiral na VLA model, na nagbabawas sa gastos sa pagkolekta ng data at pag-train.
• Balanse ng bilis at tagumpay: Maaasahang horizon extension na nag-iwas sa pagpapalawak ng chunk nang walang layunin, at mga pagtatakda sa stabilidad na nag-iwas sa pagpapakita ng maikling daan.
• Maaaring magkakasundo sa pagpapabilis ng computing side: Pinapabilis ng PolicyTrim ang bilang ng forward inference, habang pinapabilis ng mga paraan tulad ng VLA-Cache ang oras sa bawat inference; ang dalawang landas ay orthogonal at maaaring magdulot ng komposito pagpapabilis.
Ang pangunahang punto ng PolicyTrim ay: para sa mga robot na VLA, ang pagiging epektibo sa pag-deploy ay hindi lamang nagmumula sa mas mabilis na pagpapatakbo ng modelo, kundi pati na rin sa mas epektibong pag-uugali ng patakaran. Ang pagpapababa ng "paglalakbay sa maling daan" ng robot ay maaari ring magdulot ng malaking pagpapabilis.
Mga sanggunian: https://arxiv.org/abs/2606.22540
Ang artikulong ito ay galing sa WeChat public account na “NeuroAI”, may-akda: NeuroAI; editor: LRST
