[Pengenalan] Model VLA sudah mampu menjalankan tugas, tetapi robot sebenar masih perlahan! PolicyTrim adalah kaedah untuk mengoptimumkan kecekapan pelaksanaan robot VLA tanpa perlu melatih semula. Ia membantu robot menyelesaikan tugas dengan lebih langsung dengan memperluas urutan tindakan yang boleh dipercayai dan mengurangkan langkah-langkah yang berlebihan, meningkatkan kelajuan keseluruhan.
Model Vision-Language-Action (VLA) menggabungkan pengamatan visual, arahan bahasa, dan tindakan robot ke dalam satu model strategi, membolehkan robot menyelesaikan tugas operasi kompleks berdasarkan bahasa semula jadi.
Dari OpenVLA, OpenVLA-OFT hingga π0.5 dan GR00T, model-model ini sedang menjadi jalan teknologi penting dalam kecerdasan tubuh.
Namun, apabila model VLA benar-benar dideploykan ke robot, satu bottleneck utama akan segera muncul: masa total yang diperlukan robot untuk menyelesaikan tugas tidak hanya bergantung pada seberapa pantas setiap inferens, tetapi juga pada berapa banyak inferens dan berapa banyak tindakan fizikal sebenar yang diperlukan oleh strategi tersebut.

Dalam beberapa rollout tugas yang sama, bilangan langkah pelaksanaan model VLA menunjukkan fluktuasi yang ketara, menunjukkan bahawa laluan kejayaan yang lebih pendek dan lebih terus adalah boleh dicapai, tetapi strategi semasa sering hanya dapat menemui secara kebetulan.
Tindakan di hujung chunk tidak boleh dipercayai: Model meramal beberapa tindakan sekaligus, tetapi tindakan yang semakin ke belakang lebih mudah mengumpul ralat, menyebabkan sistem perlu merancang semula dengan kerap. Memaksa memperpanjang panjang pelaksanaan akan mengurangkan kejayaan dan meningkatkan bilangan langkah fizikal.
Keterlaluan gerakan fizikal yang berulang: Walaupun tugas berjaya pada akhirnya, trajektori mungkin mengandungi banyak tindakan koreksi, undur, dan pengulangan.
Oleh itu, kecekapan penyebaran VLA tidak hanya bergantung pada latensi inferensi setiap langkah, tetapi juga kecekapan strategi (policy efficiency): berapa banyak tindakan yang boleh dilaksanakan dengan yakin dalam satu ramalan? Berapa banyak langkah fizikal sebenar yang diperlukan untuk menyelesaikan tugas?
Kebanyakan kaedah yang sedia ada berfokus pada sisi pengiraan, seperti pemotongan token visual, kuantisasi, semula jadi KV-cache, pendidikan atau pengoptimuman enjin inferens. Kaedah-kaedah ini boleh mengurangkan latensi inferens tunggal, tetapi jika strategi masih memerlukan banyak langkah fizikal yang berlebihan, masa sebenar tugas masih akan panjang.
Menggunakan chunk tindakan yang lebih panjang secara langsung dan tetap juga tidak boleh dipercaya.
Eksperimen dalam kertas ini menunjukkan bahawa semakin panjang panjang tindakan yang dipaksakan, kejayaan mungkin menurun, sementara bilangan langkah fizikal meningkat. Ini menunjukkan bahawa ramalan ekor yang berkualiti rendah akan membawa ralat ke dunia fizikal, menyebabkan robot memerlukan lebih banyak tindakan koreksi.
Masalah utama: Adakah mungkin melalui pasca-pelatihan untuk membolehkan strategi VLA yang sudah ada belajar secara automatik "mengelakkan jalan buntu" dan menyelesaikan tugas dengan lebih sedikit langkah fizikal, tanpa mengorbankan kejayaan tugas?
Pasukan yang dipimpin oleh Profesor Lei Yinjie dari Universiti Sichuan mengusulkan PolicyTrim—sebuah kerangka kerja latihan selepas dua peringkat yang berfokus kepada "kecekapan strategi". Ia tidak mengubah arsitektur VLA atau mengumpul semula data pakar, tetapi meneruskan pengoptimuman tingkah laku pelaksanaan robot sebenar di atas strategi pra-dilatih yang sedia ada.

Laman utama projek: https://inceptionwang.github.io/PolicyTrim/
Pautan kertas: https://arxiv.org/abs/2606.22540
Pautan kod: https://github.com/INCEPTIONwang/PolicyTrim
Pautan model: https://huggingface.co/INCEPTIONwang/PolicyTrim
Metodologi baharu telah dicapai:
- Penggunaan chunk tindakan 3×, pelaksanaan yang lebih boleh dipercayai dengan horizon yang lebih panjang;
- 51.4% pengurangan langkah fizikal, mampat tindakan koreksi berlebihan;
- 5.83× pantas end-to-end tertinggi, LIBERO Object/π0.5;
Dari "Mengira Lebih Cepat" ke "Melakukan Lebih Cepat"
Matlamat utama PolicyTrim bukanlah menggantikan akselerasi sisi pengiraan, tetapi memenuhi dimensi lain yang diabaikan: mengurangkan bilangan inferens forward yang diperlukan untuk menyelesaikan tugas. Ia memecahkan kecekapan strategi kepada dua objektif yang boleh dioptimakan: terlebih dahulu mengembangkan chunk tindakan yang boleh dipercayai, kemudian memampatkan langkah fizikal yang berlebihan.

1. Ekstensi Chunk Tindakan Andal (Reliable Action Chunk Extension)
Sekarang, banyak strategi VLA mengeluarkan urutan tindakan dalam bentuk action chunk, tetapi semasa pelaksanaan, sering kali hanya berani menjalankan beberapa langkah pertama. Fasa pertama PolicyTrim menggunakan dynamic execution horizon exploration: mengalokasikan nisbah penerimaan yang berbeza kepada set rollout yang sama, membolehkan model mengeksplorasi sempadan boleh dipercayai secara selari pada jendela pendek, sederhana, dan panjang.
Tugas yang berjaya diselesaikan dengan jendela pelaksanaan yang lebih panjang akan mendapat reward yang lebih tinggi, mendorong model untuk menjadikan tindakan di bahagian belakang chunk yang sebelumnya tidak boleh dipercayai menjadi lebih boleh digunakan.
Hadiah horizon hanya diaktifkan apabila terdapat trajektori berjaya dalam kumpulan, untuk mengelakkan model daripada secara membabi buta mengejar panjang chunk yang lebih panjang dalam keadaan gagal.
2. Pemampatan langkah yang sedar redundansi (Redundancy-Aware Step Reduction)
Selepas horizon yang boleh dipercayai diperluaskan, fasa kedua mengurangkan jumlah langkah fizikal secara tambahan. PolicyTrim memperkenalkan ganjaran penjimat langkah: semakin sedikit langkah yang digunakan untuk menyelesaikan tugas dalam trajektori yang berjaya, semakin tinggi ganjarannya.
Hadiah penghematan langkah secara langsung menulis "jalur kejayaan yang lebih pendek dan lebih terus" ke dalam objektif pengoptimuman.
Pengaturan terasas kumpulan menghalang laluan spekulasi yang tidak boleh diulang, mengelakkan model hanya mengejar laluan pendek tetapi merosakkan kejayaan.
Pengoptimuman bertahap dua boleh mengelakkan tujuan "memanjangkan chunk" dan "mengurangkan langkah" saling mengganggu, akhirnya mengurangkan bilangan inferens maju yang diperlukan untuk menyelesaikan tugas.
Keputusan eksperimen
PolicyTrim telah diuji dalam tugas LIBERO, ManiSkill, Meta-World, dan tugas robot sebenar, serta mencakup pelbagai arsitektur VLA seperti π0.5, OpenVLA-OFT, dan GR00T. Hasil keseluruhan menunjukkan bahawa PolicyTrim secara signifikan meningkatkan kecekapan pelaksanaan sambil mengekalkan kejayaan tugas secara stabil.
Dalam LIBERO, π0.5 mencapai percepatan end-to-end sehingga 5.83 kali ganda, sambil mengekalkan kejayaan lebih daripada 98%.
Hasil lintas benchmark menunjukkan bahawa PolicyTrim mencapai percepatan sehingga 2.36 kali ganda di ManiSkill dan 2.52 kali ganda di Meta-World.
Hasil lintas arsitektur menunjukkan bahawa OpenVLA-OFT yang dilatih semula semula menggunakan proses dua peringkat penuh mencapai percepatan 2.97 kali; OpenVLA yang hanya menggunakan peringkat kedua juga mencapai percepatan 1.41 kali.

Perbandingan kualitatif: Kurang tersesat, trajektori lebih langsung
Dalam tugas LIBERO yang diambil secara rawak, Baseline sering menunjukkan tindakan koreksi berlebihan dan kegoyangan/keraguan di sekitar sasaran; trajektori PolicyTrim lebih licin dan lebih langsung, mampu menyelesaikan tugas yang sama dengan langkah fizikal yang lebih sedikit, biasanya mengurangkan jumlah langkah fizikal sehingga separuhnya.

Penempatan robot sebenar: Keuntungan kecekapan dalam simulasi boleh dipindahkan ke dunia fizikal
Kertas ini juga diuji pada lengan robot Agilex Piper yang dilengkapi dengan dua kamera Intel RealSense D435i untuk tugas robot sebenar, termasuk tiga jenis tugas: FlipMug, HangMug, dan TapeBox. Eksperimen mencakup pengaturan standard dengan posisi objek tetap, serta pengaturan dinamik dengan gangguan rawak terhadap objek semasa pengambilan.
PolicyTrim mempertahankan atau meningkatkan kejayaan dalam tetapan standard dan tetapan gangguan dinamik, sambil secara ketara mengurangkan masa pelaksanaan sebenar. Dalam tetapan robot sebenar standard, purata mencapai percepatan end-to-end 1.86 kali.


Berdasarkan keputusan eksperimen, PolicyTrim bukan hanya mengoptimumkan indikator benchmark: masa penyelesaian tugas pada robot fizikal juga berkurang sehingga separuh lebih kurang berbanding baseline, dan tetap mantap dalam skenario gangguan dinamik.
Mengapa PolicyTrim berkesan?
• Meningkatkan kecekapan strategi itu sendiri: ia mengurangkan tindakan berulang dan perancangan semula yang tidak perlu, bukan sekadar mengurangkan latensi inferensi tunggal.
• Tidak perlu melatih dari awal: Sebagai kerangka kerja pasca-pelatihan, ia boleh mengoptimumkan model VLA yang sudah ada, mengurangkan kos pengumpulan data dan pelatihan.
• Menyeimbangkan kelajuan dan kejayaan: ekspansi horizon yang boleh dipercayai mengelakkan penpanjangan chunk yang sembarangan, manakala sekatan kestabilan mengelakkan spekulasi laluan pendek.
• Boleh digabungkan dengan akselerasi sisi pengiraan: PolicyTrim mengoptimumkan bilangan inferensiaran maju, sementara kaedah seperti VLA-Cache mengoptimumkan masa setiap inferensiaran; kedua-dua laluan ini berserenjang dan boleh menghasilkan akselerasi gabungan.
Pandangan utama PolicyTrim ialah: bagi robot VLA, kecekapan pelaksanaan tidak hanya datang daripada inferens model yang lebih pantas, tetapi juga daripada tingkah laku strategi yang lebih cekap. Membuat robot "berjalan lebih sedikit melalui jalan yang salah" juga boleh membawa percepatan yang ketara.
Rujukan: https://arxiv.org/abs/2606.22540
Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan", penulis: Sinzhiyuan; penyunting: LRST
