PolicyTrim 在無需重新訓練的情況下,將 VLA 機器人效率提升 5.83 倍

icon MarsBit
分享
AI summary icon精華摘要
MarsBit 報導指出,PolicyTrim 在無需重新訓練的情況下,將 VLA 機器人的效率提升了 5.83 倍。該框架通過刪減冗餘步驟並延長可靠動作序列來提升執行效果,在 LIBERO Object/π0.5 等任務中實現了 98% 的成功率。PolicyTrim 分為兩個階段:擴展可靠動作與壓縮物理步驟。此方法透過為現有 VLA 模型提供經濟高效的升級方案,符合 CFT 和 MiCA 合規目標,無需收集新數據或重新訓練。

【導讀】VLA 模型已能執行任務,但真實機器人仍顯緩慢!PolicyTrim 是一種優化 VLA 機器人執行效率的方法,無需重新訓練。它透過擴展可靠動作序列並減少冗餘步驟,協助機器人更直接完成任務,提升整體速度。

Vision-Language-Action(VLA)模型將視覺觀測、語言指令和機器人動作統一至一個策略模型中,使機器人能夠根據自然語言完成複雜操作任務。

從 OpenVLA、OpenVLA-OFT 到 π0.5、GR00T,這類模型正成為具身智能的重要技術路線。

但當 VLA 模型真正部署到機器人上時,一個關鍵瓶頸會立即顯現:機器人完成任務的總時間,不僅取決於每次推理有多快,也取決於策略需要執行多少次推理、多少個真實物理動作。

Bot

在同一批任務的多次 rollout 中,VLA 模型的執行步數存在顯著波動,說明更短、更直接的成功路徑是可達的,但當前策略往往只能偶然找到。

Action chunk tail is unreliable: The model predicts multiple actions at once, but later actions are more prone to accumulated errors, forcing the system to replan frequently. Forcing an extended execution length reduces success rate and increases physical steps.

物理動作冗餘嚴重:即便任務最終成功,軌跡中也可能包含大量糾錯、回退和重複動作。

因此,VLA 部署效率不僅要看每一步的推理延遲,更要看策略效率(policy efficiency):一次預測中有多少動作能放心執行?完成任務到底需要多少真實物理步驟?

現有方法大多從計算端入手,例如視覺 token 剪枝、量化、KV-cache 重用、蒸餾或推理引擎優化。這些方法可降低單次推理延遲,但如果策略仍需大量冗餘的物理步驟,真實任務的耗時仍會很長。

直接固定執行更長的 action chunk 也並不可靠。

論文中的實驗顯示,隨著強行將動作執行長度變長,成功率可能下降,物理步數反而增加。這說明低質量的尾部預測會把誤差帶入物理世界,機器人隨後需要更多糾錯動作。

關鍵問題:能否在不犧牲任務成功率的前提下,透過後訓練,讓已有 VLA 策略自動學會「少走彎路」,用更少物理步驟完成任務?

由四川大學雷印傑教授領導的團隊提出了 PolicyTrim——一個面向「策略效率」的兩階段強化學習後訓練框架。它不改變 VLA 架構,也不重新收集專家數據,而是在已有預訓練策略之上繼續優化機器人真實執行行為。

Bot

項目主頁:https://inceptionwang.github.io/PolicyTrim/

論文連結:https://arxiv.org/abs/2606.22540

代碼連結:https://github.com/INCEPTIONwang/PolicyTrim

模型連結:https://huggingface.co/INCEPTIONwang/PolicyTrim

新方法實現了:

  • 3× 動作 chunk 利用率,更長 horizon 可靠執行;
  • 51.4% 物理步數減少,壓縮冗餘修正動作;
  • 5.83× 端到端最高加速,LIBERO Object/π0.5;

從「算得更快」到「做得更快」

PolicyTrim 的核心目標不是取代計算端加速,而是彌補另一個被忽略的維度:減少完成任務所需的前向推理次數。它將策略效率拆分為兩個可優化的目標:先擴展可靠的動作 chunk,再壓縮冗餘的物理步驟。

Bot

1. 可靠動作 chunk 擴展(Reliable Action Chunk Extension)

目前許多 VLA 策略以 action chunk 形式輸出動作序列,但在部署時往往只敢執行前幾步。PolicyTrim 第一階段使用 dynamic execution horizon exploration:對同一組 rollout 分配不同的接受比率,讓模型在短、中、長窗口上並行探索可靠邊界。

成功完成任務且執行窗口更長的軌跡將獲得更高 reward,鼓勵模型將原本不可靠的 chunk 尾部動作變得更可用。

Horizon reward 僅在組內出現成功軌跡時激活,以避免模型在失敗情況下盲目追求更長的 chunk 長度。

2. 冗餘感知的步數壓縮(Redundancy-Aware Step Reduction)

當可靠 horizon 被擴展之後,第二階段進一步減少總物理步數。PolicyTrim 引入 step-saving reward:成功軌跡用越少步驟完成任務,獎勵越高。

step-saving reward 直接把「更短、更直接的成功軌跡」寫進優化目標。

Group-anchored regularization 抑制不可複現的投機捷徑,避免模型只追求短路徑卻損害成功率。

兩階段順序優化可避免「拉長 chunk」和「縮短步數」兩個目標互相干擾,最終減少完成任務所需的前向推理次數。

實驗結果

PolicyTrim 在 LIBERO、ManiSkill、Meta-World 以及真實機器人任務上進行了驗證,涵蓋 π0.5、OpenVLA-OFT、GR00T 等不同 VLA 架構。整體結果顯示,PolicyTrim 在保持任務成功率穩定的同時,顯著提升執行效率。

In LIBERO, π0.5 achieves up to 5.83x end-to-end acceleration while maintaining a success rate above 98%.

跨基準結果顯示,PolicyTrim 在 ManiSkill 上最高達到 2.36 倍加速,在 Meta-World 上達到 2.52 倍加速。

跨架構結果顯示,重新預訓練後的 OpenVLA-OFT 採用完整兩階段流程可達 2.97 倍加速;OpenVLA 僅使用第二階段也能達 1.41 倍加速。

Bot

定性對比:少走彎路,軌跡更直接

On randomly sampled LIBERO tasks, the baseline often exhibits redundant correction actions and hesitation/jittering near the target; PolicyTrim’s trajectories are smoother and more direct, completing the same task in fewer physical steps, typically reducing the number of physical steps by about half.

Bot

真實機器人部署:模擬中的效率收益可遷移至物理世界

論文進一步在配備兩台 Intel RealSense D435i 相機的 Agilex Piper 機械臂上,驗證真實機器人任務,包括 FlipMug、HangMug 和 TapeBox 三類任務。實驗涵蓋固定目標位置的標準設定,以及在抓取過程中隨機擾動目標的動態設定。

PolicyTrim 在標準設定和動態擾動設定下均維持或提升成功率,同時顯著縮短真實執行時間。在標準真實機器人設定下,平均實現 1.86 倍端到端加速。

Bot

Bot

From the experimental results, PolicyTrim does not merely optimize benchmark metrics: on physical robots, task completion time is also reduced to approximately half of the baseline, while maintaining robustness in dynamic interference scenarios.

為什麼 PolicyTrim 有效?

• 提升策略本身效率:它減少冗餘操作和不必要的重新規劃,而不僅僅是降低單次推理延遲。

• 無需從頭訓練:作為後訓練框架,可基於現有 VLA 模型繼續優化,降低數據收集和訓練成本。

• 平衡速度與成功率:可靠的 Horizon 擴展避免盲目延長 chunk,穩定性約束避免短路徑投機。

• 可與計算側加速疊加:PolicyTrim 優化前向推理次數,VLA-Cache 等方法優化每次推理耗時,兩條路徑正交且可產生複合加速。

PolicyTrim 的核心觀點是:對於 VLA 機器人而言,部署效率不僅來自更快的模型推理,也來自更高效的策略行為。讓機器人「少走彎路」,同樣可以帶來顯著加速。

參考資料:https://arxiv.org/abs/2606.22540

本文來自微信公眾號「新智元」,作者:新智元;編輯:LRST

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露