PolicyTrimは再学習なしでVLAロボットの効率を5.83倍に向上

icon MarsBit
共有
AI summary icon概要
MarsBitの報告によると、PolicyTrimは再学習なしでVLAロボットの効率を5.83倍向上させます。このフレームワークは、不要なステップを削除し、信頼できるアクションシーケンスを拡張することで実行を改善します。LIBERO Object/π0.5などのタスクで98%の成功率を達成しています。PolicyTrimは、信頼できるアクションの拡張と物理的ステップの圧縮という2段階で動作します。この手法は、既存のVLAモデルにコスト効率の良いアップグレードを提供することで、CFTおよびMiCA準拠の目標と一致しています。新たなデータ収集や再学習は不要です。

【ガイド】VLAモデルはすでにタスクを実行できますが、実際のロボットは依然として遅い!PolicyTrimは、再学習なしにVLAロボットの実行効率を最適化する方法です。信頼できる動作シーケンスを拡張し、冗長なステップを削減することで、ロボットがタスクをより直接的に完了し、全体的な速度を向上させます。

ビジョン・ランゲージ・アクション(VLA)モデルは、視覚観測、言語指示、ロボット動作を1つのポリシーモデルに統合し、ロボットが自然言語に基づいて複雑な操作タスクを実行できるようにします。

OpenVLA、OpenVLA-OFTからπ0.5、GR00Tまで、これらのモデルはエムボディードインテリジェンスの重要な技術路線となっています。

しかし、VLAモデルをロボットに実際に展開した際、重要なボトルネックが即座に浮上します。ロボットがタスクを完了する総時間は、各推論の速度だけでなく、戦略がどれだけ多くの推論と実際の物理的動作を必要とするかにも依存します。

ボット

同じタスクの複数のロールアウトにおいて、VLAモデルの実行ステップ数に顕著な変動が見られ、より短く直接的な成功経路が可能であることを示しているが、現在のポリシーは偶然その経路を発見するにとどまっている。

動作のチェンクの末尾が信頼できない:モデルが一度に複数の動作を予測するが、後方の動作ほど誤差が蓄積しやすく、システムは頻繁に再計画を強いられる。実行長を無理に延長すると成功率が低下し、物理的なステップ数が増加する。

物理動作の重複が深刻である:タスクが最終的に成功しても、トラジェクトリには多くの修正、戻り、および繰り返し動作が含まれる可能性がある。

したがって、VLAの展開効率は、各ステップの推論遅延だけでなく、ポリシー効率(policy efficiency)も見なければなりません。1回の予測で、どの程度のアクションを安心して実行できるか?タスクを完了するには、実際に必要な物理的ステップはいくつあるか?

従来の方法は主に計算側に焦点を当てており、たとえばビジョナルトークンのプリニング、量子化、KVキャッシュの再利用、蒸留、または推論エンジンの最適化などが含まれます。これらの方法は単一の推論遅延を削減できますが、戦略が依然として多数の冗長な物理的ステップを必要とする場合、実際のタスクにかかる時間は依然として長くなります。

直接固定执行更长的action chunk也不可靠。

論文の実験では、行動の実行長を強制的に延長すると、成功率が低下し、物理ステップ数が逆に増加することが示されています。これは、低品質な終端予測が誤差を物理世界に持ち込み、ロボットがより多くの修正行動を必要とすることを意味します。

重要な質問:タスクの成功率を犠牲にすることなく、後学習によって既存のVLA戦略が「無駄なステップを減らし」、より少ない物理的ステップでタスクを完了できるように自動的に学習できるか?

四川大学の雷印杰教授が率いるチームは、PolicyTrimと呼ばれる、戦略効率を目的とした二段階の強化学習後トレーニングフレームワークを提案しました。このフレームワークはVLAアーキテクチャを変更せず、専門家のデータを再収集することなく、既存の事前学習済み戦略を基にロボットの実際の実行行動を最適化します。

ボット

プロジェクトページ:https://inceptionwang.github.io/PolicyTrim/

論文リンク:https://arxiv.org/abs/2606.22540

コードリンク:https://github.com/INCEPTIONwang/PolicyTrim

モデルリンク:https://huggingface.co/INCEPTIONwang/PolicyTrim

新しい方法が実現されました:

  • 3×アクションチャンク利用率、より長いホライズンでの信頼性ある実行;
  • 物理ステップ数が51.4%削減され、冗長な修正動作が圧縮されました。
  • 5.83倍のエンドツーエンド最大加速、LIBERO Object/π0.5;

「より速く計算する」から「より速く実行する」へ

PolicyTrimの核心目標は、計算側の加速を置き換えることではなく、見過ごされてきたもう一つの次元を補うこと、つまりタスクを完了するために必要なフォワード推論の回数を減らすことです。これは、戦略の効率を二つの最適化可能な目標に分解します。まず信頼できるアクションのチャンクを拡張し、次に冗長な物理ステップを圧縮します。

ボット

1. 可靠なアクションチャンク拡張(Reliable Action Chunk Extension)

現在、多くのVLA戦略はアクションチェンク形式でアクションシーケンスを出力するが、実行時には通常、最初の数ステップのみを実行する。PolicyTrimの第1段階では、ダイナミックな実行ホライズン探索を使用し、同じロールアウトに異なる受容比率を割り当てることで、モデルが短・中・長期のウィンドウ上で並行的に信頼可能な境界を探索できるようにする。

タスクを成功裏に完了し、実行ウィンドウが長いトラジェクトリーにはより高いリワードが与えられ、モデルが元々信頼できなかったチャンクの末尾のアクションをより使いやすくするよう促す。

ホライズン報酬は、グループ内で成功の経路が発生した場合にのみ活性化され、モデルが失敗時に無意味に長いチャンク長を追求するのを防ぎます。

2. 冗長性認識型ステップ削減(Redundancy-Aware Step Reduction)

信頼できるhorizonが拡張された後、第二段階で総物理ステップ数をさらに削減します。PolicyTrimはステップ節約報酬を導入します:成功したトレジャリーはステップ数が少ないほど、報酬が高くなります。

ステップ削減報酬を最適化目標に「より短く、より直接的な成功の道筋」を直接組み込む。

グループ基準正則化は、再現不可能な投機的近道を抑制し、モデルが短いパスのみを追求して成功率を損なうのを防ぎます。

二段階の順序最適化により、「chunkを長くする」と「ステップ数を減らす」の二つの目標が互いに干渉することを回避し、タスク完了に必要なフォワード推論回数を削減できます。

実験結果

PolicyTrimは、LIBERO、ManiSkill、Meta-Worldおよび実際のロボットタスクで検証され、π0.5、OpenVLA-OFT、GR00Tなどの異なるVLAアーキテクチャをカバーしています。全体的な結果によると、PolicyTrimはタスク成功率を安定させながら、実行効率を大幅に向上させました。

LIBEROでは、π0.5が端から端までの速度を最大5.83倍に向上させ、成功率は98%以上を維持します。

ベンチマーク間の結果によると、PolicyTrimはManiSkillで最大2.36倍の高速化、Meta-Worldで2.52倍の高速化を達成しました。

アーキテクチャ間の結果によると、再プリトレーニングされたOpenVLA-OFTが完全な2段階プロセスを用いることで2.97倍の高速化が達成され、OpenVLAが第2段階のみを使用しても1.41倍の高速化が可能です。

ボット

定性的比較:遠回りを減らし、経路がより直接的

ランダムにサンプリングされたLIBEROタスクにおいて、Baselineは冗長な修正動作や目標付近でのためらいや振動が発生しやすいが、PolicyTrimの軌道はより滑らかで直接的であり、同じタスクをより少ない物理ステップで完了でき、通常、物理ステップ数を約半分に削減できる。

ボット

リアルロボットの導入:シミュレーションでの効率性の利点を物理世界に移行可能

論文は、2台のIntel RealSense D435iカメラを搭載したAgilex Piperロボットアームを用いて、FlipMug、HangMug、TapeBoxの3つの実際のロボットタスクを検証しました。実験は、ターゲット位置が固定された標準設定と、グリッピング中にターゲットにランダムな摂動を加える動的設定をカバーしています。

PolicyTrimは、標準設定および動的擾動設定の両方で成功率を維持または向上させるとともに、実行時間を大幅に短縮します。標準的なリアルロボット設定では、平均して端から端までの加速が1.86倍になります。

ボット

ボット

実験結果によると、PolicyTrimはベンチマーク指標の最適化だけでなく、物理ロボット上でタスク完了時間をベースラインの約半分に短縮し、動的干渉シナリオにおいてもロバスト性を維持します。

なぜPolicyTrimは効果的ですか?

• プロセス自体の効率化:単一の推論遅延を低減するだけでなく、重複するアクションや不要な再計画を削減します。

• フレームワークとして後学習が可能:既存のVLAモデルを基に最適化でき、データ収集と学習コストを削減できます。

• 速度と成功率の両立:信頼できるhorizon拡張によりchunkを無意味に延長せず、安定性制約により短経路の投機を回避します。

• 計算側の加速と組み合わせ可能:PolicyTrimは前方推論の回数を最適化し、VLA-Cacheなどの手法は各推論の所要時間を最適化する。両者は直交しており、複合的な加速を実現できる。

PolicyTrimの核心的な見解は、VLAロボットにとって、デプロイ効率はモデル推論の高速化だけでなく、より効率的な戦略行動からももたらされることである。ロボットが「無駄な道を歩まないように」することで、同様に顕著なスピードアップが実現できる。

参照:https://arxiv.org/abs/2606.22540

本文は微信公众号「新智元」より、著者:新智元;編集:LRST

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。