PolicyTrim augmente l'efficacité du robot VLA de 5,83 fois sans re-entraînement

icon MarsBit
Partager
AI summary iconRésumé
PolicyTrim augmente l'efficacité du robot VLA de 5,83 fois sans re-entraînement, selon MarsBit. Ce cadre améliore l'exécution en supprimant les étapes redondantes et en prolongeant les séquences d'actions fiables. Il atteint un taux de réussite de 98 % pour des tâches telles que LIBERO Object/π0.5. PolicyTrim fonctionne en deux étapes : expansion des actions fiables et compression des étapes physiques. La méthode s'aligne sur les objectifs de conformité CFT et MiCA en offrant une mise à niveau rentable pour les modèles VLA existants. Aucune collecte de nouvelles données ni re-entraînement n'est nécessaire.

[Introduction] Le modèle VLA sait déjà accomplir des tâches, mais les robots réels restent lents ! PolicyTrim est une méthode d'optimisation de l'efficacité d'exécution des robots VLA, sans nécessiter de re-entraînement. Elle améliore la vitesse globale en étendant les séquences d'actions fiables et en réduisant les étapes redondantes, permettant aux robots d'accomplir les tâches de manière plus directe.

Les modèles Vision-Language-Action (VLA) unifient les observations visuelles, les instructions linguistiques et les actions robotiques dans un seul modèle de stratégie, permettant aux robots d'accomplir des tâches complexes en se basant sur un langage naturel.

De OpenVLA et OpenVLA-OFT à π0.5 et GR00T, ces modèles deviennent une voie technologique importante pour l'intelligence incarnée.

Mais lorsqu'un modèle VLA est réellement déployé sur un robot, un goulot d'étranglement clé apparaît immédiatement : le temps total nécessaire au robot pour accomplir une tâche ne dépend pas seulement de la vitesse de chaque inférence, mais aussi du nombre d'inférences nécessaires et du nombre d'actions physiques réelles à effectuer.

Robot

Lors de plusieurs rollouts de la même tâche, le nombre d'étapes effectuées par le modèle VLA présente une forte variabilité, ce qui indique que des chemins de réussite plus courts et plus directs sont accessibles, mais que la stratégie actuelle ne les trouve que par hasard.

Les actions en fin de chunk sont peu fiables : le modèle prédit plusieurs actions en une seule fois, mais les actions situées en fin de séquence accumulent plus facilement des erreurs, obligeant le système à replanifier fréquemment. Allonger artificiellement la longueur d'exécution réduit le taux de réussite et augmente le nombre de pas physiques.

Redondance physique importante : même si la tâche réussit finalement, la trajectoire peut contenir de nombreux gestes de correction, de retour en arrière et de répétition.

Ainsi, l'efficacité du déploiement de VLA ne se mesure pas seulement à la latence d'inférence à chaque étape, mais aussi à l'efficacité de la politique (policy efficiency) : combien d'actions peuvent-elles être exécutées en toute confiance lors d'une seule prédiction ? Combien d'étapes physiques réelles sont nécessaires pour accomplir la tâche ?

Les méthodes existantes s'attaquent principalement au côté calcul, par exemple par élagage des tokens visuels, quantification, réutilisation du KV-cache, distillation ou optimisation des moteurs d'inférence. Ces approches peuvent réduire la latence d'une seule inférence, mais si la stratégie nécessite encore de nombreuses étapes physiques redondantes, le temps réel d'exécution des tâches reste long.

Fixer directement un chunk d'action plus long n'est pas non plus fiable.

Les expériences dans l'article montrent que, en forçant l'allongement de la durée d'exécution des actions, le taux de réussite peut diminuer, tandis que le nombre de pas physiques augmente. Cela indique que les prédictions de queue de mauvaise qualité introduisent des erreurs dans le monde physique, obligeant le robot à effectuer davantage d'actions de correction.

Question clé : Peut-on, par un entraînement postérieur, permettre aux stratégies VLA existantes d'apprendre automatiquement à « emprunter les chemins les plus directs » pour accomplir les tâches en moins d'étapes physiques, sans compromettre le taux de réussite ?

L'équipe dirigée par le professeur Lei Yinjie de l'Université du Sichuan a proposé PolicyTrim — un cadre d'entraînement postérieur à deux étapes axé sur l'efficacité des stratégies. Il n'altère pas l'architecture VLA ni ne recueille de nouvelles données d'experts, mais optimise plutôt les comportements réels d'exécution des robots sur la base des stratégies déjà pré-entraînées.

Robot

Page du projet : https://inceptionwang.github.io/PolicyTrim/

Lien vers l'article : https://arxiv.org/abs/2606.22540

Lien du code : https://github.com/INCEPTIONwang/PolicyTrim

Lien du modèle : https://huggingface.co/INCEPTIONwang/PolicyTrim

Une nouvelle méthode a été réalisée :

  • Utilisation de chunk à 3×, exécution fiable sur un horizon plus long ;
  • Réduction de 51,4 % des pas physiques, compression des actions de correction redondantes ;
  • 5,83× accélération maximale de bout en bout, LIBERO Object/π0,5 ;

De « calculer plus vite » à « agir plus vite »

L'objectif principal de PolicyTrim n'est pas de remplacer l'accélération du calcul, mais de combler une autre dimension négligée : réduire le nombre d'inférences avant nécessaires pour accomplir une tâche. Il décompose l'efficacité de la stratégie en deux objectifs optimisables : d'abord étendre les chunks d'actions fiables, puis compresser les étapes physiques redondantes.

Robot

1. Extension de chunk d'action fiable (Reliable Action Chunk Extension)

De nombreuses stratégies VLA génèrent des séquences d'actions sous forme de chunks d'action, mais lors du déploiement, on se contente souvent d'exécuter uniquement les premières étapes. La première phase de PolicyTrim utilise l'exploration de horizon d'exécution dynamique : des taux d'acceptation différents sont attribués aux mêmes rollouts, permettant au modèle d'explorer en parallèle les limites fiables sur des fenêtres courtes, moyennes et longues.

Les trajectoires qui réussissent la tâche et disposent d'une fenêtre d'exécution plus longue obtiennent une récompense plus élevée, encourageant le modèle à rendre les actions de la fin des morceaux initialement peu fiables plus utilisables.

La récompense horizon n'est activée que lorsqu'une trajectoire réussie est observée au sein du groupe, afin d'éviter que le modèle ne cherche aveuglément des longueurs de chunk plus importantes en cas d'échec.

2. Réduction des pas consciente de la redondance (Redundancy-Aware Step Reduction)

Après extension de l'horizon fiable, la deuxième phase réduit davantage le nombre total d'étapes physiques. PolicyTrim introduit une récompense d'économie d'étapes : plus une trajectoire réussie complète la tâche en peu d'étapes, plus la récompense est élevée.

Récompense d'économie d'étapes : intégrez directement « un parcours de réussite plus court et plus direct » dans l'objectif d'optimisation.

La régularisation ancrée au groupe supprime les raccourcis spéculatifs non reproductibles, empêchant le modèle de privilégier uniquement les chemins courts au détriment du taux de réussite.

L'optimisation en deux étapes permet d'éviter que les objectifs de « allonger le chunk » et de « réduire le nombre d'étapes » ne se perturbent mutuellement, réduisant ainsi le nombre total d'inférences avant nécessaires pour accomplir la tâche.

Résultats de l'expérience

PolicyTrim a été validé sur LIBERO, ManiSkill, Meta-World et des tâches de robots réels, en couvrant différentes architectures VLA telles que π0.5, OpenVLA-OFT et GR00T. Les résultats globaux montrent que PolicyTrim améliore significativement l'efficacité d'exécution tout en maintenant une réussite tâche stable.

Dans LIBERO, π0.5 atteint une accélération extrémité à extrémité maximale de 5,83 fois, tout en maintenant un taux de réussite supérieur à 98 %.

Les résultats croisés montrent que PolicyTrim atteint un accélération maximale de 2,36 fois sur ManiSkill et de 2,52 fois sur Meta-World.

Les résultats cross-architecture montrent que OpenVLA-OFT re-entraîné, en utilisant le processus complet en deux étapes, atteint une accélération de 2,97 fois ; OpenVLA n'utilisant que la deuxième étape atteint également une accélération de 1,41 fois.

Robot

Comparaison qualitative : évitez les détours, trajectoire plus directe

Sur les tâches LIBERO échantillonnées aléatoirement, la méthode de référence présente souvent des actions de correction redondantes et des hésitations ou des tremblements près de la cible ; les trajectoires de PolicyTrim sont plus lisses et plus directes, permettant d'accomplir la même tâche avec moins d'étapes physiques, réduisant généralement le nombre d'étapes physiques d'environ la moitié.

Robot

Real robot deployment: Efficiency gains from simulation can be transferred to the physical world

Le papier valide également les tâches réelles sur un bras robotique Agilex Piper équipé de deux caméras Intel RealSense D435i, incluant trois types de tâches : FlipMug, HangMug et TapeBox. Les expériences couvrent à la fois un paramétrage standard avec des positions cibles fixes et un paramétrage dynamique avec des perturbations aléatoires des cibles pendant la prise.

PolicyTrim maintient ou améliore le taux de réussite à la fois en configuration standard et en configuration de perturbation dynamique, tout en réduisant significativement le temps d'exécution réel. En configuration standard avec robots réels, une accélération end-to-end moyenne de 1,86 fois est atteinte.

Robot

Robot

Les résultats expérimentaux montrent que PolicyTrim n'optimise pas uniquement les indicateurs de référence : sur des robots physiques, le temps de accomplissement de la tâche est réduit d'environ la moitié par rapport au baseline, tout en conservant une robustesse dans des scénarios avec interférences dynamiques.

Pourquoi PolicyTrim fonctionne-t-il ?

• Optimisation de l'efficacité de la stratégie elle-même : elle réduit les actions redondantes et les replanifications inutiles, et non seulement le délai d'inférence unique.

• Pas besoin d'entraînement depuis le début : en tant que cadre de post-entraînement, il peut optimiser les modèles VLA existants, réduisant ainsi les coûts de collecte de données et d'entraînement.

• Équilibre entre vitesse et taux de réussite : une extension horizon fiable évite d’allonger inutilement les chunks, et les contraintes de stabilité empêchent les stratégies short-path.

• Compatibles avec l'accélération du côté calcul : PolicyTrim optimise le nombre d'inférences forward, tandis que des méthodes comme VLA-Cache réduisent le temps d'inférence par opération ; les deux approches sont orthogonales et peuvent générer une accélération composite.

Le point central de PolicyTrim est que, pour les robots VLA, l'efficacité du déploiement ne provient pas seulement d'une inférence de modèle plus rapide, mais aussi d'un comportement de stratégie plus efficace. Faire en sorte que le robot « emprunte moins de chemins détournés » peut également entraîner une accélération significative.

Références : https://arxiv.org/abs/2606.22540

Cet article provient du compte officiel WeChat « Nouvelle Intelligence », auteur : Nouvelle Intelligence ; éditeur : LRST

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.