【Guía】¡El modelo VLA ya puede realizar tareas, pero los robots reales aún son lentos! PolicyTrim es un método para optimizar la eficiencia de ejecución de robots VLA sin necesidad de reentrenarlos. Al extender secuencias de acciones confiables y reducir pasos redundantes, ayuda a los robots a completar tareas de forma más directa, mejorando la velocidad general.
Los modelos Vision-Language-Action (VLA) unifican las observaciones visuales, las instrucciones lingüísticas y los movimientos del robot en un solo modelo de política, permitiendo que los robots realicen tareas complejas según instrucciones en lenguaje natural.
Desde OpenVLA y OpenVLA-OFT hasta π0.5 y GR00T, estos modelos están convirtiéndose en una importante línea tecnológica para la inteligencia encarnada.
Pero cuando el modelo VLA se implementa realmente en un robot, se manifiesta inmediatamente un cuello de botella clave: el tiempo total que tarda el robot en completar una tarea no solo depende de cuán rápido es cada inferencia, sino también de cuántas inferencias necesita ejecutar la estrategia y cuántos movimientos físicos reales requiere.

En múltiples ejecuciones de la misma tarea, el número de pasos ejecutados por el modelo VLA muestra una variación significativa, lo que indica que rutas de éxito más cortas y directas son alcanzables, pero la estrategia actual solo las encuentra ocasionalmente.
Los movimientos al final del chunk son inconfiables: el modelo predice múltiples acciones a la vez, pero cuanto más hacia el final, más propensas son a acumular errores, lo que obliga al sistema a replanificar con frecuencia. Forzar un alargamiento de la duración de la ejecución reduce la tasa de éxito y aumenta el número de pasos físicos.
Exceso significativo de movimientos físicos: incluso si la tarea tiene éxito al final, la trayectoria puede incluir numerosos ajustes, retrocesos y acciones repetidas.
Por lo tanto, la eficiencia de implementación de VLA no solo debe evaluarse por la latencia de inferencia en cada paso, sino también por la eficiencia de la política (policy efficiency): ¿cuántas acciones se pueden ejecutar con confianza en una sola predicción? ¿Cuántos pasos físicos reales son necesarios para completar la tarea?
Los métodos existentes principalmente abordan el lado del cálculo, por ejemplo, mediante poda de tokens visuales, cuantización, reutilización de KV-cache, distilación u optimización del motor de inferencia. Estos métodos pueden reducir la latencia de una sola inferencia, pero si la estrategia aún requiere numerosos pasos físicos redundantes, el tiempo real de ejecución de la tarea sigue siendo largo.
También es poco confiable ejecutar directamente chunks de acción más largos.
Los experimentos en el artículo muestran que, al forzar un aumento en la duración de las acciones ejecutadas, la tasa de éxito puede disminuir y el número de pasos físicos aumenta. Esto indica que las predicciones de cola de baja calidad introducen errores en el mundo físico, lo que obliga al robot a realizar más acciones de corrección.
Pregunta clave: ¿Es posible, mediante un entrenamiento posterior, que las estrategias de VLA existentes aprendan automáticamente a «evitar caminos innecesarios» y completar tareas con menos pasos físicos, sin sacrificar la tasa de éxito?
Un equipo liderado por el profesor Lei Yinjie de la Universidad de Sichuan propuso PolicyTrim: un marco de postentrenamiento por refuerzo en dos etapas orientado a la «eficiencia de la estrategia». No modifica la arquitectura VLA ni vuelve a recopilar datos de expertos, sino que optimiza continuamente el comportamiento real de ejecución del robot sobre la estrategia preentrenada existente.

Página principal del proyecto: https://inceptionwang.github.io/PolicyTrim/
Enlace al artículo: https://arxiv.org/abs/2606.22540
Enlace al código: https://github.com/INCEPTIONwang/PolicyTrim
Enlace del modelo: https://huggingface.co/INCEPTIONwang/PolicyTrim
Se ha implementado el nuevo método:
- Utilización de chunk en 3×, ejecución confiable con horizonte más largo;
- Reducción del 51,4% en los pasos físicos; compresión de acciones de corrección redundantes;
- 5.83× aceleración máxima de extremo a extremo, LIBERO Object/π0.5;
De "calcular más rápido" a "hacer más rápido"
El objetivo principal de PolicyTrim no es reemplazar la aceleración en el lado de cálculo, sino abordar otra dimensión ignorada: reducir el número de inferencias hacia adelante necesarias para completar una tarea. Divide la eficiencia de la política en dos objetivos optimizables: primero, expandir los chunks de acciones confiables; luego, comprimir los pasos físicos redundantes.

1. Extensión de chunk de acción confiable (Reliable Action Chunk Extension)
Actualmente, muchas estrategias VLA generan secuencias de acciones en forma de action chunk, pero durante la implementación, a menudo solo se ejecutan los primeros pasos. La primera fase de PolicyTrim utiliza dynamic execution horizon exploration: se asignan diferentes tasas de aceptación a los mismos rollouts, permitiendo que el modelo explore en paralelo los límites confiables en ventanas cortas, medias y largas.
Las trayectorias que completan con éxito la tarea y tienen una ventana de ejecución más larga obtienen una recompensa mayor, lo que anima al modelo a hacer que las acciones en la cola de los fragmentos originalmente poco confiables sean más útiles.
La recompensa de horizon solo se activa cuando se logra una trayectoria exitosa dentro del grupo, evitando que el modelo persiga ciegamente longitudes de chunk más largas en casos de fracaso.
2. Compresión de pasos consciente de la redundancia (Redundancy-Aware Step Reduction)
Una vez que se amplía el horizonte confiable, la segunda fase reduce aún más el número total de pasos físicos. PolicyTrim introduce una recompensa de ahorro de pasos: cuanto menos pasos se utilicen para completar una trayectoria exitosa, mayor será la recompensa.
step-saving reward escribe directamente «una trayectoria de éxito más corta y más directa» en el objetivo de optimización.
La regularización anclada al grupo suprime atajos especulativos no reproducibles, evitando que el modelo busque únicamente rutas cortas a expensas de la tasa de éxito.
La optimización en dos fases secuenciales evita que los objetivos de "alargar el chunk" y "reducir el número de pasos" se interfieran entre sí, reduciendo finalmente el número de inferencias hacia adelante necesarias para completar la tarea.
Resultados del experimento
PolicyTrim se validó en tareas LIBERO, ManiSkill, Meta-World y robots reales, cubriendo distintas arquitecturas VLA como π0.5, OpenVLA-OFT y GR00T. Los resultados generales muestran que PolicyTrim mejora significativamente la eficiencia de ejecución mientras mantiene la tasa de éxito de las tareas estable.
En LIBERO, π0.5 logra una aceleración punto a punto de hasta 5.83 veces, manteniendo una tasa de éxito superior al 98%.
Los resultados cruzados de referencia muestran que PolicyTrim alcanza una aceleración máxima de 2.36 veces en ManiSkill y de 2.52 veces en Meta-World.
Los resultados cruzados de arquitectura muestran que OpenVLA-OFT reentrenado puede lograr una aceleración de 2.97 veces utilizando el proceso completo de dos etapas; OpenVLA que utiliza solo la segunda etapa también logra una aceleración de 1.41 veces.

Comparación cualitativa: evita caminos erróneos, trayectoria más directa
En tareas LIBERO muestreadas aleatoriamente, el baseline a menudo presenta acciones de corrección redundantes y hesitación/jittering cerca del objetivo; las trayectorias de PolicyTrim son más suaves y directas, logrando completar la misma tarea con menos pasos físicos, generalmente reduciendo el número de pasos físicos a aproximadamente la mitad.

Real robot deployment: Efficiency gains from simulation can be transferred to the physical world
El artículo también valida tareas robóticas reales en un brazo robótico Agilex Piper equipado con dos cámaras Intel RealSense D435i, incluyendo tres tipos de tareas: FlipMug, HangMug y TapeBox. Los experimentos cubren tanto el escenario estándar con posiciones objetivo fijas como el escenario dinámico con perturbaciones aleatorias del objetivo durante la manipulación.
PolicyTrim mantiene o mejora la tasa de éxito tanto en configuraciones estándar como en configuraciones de perturbación dinámica, reduciendo significativamente el tiempo de ejecución real. En el entorno de robot real estándar, logra una aceleración end-to-end promedio de 1.86 veces.


Según los resultados experimentales, PolicyTrim no solo optimiza las métricas de referencia: también reduce el tiempo de finalización de la tarea a aproximadamente la mitad del baseline en robots físicos y mantiene robustez en escenarios con interferencias dinámicas.
¿Por qué funciona PolicyTrim?
• Optimización orientada a la estrategia en sí: reduce acciones redundantes y replanificaciones innecesarias, no solo la latencia de inferencia individual.
• Sin necesidad de entrenar desde cero: como marco de postentrenamiento, puede optimizar modelos VLA existentes, reduciendo los costos de recopilación de datos y entrenamiento.
• Equilibrio entre velocidad y tasa de éxito: la expansión confiable de horizon evita extender innecesariamente los chunk, y las restricciones de estabilidad evitan la especulación con rutas cortas.
• Puede combinarse con aceleración en el lado de cómputo: PolicyTrim optimiza el número de inferencias hacia adelante, mientras que métodos como VLA-Cache optimizan el tiempo por inferencia; ambas vías son ortogonales y pueden generar una aceleración compuesta.
La idea central de PolicyTrim es que, para los robots VLA, la eficiencia de implementación no solo proviene de una inferencia de modelo más rápida, sino también de comportamientos de estrategia más eficientes. Hacer que los robots "eviten caminos innecesarios" también puede generar aceleraciones significativas.
Referencia: https://arxiv.org/abs/2606.22540
Este artículo proviene del canal de WeChat "Neozhiyuan", autor: Neozhiyuan; editor: LRST
