[Введение] Модель VLA уже умеет выполнять задачи, но реальные роботы всё ещё медленны! PolicyTrim — это метод оптимизации эффективности выполнения задач роботами на базе VLA без необходимости переобучения. Он помогает роботам быстрее завершать задачи, расширяя надёжные последовательности действий и устраняя избыточные шаги.
Модели Vision-Language-Action (VLA) объединяют визуальные наблюдения, языковые инструкции и действия робота в единую стратегическую модель, позволяя роботам выполнять сложные операционные задачи на основе естественного языка.
От OpenVLA и OpenVLA-OFT до π0.5 и GR00T такие модели становятся важным направлением в области встроенного интеллекта.
Однако, когда модель VLA действительно развертывается на роботе, возникает ключевое узкое место: общее время выполнения задачи роботом зависит не только от скорости каждого вывода, но и от того, сколько раз необходимо выполнить вывод и сколько реальных физических действий требуется.

В ходе нескольких запусков одной и той же задачи количество шагов, выполняемых моделью VLA, значительно варьируется, что указывает на то, что более короткие и прямые успешные пути достижимы, но текущая стратегия обычно находит их лишь случайно.
Ненадежность конца чанка действий: модель предсказывает несколько действий за один раз, но действия, расположенные дальше, чаще накапливают ошибки, что вынуждает систему часто перепланировать. Принудительное удлинение длины выполнения снижает вероятность успеха и увеличивает количество физических шагов.
Серьезная избыточность физических движений: даже при успешном завершении задачи траектория может содержать множество корректирующих, возвратных и повторяющихся действий.
Поэтому эффективность развертывания VLA следует оценивать не только по задержке на каждом этапе вывода, но и по эффективности стратегии (policy efficiency): сколько действий можно безопасно выполнить за один прогноз? Сколько реальных физических шагов действительно необходимо для выполнения задачи?
Существующие методы в основном сосредоточены на вычислительной стороне, например, на обрезке визуальных токенов, квантовании, повторном использовании KV-cache, дистилляции или оптимизации движка вывода. Эти методы могут снизить задержку одного вывода, но если стратегия по-прежнему требует большого количества избыточных физических шагов, реальное время выполнения задачи остается длительным.
Прямое фиксированное выполнение более длинных блоков действий также ненадежно.
Эксперименты в статье показывают, что при принудительном увеличении длины выполнения действий成功率 может снижаться, а количество физических шагов, наоборот, увеличивается. Это указывает на то, что низкокачественные прогнозы в хвостовой части вносят ошибки в физический мир, после чего роботу требуется больше корректирующих действий.
Ключевой вопрос: можно ли с помощью пост-обучения заставить существующую стратегию VLA автоматически научиться «не ходить вокруг да около» и выполнять задачи за меньшее количество физических шагов, не снижая成功率 задач?
Команда под руководством профессора Лей Инъе из Сычуаньского университета предложила PolicyTrim — двухэтапную рамку для пост-обучения методов усиленного обучения, ориентированную на «эффективность стратегии». Она не изменяет архитектуру VLA и не собирает новые данные экспертов, а продолжает оптимизировать реальное исполнение роботом уже существующих предварительно обученных стратегий.

Главная страница проекта: https://inceptionwang.github.io/PolicyTrim/
Ссылка на статью: https://arxiv.org/abs/2606.22540
Ссылка на код: https://github.com/INCEPTIONwang/PolicyTrim
Ссылка на модель: https://huggingface.co/INCEPTIONwang/PolicyTrim
Новый метод реализован:
- 3× использование чанков действий, более надежное выполнение с удлиненным горизонтом;
- Снижение физических шагов на 51,4%, сжатие избыточных корректирующих действий;
- 5,83× максимальное ускорение от конца до конца, LIBERO Object/π0.5;
От «быстрее считать» к «быстрее делать»
Основная цель PolicyTrim — не заменить ускорение на вычислительной стороне, а дополнить другой недооцененный аспект: снижение количества прямых выводов, необходимых для выполнения задачи. Она разделяет эффективность стратегии на две оптимизируемые цели: сначала расширить надежные фрагменты действий, затем сжать избыточные физические шаги.

1. Расширение надежного чанка действий (Reliable Action Chunk Extension)
Сегодня многие стратегии VLA выводят последовательности действий в виде action chunk, но при развертывании часто выполняют только первые несколько шагов. На первом этапе PolicyTrim использует динамическое исследование горизонта выполнения: одной и той же группе рулонов назначаются разные коэффициенты принятия, что позволяет модели параллельно исследовать надежные границы на коротких, средних и длинных окнах.
Более высокая награда присуждается за успешное выполнение задачи с более длительным окном выполнения, что поощряет модель делать действия в хвосте ранее ненадежных фрагментов более полезными.
Horizon reward активируется только при наличии успешной траектории в группе, чтобы избежать слепого стремления модели к более длинным чанкам в случае неудачи.
2. Сжатие шагов с учетом избыточности (Redundancy-Aware Step Reduction)
После расширения надежного горизонта второй этап дополнительно снижает общее количество физических шагов. PolicyTrim вводит вознаграждение за экономию шагов: чем меньше шагов требуется для успешного завершения задачи, тем выше вознаграждение.
Награда, экономящая шаги: сразу включите «более короткую и прямую траекторию успеха» в целевую функцию оптимизации.
Группово-ориентированная регуляризация подавляет неповторяемые спекулятивные обходные пути, предотвращая стремление модели только к коротким путям за счет снижения успешности.
Двухэтапная последовательная оптимизация позволяет избежать взаимного влияния целей «удлинения чанка» и «сокращения числа шагов», в итоге снижая количество прямых выводов, необходимых для выполнения задачи.
Результаты эксперимента
PolicyTrim был протестирован на LIBERO, ManiSkill, Meta-World и реальных робототехнических задачах, охватывая различные архитектуры VLA, такие как π0.5, OpenVLA-OFT и GR00T. Общие результаты показывают, что PolicyTrim значительно повышает эффективность выполнения при стабильной успешности задач.
В LIBERO π0.5 достигает максимального ускорения в 5,83 раза при сохранении успешности выше 98%.
Результаты по сравнению с базовым показателем показывают, что PolicyTrim достигает ускорения до 2,36 раза на ManiSkill и до 2,52 раза на Meta-World.
Результаты跨架构 показывают, что переобученная версия OpenVLA-OFT с использованием полного двухэтапного процесса достигает ускорения в 2,97 раза; OpenVLA, использующая только второй этап, достигает ускорения в 1,41 раза.

Качественное сравнение: меньше лишних шагов, более прямой путь
При случайной выборке задач LIBERO базовая модель часто демонстрирует избыточные корректирующие действия и колебания/дрожание вблизи цели; траектории PolicyTrim более плавные и прямолинейные, позволяя выполнять ту же задачу за меньшее количество физических шагов, обычно сокращая их количество примерно вдвое.

Real robot deployment: Efficiency gains from simulation can be transferred to the physical world
Далее работа проверяется на реальных робототехнических задачах с использованием манипулятора Agilex Piper, оснащенного двумя камерами Intel RealSense D435i, включая три типа задач: FlipMug, HangMug и TapeBox. Эксперименты охватывают как стандартные условия с фиксированным положением цели, так и динамические условия с случайными возмущениями цели в процессе захвата.
PolicyTrim поддерживает или повышает успешность как при стандартных, так и при динамических настройках возмущений, значительно сокращая реальное время выполнения. При стандартных реальных роботизированных настройках достигается среднее ускорение в 1,86 раза по сравнению с конечной точкой.


Из экспериментальных результатов видно, что PolicyTrim не только оптимизирует показатели эталонного теста: время выполнения задачи на физических роботах также сокращается примерно вдвое по сравнению с базовым уровнем, при этом сохраняется устойчивость в условиях динамических помех.
Почему PolicyTrim эффективен?
• Повышение эффективности самой стратегии: она снижает избыточные действия и ненужное повторное планирование, а не только задержку одного этапа вывода.
• Не требуется обучение с нуля: как фреймворк для пост-обучения, можно продолжить оптимизацию на основе существующих VLA-моделей, снижая затраты на сбор данных и обучение.
• Баланс скорости и успешности: надежное расширение horizon избегает слепого увеличения chunk, а ограничения стабильности предотвращают спекуляции на коротких путях.
• Может комбинироваться с ускорением вычислительной стороны: PolicyTrim оптимизирует количество прямых выводов, а такие методы, как VLA-Cache, оптимизируют время каждого вывода — эти два подхода ортогональны и могут обеспечивать совокупное ускорение.
Основная идея PolicyTrim заключается в том, что для роботов VLA эффективность развертывания обусловлена не только более быстрым выводом модели, но и более эффективным поведением стратегии. Заставляя роботов «избегать лишних действий», можно добиться значительного ускорения.
Ссылки: https://arxiv.org/abs/2606.22540
Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: Новости ИИ; редактор: LRST
