PolicyTrim повышает эффективность робота VLA в 5,83 раза без дообучения

icon MarsBit
Поделиться
AI summary iconСводка
PolicyTrim повышает эффективность робота VLA в 5,83 раза без переобучения, как сообщается MarsBit. Фреймворк улучшает выполнение за счет удаления избыточных шагов и расширения надежных последовательностей действий. Он достигает 98% успеха в задачах, таких как LIBERO Object/π0.5. PolicyTrim работает в два этапа: расширение надежных действий и сжатие физических шагов. Метод соответствует целям соответствия CFT и MiCA, предлагая недорогое обновление для существующих моделей VLA. Сбор новых данных или переобучение не требуются.

[Введение] Модель VLA уже умеет выполнять задачи, но реальные роботы всё ещё медленны! PolicyTrim — это метод оптимизации эффективности выполнения задач роботами на базе VLA без необходимости переобучения. Он помогает роботам быстрее завершать задачи, расширяя надёжные последовательности действий и устраняя избыточные шаги.

Модели Vision-Language-Action (VLA) объединяют визуальные наблюдения, языковые инструкции и действия робота в единую стратегическую модель, позволяя роботам выполнять сложные операционные задачи на основе естественного языка.

От OpenVLA и OpenVLA-OFT до π0.5 и GR00T такие модели становятся важным направлением в области встроенного интеллекта.

Однако, когда модель VLA действительно развертывается на роботе, возникает ключевое узкое место: общее время выполнения задачи роботом зависит не только от скорости каждого вывода, но и от того, сколько раз необходимо выполнить вывод и сколько реальных физических действий требуется.

Робот

В ходе нескольких запусков одной и той же задачи количество шагов, выполняемых моделью VLA, значительно варьируется, что указывает на то, что более короткие и прямые успешные пути достижимы, но текущая стратегия обычно находит их лишь случайно.

Ненадежность конца чанка действий: модель предсказывает несколько действий за один раз, но действия, расположенные дальше, чаще накапливают ошибки, что вынуждает систему часто перепланировать. Принудительное удлинение длины выполнения снижает вероятность успеха и увеличивает количество физических шагов.

Серьезная избыточность физических движений: даже при успешном завершении задачи траектория может содержать множество корректирующих, возвратных и повторяющихся действий.

Поэтому эффективность развертывания VLA следует оценивать не только по задержке на каждом этапе вывода, но и по эффективности стратегии (policy efficiency): сколько действий можно безопасно выполнить за один прогноз? Сколько реальных физических шагов действительно необходимо для выполнения задачи?

Существующие методы в основном сосредоточены на вычислительной стороне, например, на обрезке визуальных токенов, квантовании, повторном использовании KV-cache, дистилляции или оптимизации движка вывода. Эти методы могут снизить задержку одного вывода, но если стратегия по-прежнему требует большого количества избыточных физических шагов, реальное время выполнения задачи остается длительным.

Прямое фиксированное выполнение более длинных блоков действий также ненадежно.

Эксперименты в статье показывают, что при принудительном увеличении длины выполнения действий成功率 может снижаться, а количество физических шагов, наоборот, увеличивается. Это указывает на то, что низкокачественные прогнозы в хвостовой части вносят ошибки в физический мир, после чего роботу требуется больше корректирующих действий.

Ключевой вопрос: можно ли с помощью пост-обучения заставить существующую стратегию VLA автоматически научиться «не ходить вокруг да около» и выполнять задачи за меньшее количество физических шагов, не снижая成功率 задач?

Команда под руководством профессора Лей Инъе из Сычуаньского университета предложила PolicyTrim — двухэтапную рамку для пост-обучения методов усиленного обучения, ориентированную на «эффективность стратегии». Она не изменяет архитектуру VLA и не собирает новые данные экспертов, а продолжает оптимизировать реальное исполнение роботом уже существующих предварительно обученных стратегий.

Робот

Главная страница проекта: https://inceptionwang.github.io/PolicyTrim/

Ссылка на статью: https://arxiv.org/abs/2606.22540

Ссылка на код: https://github.com/INCEPTIONwang/PolicyTrim

Ссылка на модель: https://huggingface.co/INCEPTIONwang/PolicyTrim

Новый метод реализован:

  • 3× использование чанков действий, более надежное выполнение с удлиненным горизонтом;
  • Снижение физических шагов на 51,4%, сжатие избыточных корректирующих действий;
  • 5,83× максимальное ускорение от конца до конца, LIBERO Object/π0.5;

От «быстрее считать» к «быстрее делать»

Основная цель PolicyTrim — не заменить ускорение на вычислительной стороне, а дополнить другой недооцененный аспект: снижение количества прямых выводов, необходимых для выполнения задачи. Она разделяет эффективность стратегии на две оптимизируемые цели: сначала расширить надежные фрагменты действий, затем сжать избыточные физические шаги.

Робот

1. Расширение надежного чанка действий (Reliable Action Chunk Extension)

Сегодня многие стратегии VLA выводят последовательности действий в виде action chunk, но при развертывании часто выполняют только первые несколько шагов. На первом этапе PolicyTrim использует динамическое исследование горизонта выполнения: одной и той же группе рулонов назначаются разные коэффициенты принятия, что позволяет модели параллельно исследовать надежные границы на коротких, средних и длинных окнах.

Более высокая награда присуждается за успешное выполнение задачи с более длительным окном выполнения, что поощряет модель делать действия в хвосте ранее ненадежных фрагментов более полезными.

Horizon reward активируется только при наличии успешной траектории в группе, чтобы избежать слепого стремления модели к более длинным чанкам в случае неудачи.

2. Сжатие шагов с учетом избыточности (Redundancy-Aware Step Reduction)

После расширения надежного горизонта второй этап дополнительно снижает общее количество физических шагов. PolicyTrim вводит вознаграждение за экономию шагов: чем меньше шагов требуется для успешного завершения задачи, тем выше вознаграждение.

Награда, экономящая шаги: сразу включите «более короткую и прямую траекторию успеха» в целевую функцию оптимизации.

Группово-ориентированная регуляризация подавляет неповторяемые спекулятивные обходные пути, предотвращая стремление модели только к коротким путям за счет снижения успешности.

Двухэтапная последовательная оптимизация позволяет избежать взаимного влияния целей «удлинения чанка» и «сокращения числа шагов», в итоге снижая количество прямых выводов, необходимых для выполнения задачи.

Результаты эксперимента

PolicyTrim был протестирован на LIBERO, ManiSkill, Meta-World и реальных робототехнических задачах, охватывая различные архитектуры VLA, такие как π0.5, OpenVLA-OFT и GR00T. Общие результаты показывают, что PolicyTrim значительно повышает эффективность выполнения при стабильной успешности задач.

В LIBERO π0.5 достигает максимального ускорения в 5,83 раза при сохранении успешности выше 98%.

Результаты по сравнению с базовым показателем показывают, что PolicyTrim достигает ускорения до 2,36 раза на ManiSkill и до 2,52 раза на Meta-World.

Результаты跨架构 показывают, что переобученная версия OpenVLA-OFT с использованием полного двухэтапного процесса достигает ускорения в 2,97 раза; OpenVLA, использующая только второй этап, достигает ускорения в 1,41 раза.

Робот

Качественное сравнение: меньше лишних шагов, более прямой путь

При случайной выборке задач LIBERO базовая модель часто демонстрирует избыточные корректирующие действия и колебания/дрожание вблизи цели; траектории PolicyTrim более плавные и прямолинейные, позволяя выполнять ту же задачу за меньшее количество физических шагов, обычно сокращая их количество примерно вдвое.

Робот

Real robot deployment: Efficiency gains from simulation can be transferred to the physical world

Далее работа проверяется на реальных робототехнических задачах с использованием манипулятора Agilex Piper, оснащенного двумя камерами Intel RealSense D435i, включая три типа задач: FlipMug, HangMug и TapeBox. Эксперименты охватывают как стандартные условия с фиксированным положением цели, так и динамические условия с случайными возмущениями цели в процессе захвата.

PolicyTrim поддерживает или повышает успешность как при стандартных, так и при динамических настройках возмущений, значительно сокращая реальное время выполнения. При стандартных реальных роботизированных настройках достигается среднее ускорение в 1,86 раза по сравнению с конечной точкой.

Робот

Робот

Из экспериментальных результатов видно, что PolicyTrim не только оптимизирует показатели эталонного теста: время выполнения задачи на физических роботах также сокращается примерно вдвое по сравнению с базовым уровнем, при этом сохраняется устойчивость в условиях динамических помех.

Почему PolicyTrim эффективен?

• Повышение эффективности самой стратегии: она снижает избыточные действия и ненужное повторное планирование, а не только задержку одного этапа вывода.

• Не требуется обучение с нуля: как фреймворк для пост-обучения, можно продолжить оптимизацию на основе существующих VLA-моделей, снижая затраты на сбор данных и обучение.

• Баланс скорости и успешности: надежное расширение horizon избегает слепого увеличения chunk, а ограничения стабильности предотвращают спекуляции на коротких путях.

• Может комбинироваться с ускорением вычислительной стороны: PolicyTrim оптимизирует количество прямых выводов, а такие методы, как VLA-Cache, оптимизируют время каждого вывода — эти два подхода ортогональны и могут обеспечивать совокупное ускорение.

Основная идея PolicyTrim заключается в том, что для роботов VLA эффективность развертывания обусловлена не только более быстрым выводом модели, но и более эффективным поведением стратегии. Заставляя роботов «избегать лишних действий», можно добиться значительного ускорения.

Ссылки: https://arxiv.org/abs/2606.22540

Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: Новости ИИ; редактор: LRST

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.