PolicyTrim збільшує ефективність робота VLA у 5,83 рази без переосвіти

icon MarsBit
Поділитися
AI summary iconКороткий зміст
PolicyTrim збільшує ефективність робота VLA в 5,83 рази без переосвіти, згідно з MarsBit. Фреймворк покращує виконання, скорочуючи надлишкові кроки та розширюючи надійні послідовності дій. Він досягає 98% успішності у завданнях, таких як LIBERO Object/π0.5. PolicyTrim працює у два етапи: розширення надійних дій та стиснення фізичних кроків. Метод відповідає цілям відповідності CFT та MiCA, пропонуючи економічно ефективне оновлення для існуючих моделей VLA. Збір нових даних або переосвіта не потрібні.

[Вступ] Модель VLA вже вміє виконувати завдання, але реальні роботи все ще працюють повільно! PolicyTrim — це метод оптимізації ефективності виконання роботами VLA без необхідності переосвіти. Він допомагає роботам швидше виконувати завдання, розширюючи надійні послідовності дій та зменшуючи надлишкові кроки.

Моделі Vision-Language-Action (VLA) об’єднують візуальні спостереження, мовні інструкції та робототехнічні дії в єдину стратегічну модель, що дозволяє роботам виконувати складні операційні завдання за допомогою природної мови.

Від OpenVLA та OpenVLA-OFT до π0.5 та GR00T ці моделі стають важливою технологічною лінією для ембодієн-інтелекту.

Але коли модель VLA справді розгортається на роботі, виникає ключовий обмежуючий фактор: загальний час виконання завдання роботом залежить не лише від швидкості кожного висновку, а й від того, скільки разів потрібно виконати висновок і скільки реальних фізичних дій потрібно здійснити.

Робот

Під час кількох виконань однієї й тієї ж задачі модель VLA демонструє значні коливання кількості кроків, що свідчить про те, що коротші та більш прямі шляхи до успіху є досяжними, але поточна стратегія часто знаходить їх лише випадково.

Ненадійність кінця чанка дій: модель одночасно передбачає кілька дій, але дії, розташовані далі, більш схильні до накопичення похибок, що змушує систему часто переплановувати. Навмисне збільшення довжини виконання знижує ймовірність успіху та збільшує кількість фізичних кроків.

Велика кількість фізичних дій у надлишку: навіть якщо завдання завершиться успішно, траєкторія може містити велику кількість корекцій, відкатів та повторюваних дій.

Тому ефективність розгортання VLA визначається не лише затримкою виведення на кожному етапі, а й ефективністю стратегії (policy efficiency): скільки дій у одній передбаченні можна безпечно виконати? Скільки справжніх фізичних кроків необхідно для виконання завдання?

Існуючі методи більшістю зосереджуються на обчислювальній стороні, наприклад, зрізання візуальних токенів, квантування, повторне використання KV-cache, дистиляція або оптимізація інженерії висновку. Ці методи можуть знизити затримку одного висновку, але якщо стратегія все ще вимагає великої кількості надлишкових фізичних кроків, реальний час виконання завдання залишається довгим.

Пряме фіксоване виконання довших блоків дій також не є надійним.

Експерименти в статті показують, що зі збільшенням тривалості виконання дій成功率 може знижуватися, а кількість фізичних кроків збільшується. Це свідчить про те, що погана передбачуваність хвоста вносить помилки у фізичний світ, і роботу потрібно виконувати більше коригувальних дій.

Ключове питання: чи можна за допомогою післятренування залишити існуючу стратегію VLA автоматично вчитися «ходити меншими шляхами» і виконувати завдання за меншою кількістю фізичних кроків, не поступаючись у успішності завдань?

Команда під керівництвом професора Лей Цзіньцзе з Сичуанського університету запропонувала PolicyTrim — двоетапний післятренувальний фреймворк для підсиленого навчання, спрямований на «ефективність стратегії». Він не змінює архітектуру VLA і не збирає заново експертні дані, а замість цього продовжує оптимізувати реальні виконавчі дії робота на основі вже існуючої передньо-навчаної стратегії.

Робот

Головна сторінка проекту: https://inceptionwang.github.io/PolicyTrim/

Посилання на статтю: https://arxiv.org/abs/2606.22540

Посилання на код: https://github.com/INCEPTIONwang/PolicyTrim

Посилання на модель: https://huggingface.co/INCEPTIONwang/PolicyTrim

Новий метод реалізовано:

  • Використання chunk з кратністю 3, надійне виконання з більшим горизонтом;
  • 51,4% зменшення фізичних кроків, стиснення надлишкових корекційних дій;
  • 5,83× найвища ефективність у порівнянні з кінцем до кінця, LIBERO Object/π0.5;

Від «швидшого обчислення» до «швидшого виконання»

Основна мета PolicyTrim — не замінити прискорення на обчислювальній стороні, а доповнити інший знехтуваний аспект: зменшення кількості прямих висновків, необхідних для виконання завдання. Вона розбиває ефективність стратегії на дві оптимізовувані цілі: спочатку розширити надійні чанки дій, а потім стиснути надлишкові фізичні кроки.

Робот

1. Розширення надійного чанка дій (Reliable Action Chunk Extension)

Зараз багато стратегій VLA виводять послідовності дій у вигляді action chunk, але під час впровадження часто виконують лише перші кроки. На першому етапі PolicyTrim використовує динамічне дослідження горизонту виконання: одній і тій самій групі роллаутів присвоюються різні коефіцієнти прийняття, що дозволяє моделі паралельно досліджувати надійні межі на коротких, середніх та довгих вікнах.

Траєкторії, які успішно завершують завдання з більш довгим вікном виконання, отримують вищу винагороду, що сприяє зробити дії в кінці раніше ненадійних фрагментів більш корисними.

Нагорода за горизонт активується лише тоді, коли у групі відбувається успішна траєкторія, щоб уникнути сліпої спроби моделлю досягти більшої довжини чанка у випадку невдачі.

2. Стиск кроків з урахуванням надлишковості (Redundancy-Aware Step Reduction)

Після розширення надійного горизонту другий етап додатково зменшує загальну кількість фізичних кроків. PolicyTrim вводить нагороду за економію кроків: чим менше кроків використовується для завершення успішної траєкторії, тим вища нагорода.

step-saving reward прямо включити «коротшу та більш пряму траєкторію успіху» до цілей оптимізації.

Регуляризація, заснована на групі, пригнічує неповторні спекулятивні шляхи, запобігаючи тому, щоб модель прагнула лише до коротших шляхів за рахунок зниження успішності.

Двофазна послідовна оптимізація уникне взаємного впливу цілей «збільшення розміру чанка» і «зменшення кількості кроків», що в кінцевому підсумку зменшить кількість прямих висновків, необхідних для виконання завдання.

Результати експерименту

PolicyTrim було перевірено на LIBERO, ManiSkill, Meta-World та реальних робототехнічних завданнях, охоплюючи різні архітектури VLA, такі як π0.5, OpenVLA-OFT та GR00T. Загальні результати показують, що PolicyTrim значно підвищує ефективність виконання, зберігаючи при цьому стабільний рівень успішності завдань.

У LIBERO π0.5 досягає максимального прискорення 5,83 рази при збереженні успішності понад 98%.

За результатами міжбазового порівняння, PolicyTrim досяг максимального прискорення 2,36 рази на ManiSkill і 2,52 рази на Meta-World.

Результати міжархітектурного порівняння показують, що переобучена версія OpenVLA-OFT із повним двоетапним процесом досягає прискорення 2,97 рази; OpenVLA, що використовує лише другий етап, досягає прискорення 1,41 рази.

Робот

Якісне порівняння: менше помилок, більш пряма траєкторія

У випадково вибраних завданнях LIBERO базовий метод часто демонструє надлишкові коригувальні дії та коливання/тремтіння поблизу цілі; траєкторії PolicyTrim є більш плавними та прямолінійними, дозволяючи виконати ту саму задачу за меншу кількість фізичних кроків, зазвичай скорочуючи кількість кроків приблизно наполовину.

Робот

Реальне розгортання роботів: ефективність, отримана в симуляції, може бути перенесена у фізичний світ

Стаття також підтверджується на реальній роботизованій системі Agilex Piper, оснащеній двома камерами Intel RealSense D435i, для виконання трьох типів роботизованих завдань: FlipMug, HangMug та TapeBox. Експерименти охоплюють як стандартні налаштування з фіксованим положенням цілі, так і динамічні налаштування з випадковими збуреннями цілі під час захоплення.

PolicyTrim утримує або підвищує успішність як у стандартних, так і у динамічних налаштуваннях збурень, значно скорочуючи час реального виконання. У стандартних реальних роботизованих налаштуваннях досягається середнє прискорення в 1,86 рази по всьому ланцюжку.

Робот

Робот

Згідно з експериментальними результатами, PolicyTrim не оптимізує лише показники benchmark: на фізичних роботах час виконання завдання скорочується приблизно наполовину порівняно з baseline, а також зберігає стійкість у сценаріях з динамічними збуреннями.

Чому PolicyTrim ефективний?

• Оптимізація самого стратегічного процесу: він зменшує надлишкові дії та непотрібне перепланування, а не лише знижує затримку одного висновку.

• Не потрібно навчати з нуля: як фреймворк після навчання, можна продовжувати оптимізацію на основі вже існуючих моделей VLA, що знижує витрати на збір даних і навчання.

• Баланс швидкості та успішності: надійне розширення horizon уникне сліпої подовження chunk, а обмеження стабільності запобігатиме спекуляціям на коротких шляхах.

• Може поєднуватися з прискоренням обчислювального боку: PolicyTrim оптимізує кількість прямих висновків, а такі методи, як VLA-Cache, оптимізують час кожного висновку — ці два шляхи є ортогональними і можуть створювати комбіноване прискорення.

Основна ідея PolicyTrim полягає в тому, що для роботів VLA ефективність розгортання походить не лише зі швидшого висновку моделі, а й з більш ефективної поведінки стратегії. Дозволивши роботу «не відхилятися вбік», можна досягти значного прискорення.

Джерело: https://arxiv.org/abs/2606.22540

Цей матеріал надійшов із微信-каналу «Новий розум», автор: Новий розум; редактор: LRST

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.