Лаборатория Noah's Ark компании Huawei запускает систему RoboHarness для координации роботов с несколькими стратегиями

iconMetaEra
Поделиться
AI summary iconСводка
Лаборатория Noah's Ark компании Huawei представила систему RoboHarness, предназначенную для координации нескольких стратегий, таких как VLA, WAM, RL и TAMP, для задач с длительным горизонтом. Система объединяет понимание, память и эволюцию, а модуль Memory Bridge улучшает переходы между стратегиями. Эксперименты показали成功率 86%. По мере роста популярности TA в криптовалюте такие инновации могут повлиять на ценность инвестиционных стратегий в криптовалюте.
Лаборатория «Ноа» компании Huawei представила систему RoboHarness, которая с помощью Coding Agent координирует гетерогенные стратегии, такие как VLA, WAM, RL и TAMP, для выполнения длинных последовательных задач без примеров. Система включает три типа навыков: понимание, память и эволюция. Модуль Memory Bridge решает проблему несоответствия распределений состояний при переключении стратегий, достигнув в экспериментах успешность 86%. Эта работа представляет собой эволюцию встраиваемого интеллекта от одиночных моделей к систематизированной оркестровке.

Автор статьи, источник: LeFeng.com

Представьте себе задачу: открыть дверцу шкафа, найти спрятанные внутри кубики и сложить из них мост.

Для человека это очень простое дело: несколько движений плавно переходят друг в друга, и с этим справится даже ребенок из детского сада.

Но для робота эта задача охватывает множество совершенно разных навыков: поиск кубиков требует визуального понимания и выполнения языковых команд; открытие дверцы шкафа требует сложного взаимодействия с окружающей средой; сборка кубиков требует геометрического планирования и точного управления, а также прогнозирования изменений в окружающей среде.

Более того, эти способности принадлежат моделям из нескольких различных «школ»: VLA (модели визуально-языковых-действий), WAM (модели мира-действий), RL-стратегии (усиленное обучение) и TAMP (планирование задач и движений). Каждая из них обладает своими сильными сторонами, но при этом они изолированы друг от друга, различаются методами обучения, форматами входных данных и пространствами состояний.

Сегодня в области робототехники способности не отсутствуют, но отсутствует сотрудничество.

Лаборатория «Ноа» компании Huawei недавно опубликовала статью, в которой представила систему под названием RoboHarness, предназначенную для решения проблемы отсутствия взаимодействия между различными стратегиями. Авторы этой работы обсудили её с нами (LeiFengNet).

Агент движется к овеществленному миру: от языкового интеллекта к «командиру мозга» робота

Статья: https://arxiv.org/abs/2607.18060

Главная страница проекта: https://www.robo-harness.com/

01 Иллюзия и реальность между универсальной моделью

Этим летом в области робототехники было проведено несколько интенсивных исследований, связанных с Harness, которые вместе указывают на осознание: решить все проблемы за счет более крупных моделей временно невозможно, роботам необходима система организации исполнения.

Команда профессора Ю Чжэна из Циньхуа университета в июле представила Harness VLA, внедрив Harness Layer, широко используемый в цифровом интеллекте, в эмбоди-интеллект, чтобы зафиксированный VLA сосредоточился на наиболее подходящих для него задачах, связанных с интенсивным контактом, в то время как слой Harness обучался определять, когда и как вызывать его, а также как сбрасывать и повторять попытки после неудачи VLA. В тестах LIBERO-Pro система повысила成功率 с 50% до 82,4%.

По сути, Harness VLA решает проблему стабильной работы модели при внешних возмущениях распределения. Ее задача — стабильность одиночной стратегии.

RoboHarness от лаборатории «Ноа» компании Huawei сталкивается с другой проблемой: что делать, когда задача выходит за пределы возможностей любой модели?

Оба называются Harness, оба используют Coding Agent в качестве организационного слоя, но решают задачи на разных уровнях. Первый делает специалиста более надежным, второй позволяет группе специалистов с разными навыками работать совместно. По мере роста сложности задач роботов эта вторая проблема становится все более неизбежной.

Истоки этой проблемы лежат в границах возможностей различных моделей.

Преимущество модели VLA заключается в понимании открытых языковых инструкций и обобщении в новых средах, но ее подход к энд-ту-энд генерации действий трудно поддерживать в долгосрочных задачах; стратегии усиленного обучения могут выработать стабильные замкнутые поведенческие циклы в конкретных обучающих сценариях, но эта стабильность сильно зависит от распределения обучения, и небольшие изменения в среде могут привести к сбою; TAMP эффективна в символических рассуждениях и геометрических ограничениях, но требует предварительного определения примитивов действий, и при открытых сценариях и нечетких целях планировщик быстро теряет эффективность; WAM может помогать в принятии долгосрочных решений за счет прогнозирования будущих состояний, но подвержена накоплению ошибок с увеличением горизонта прогнозирования.

Сложные реальные задачи одновременно требуют семантического понимания, геометрического планирования, замкнутого управления, долгосрочного временного вывода и прогнозирования изменений среды — эти способности соответствуют различным целям обучения, иногда даже противоречащим друг другу. Между достижением прорывов в каждой из этих способностей и созданием единой модели, способной долгосрочно и стабильно справляться со всеми ними в открытой среде, существует пропасть, которую до сих пор не удалось преодолеть.

Исходной идеей RoboHarness является то, что вместо ожидания устранения этого разрыва следует сначала обеспечить настоящую координацию между уже существующими моделями, каждая из которых обладает своими сильными сторонами. Автор считает, что до тех пор, пока одна модель не сможет полностью подавить все остальные и проявить абсолютное превосходство, такая архитектура компоновки остается крайне значимой.

Эта работа не возникла из ниоткуда. Авторы рассказывают (LeiFengNet), что прототип RoboHarness появился после участия в глобальном робототехническом соревновании BEHAVIOR Challenge в прошлом году. Задачи соревнования были длинными и сложными, и команда обнаружила, что ни конец-в-конец обучение VLA, ни модели, такие как имитация поведения, не могут справиться со сложностью самой задачи. Этот неудачный опыт помог команде четко понять истинную проблему.

02 Как центральный процессор решения решает, кто выйдет на поле

Основная идея RoboHarness заключается в том, чтобы инкапсулировать независимо разработанные системы управления, такие как VLA, WAM, стратегии RL и TAMP, в агентные навыки, которые могут быть унифицированно распределены, а высокий уровень принятия решений возлагается на Coding Agent.

Этот дизайн основан на важном предположении: не изменять и не переобучать никакие базовые стратегии. Каждая стратегия сохраняет свою первоначальную реализацию и не требует совместного использования архитектуры модели, пространства действий или обучающих данных. RoboHarness добавляет лишь уровень организации поверх них.

Выбрать правильную стратегию — не так просто.

Для кодирующего агента одних только исходных изображений недостаточно, чтобы надежно определить, кому следует поручить эту задачу, поскольку за этим решением скрываются множество количественных вопросов, на которые языковая модель не может ответить. Он может понять, что чашку нужно поставить на тарелку, но не может вычислить степень сходства текущей сцены с распределением, использованным при обучении стратегии, и тем более не может оценить надежность данных датчиков в данный момент.

Для решения этой проблемы система разработала три типа вспомогательных навыков, специально предназначенных для того, чтобы извлекать информацию, необходимую для оценки, от агента по кодированию.

Агент движется к овеществленному миру: от языкового интеллекта к «командиру мозга» робота

Понимание навыков — отвечает за преобразование исходных данных в количественные сигналы, такие как сходство встраивания изображения с обучающими данными каждой стратегии, стабильность позы объекта в течение временного окна, соответствие текущего освещения и качества изображения установленным требованиям и т. д. Эти показатели являются настоящей основой для маршрутизации стратегий. Автор считает, что суть этого модуля заключается в многомерной оценке того, насколько каждая стратегия подходит для текущей задачи.

Навыки памяти, извлечение исторического опыта исполнения для обеспечения ориентира при выборе стратегии и обработка несоответствия распределения состояний между стратегиями с помощью Memory Bridge — это наиболее важный элемент дизайна системы, который будет подробно рассмотрен ниже.

Evolution Skills использует онлайн-обратную связь для постоянного обновления метаданных и логики оркестрации стратегий, позволяя системе учиться на каждом выполнении, а не принимать решения с нуля при каждом новом сценарии.

Информационные потоки трех типов навыков взаимодействуют друг с другом, совместно поддерживая принятие решений агентом для написания кода. На практике этот механизм выполняет две основные функции: во-первых, разбиение задачи — разделение длинных команд на подзадачи, подходящие для различных стратегий; во-вторых, динамическое переключение — когда текущая стратегия приближается к своим пределам возможностей, система своевременно переключается на более подходящую стратегию, обеспечивая взаимодополняемость различных стратегий.

Статья использует серию абляционных экспериментов, чтобы показать вклад каждого из двух слоев: уже при использовании только языковой модели для разложения задачи и последующей передачи ее pi0.5 успех значительно возрастает; при добавлении нескольких гетерогенных стратегий успех дополнительно значительно повышается. Правильное разложение — это первый шаг, точная передача — второй; оба шага необходимы.

Но есть и третья проблема, самая сложная, которую нельзя решить только выбором стратегии.

03 Момент передачи эстафеты решает победу в эстафете

Две независимо обученные стратегии обычно существуют в своих собственных мирах данных. Их форматы входных данных различаются, а также различаются распределения опыта по состояниям робота. Позиция, в которой останавливается TAMP после завершения операции, очень часто попадает в пространство состояний, которые VLA никогда не обрабатывала и в которых не может стабильно запуститься.

Это уникальная проблема, присущая гетерогенной оркестрации стратегий.

Поэтому Memory Bridge, отвечающий за стабильную передачу между двумя стратегиями, автор считает самым важным модулем в RoboHarness. Он признает, что в будущем, если универсальная модель сможет идеально охватить всё пространство состояний, Memory Bridge может стать необязательным; однако в текущих условиях любая модель легко может попасть за пределы своего распределения способностей в момент передачи.

Агент движется к овеществленному миру: от языкового интеллекта к «командиру мозга» робота

Работа Memory Bridge состоит из трех шагов.

Поиск: на основе следующей подзадачи и текущего наблюдения найдите Top-K наиболее похожих траекторий, на которых ранее успешно выполнялась целевая стратегия, используя текстовое и визуальное сходство из мультимодального хранилища памяти, извлеките положение конечного эффектора, углы суставов и другие состояния робота.

Моделирование: присвоение сигналов обучения на основе относительного прогресса состояний в траектории и онлайн-регрессия для реального времени подгонки диапазона состояний целевой стратегии «принимать на себя».

Мост: выбор и оценка кандидатов на состояние с учетом уверенности в попадании в зону комфорта целевой стратегии и затрат на движение, чтобы выбрать наиболее подходящую цель моста и сгенерировать переходную траекторию; после достижения роботом этого состояния управление передается следующей стратегии.

Эта система полностью зависит от онлайн-обучения на основе исторических данных исполнения, обеспечивая подключение и использование для любой стратегии без необходимости изменения базовой реализации или совместного обучения.

В экспериментах по абляции удаление Memory Bridge привело к незначительному снижению прогресса в задачах, что указывает на то, что выбор стратегии по-прежнему в основном корректен; однако полная успешность резко упала с 86,0% до 60,4%. Множество задач достигали последнего шага, но проваливались из-за несовместимости состояний передачи, что подтверждает ценность Memory Bridge.

04 Две технологические линии, тихое слияние

Отойдя от этой статьи, мы хотим описать более широкую картину технологий эмбодимента.

Автор RoboHarness отметил, что на фоне быстрого развития VLA за последние три года традиционные TAMP и иерархические подходы一度淡出社区关注, поскольку их способность к обобщению в открытых сценариях явно уступала end-to-end VLA. Однако с быстрым прогрессом в области агентных систем и кодирующих агентов в этом году иерархические архитектуры вновь обрели новую жизнь: высокий уровень агента может использовать составные навыки для декомпозиции задач, вызова инструментов и динамического планирования, что значительно усиливает обобщающую способность и адаптивность традиционных иерархических методов. В результате академическое сообщество снова обращает на это внимание и начинает изучать, как сочетать мощные обобщающие рассуждения высокого уровня с гетерогенными низкоуровневыми стратегиями.

Автор этой статьи из нескольких университетов и исследовательских институтов восточной Канады. Автор отмечает, что в области робототехники в Северной Америке долгое время существовали две технические линии с явными академическими корнями: на западном побережье США, представленном Stanford, Berkeley и другими, акцент делается на обучении и масштабировании, с фокусом на энд-ту-энд обучение, объем данных и обобщение моделей; в то время как на северо-востоке США и в Канаде, представленном MIT, Университетом Торонто, MILA и другими, долгое время уделялось больше внимания иерархическим архитектурам, символическим рассуждениям, логическому планированию и структурированным решениям.

Авторы RoboHarness находятся на продолжении этой ветви.

Технологические направления разделились, оставив четкий след в промышленности эмбоди-интеллекта. За последние годы быстро развивающиеся команды сформировали технологический спектр от масштабирования фундаментальных моделей до агентных иерархий: одна группа акцентирует внимание на универсальных эмбоди-фундаментальных моделях, VLA и моделях мира, постоянно расширяя границы обобщения за счет унификации моделей, увеличения объема данных и повышения возможностей моделей; другая группа делает упор на переиспользуемые операционные навыки и иерархическую архитектуру, сочетая планирование задач, комбинирование навыков и координацию низкоуровневого управления для выполнения сложных задач. В Китае команды, такие как Baidu AI Studio, ближе к первому подходу, тогда как Suduo Technology и Magic Atom больше ориентированы на второй. За рубежом серия pi от Physical Intelligence долгое время представляла направление масштабирования, в то время как Gemini Robotics продолжает традицию «высокоуровневого рассуждения и планирования + низкоуровневого выполнения навыков».

Интересно, что дифференциация этой технологической линии не является статичным противостоянием, а формируется в процессе постоянной эволюции как взаимодополняющая. В последние месяцы обе технологические линии начали проявлять явные признаки схождения. Например, Physical Intelligence в pi0.7 повысила значимость управляемости и комбинации навыков до более центрального уровня; в то же время команды, такие как NVIDIA, продолжают выпускать более иерархические robot agentic системы, объединяющие понимание и способности к рассуждению базовых моделей с VLA. В целом масштабирование foundation model и иерархия agentic постепенно эволюционируют от двух относительно независимых технологических путей к взаимодополняющим возможностям в рамках одной и той же робототехнической системы.

05 С помощью оркестровки — к более универсальному интеллекту

RoboHarness имеет четкие ограничения: он может запускать только существующие стратегии и не может решить задачи, которые не под силу ни одной из стратегий. Надежность Memory Bridge зависит от достаточного объема исторических данных выполнения; оценка способностей новых стратегий на начальных этапах сопряжена с высокой неопределенностью.

Основной тезис статьи не отрицает необходимость унифицированных крупных моделей.

Автор подчеркивает, что оркестрация долгосрочных задач — это не просто комбинация существующих возможностей, но и постоянный источник данных о выполнении, охватывающих различные навыки и сценарии, которые отдельные модели не могут получить самостоятельно. Эти данные фиксируют переключения между стратегиями, их связывание, восстановление после сбоев и процессы взаимодействия, что может стать важным источником данных для обучения следующего поколения универсальных роботизированных моделей. Исходя из этой идеи, команда RoboHarness также исследует возможность повторного использования данных, генерируемых в процессе гибридной оркестрации стратегий и их выполнения, для обучения базовых стратегий: опыт выполнения гетерогенной оркестрации дополнительно способствует улучшению базовых возможностей модели.

От поиска наиболее мощных моделей до организации наиболее подходящих способностей, конкуренция в области встраиваемого интеллекта тихо расширяется на уровень системного дизайна. Гетерогенные стратегии оркестрации и унифицированные крупные модели напоминают два разных хребта, по которым ведут путешествия, в конечном итоге направленные на одну и ту же цель: наделить роботов более универсальным и надежным интеллектом.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.