Лабораторія Noah’s Ark компанії Huawei запускає систему RoboHarness для координації роботів з кількома стратегіями

iconMetaEra
Поділитися
AI summary iconКороткий зміст
Лабораторія Noah’s Ark компанії Huawei представила систему RoboHarness, розроблену для координації кількох стратегій, таких як VLA, WAM, RL і TAMP, для завдань з довгим горизонтом. Система поєднує розуміння, пам’ять та еволюцію, а модуль Memory Bridge покращує перехід між стратегіями. Експерименти показали рівень успішності 86%. Оскільки TA для криптовалют набирає популярності, такі інновації можуть вплинути на ціннісне інвестування в криптовалютні стратегії.
Лабораторія Нойя компанії Huawei представила систему RoboHarness, яка за допомогою Coding Agent координує гетерогенні стратегії, такі як VLA, WAM, RL, TAMP, для виконання довготривалих завдань без навчання. Система включає три типи навичок: розуміння, пам’ять та еволюція. Модуль Memory Bridge вирішує проблему несумісності розподілу станів під час переключення стратегій, досягаючи успішності 86% у експериментах. Ця робота відображає еволюцію вбудованого інтелекту від окремих моделей до системної оркестрації.

Автор статті, джерело: Leiphone

Уявіть собі завдання: відкрити дверцята шафи, знайти сховані всередині кубики та зібрати з них міст.

Для людини це дуже проста справа: кілька рухів плавно поєднуються, і з цим може впоратися навіть дитина з дитячого садочка.

Але для робота це завдання охоплює кілька абсолютно різних здібностей: пошук кубиків вимагає візуального розуміння та виконання мовних інструкцій; відкриття дверей шафи вимагає складної взаємодії з оточенням; збирання кубиків вимагає геометричного планування та точного керування з передбаченням змін у середовищі.

Ще складніше те, що ці здібності належать до моделей різних «шкіл» — VLA (візуально-мовна-дієва модель), WAM (модель світ-дія), RL-стратегії (підсилене навчання) та TAMP (планування завдань і рухів). Вони мають різні сильні сторони, але не пов’язані між собою, мають різні методи навчання, формати вхідних даних та простори станів.

Сьогодні в робототехніці здібностей не вистачає, але відсутнє співробітництво.

Лабораторія Ноеєвого ковчега Huawei недавно опублікувала статтю, в якій було запропоновано систему під назвою RoboHarness, призначенну для вирішення проблеми неможливості співпраці між різними стратегіями. Автори цієї роботи спілкувалися з нами (LeiFeng.com).

Агент напрямкується до тілесного світу: від мовної інтелігентності до «головного командира» робота

Папер: https://arxiv.org/abs/2607.18060

Головна сторінка проекту: https://www.robo-harness.com/

01 Ілюзії та реальність універсальної моделі

Цього літа в галузі досліджень роботів з’явилося кілька інтенсивних робіт, пов’язаних із Harness, які разом вказують на одне розуміння: вирішувати все за допомогою більших моделей тимчасово неможливо — роботам потрібна система організації виконання.

Команда професора Ю Чжоу з Цинхуа у липні представила Harness VLA, яка впроваджує Harness Layer — широко використовуваний у цифровому інтелекті — у сферу ембодірованого інтелекту, дозволяючи замороженому VLA зосередитися на найбільш вдалих для нього завданнях, пов’язаних з інтенсивним контактом, одночасно використовуючи шар Harness для навчання, коли і як викликати його, а також як скидати та повторювати спроби після невдачі VLA. У тестах LIBERO-Pro ця система підвищила показник успішності з 50% до 82,4%.

На рівні ідеї Harness VLA вирішує проблему стабільної роботи моделі під впливом зовнішніх збурень. Її проблема — стабільність однієї стратегії.

RoboHarness від лабораторії Noah’s Ark компанії Huawei стикається з іншим рівнем проблеми: що робити, коли завдання виходить за межі здібностей будь-якої моделі?

Обидва називаються Harness, обидва використовують Coding Agent як організаційний рівень, але вирішують різні виміри викликів. Перший робить фахівця більш стабільним, другий дозволяє групі фахівців з різними навичками працювати разом. Зі зростанням складності завдань роботів цей другий виклик стає все більш неусвідомленим.

Причина цього питання полягає в межах можливостей різних моделей.

Переваги моделі VLA полягають у розумінні відкритих мовних інструкцій та узагальненні в нових середовищах, але її підхід до прямого генерування дій важко зберігає послідовність у довготривалих завданнях; стратегії підсиленого навчання можуть виробити стабільні замкнені поведінки в конкретних тренувальних сценаріях, але ця стабільність сильно залежить від розподілу навчання, і навіть невеликі зміни середовища можуть призвести до відмови; TAMP добре справляється з символічним міркуванням та геометричними обмеженнями, але вимагає попереднього визначення дієвих примітивів, і при відкритих сценаріях та нечітких цілях планувальник швидко втрачає ефективність; WAM може допомагати у прийнятті довготривалих рішень шляхом прогнозування майбутніх станів, але схильний до накопичення помилок зі збільшенням горизонту прогнозування.

Складні реальні завдання вимагають одночасно семантичного розуміння, геометричного планування, замкненого керування, довготривалого ланцюгового міркування та передбачення змін у середовищі — ці здібності мають різні цілі навчання і іноді навіть суперечать одна одній. Між досягненням проривів у кожній з цих здібностей окремо та створенням єдиної моделі, яка довготривалий час стабільно поєднує всі ці здібності в відкритому середовищі, лежить пропасть, яку досі не вдалося справжньо подолати.

Вихідною ідеєю RoboHarness є не чекати, поки ця прірва буде заповнена, а вже зараз змусити існуючі моделі, кожна з яких має свої сильні сторони, працювати разом. Автор вважає, що до тих пір, поки жодна модель не зможе повністю перевершити всі інші й продемонструвати абсолютну домінуючу силу, така архітектура компонування дуже значуща.

Ця робота не виникла з нічого. Автори розповідають (LeiFengNet), що прототип RoboHarness виник під час участі у глобальному робототехнічному виклику BEHAVIOR Challenge минулого року. Завдання конкурсу були довгими та складними, і команда зрозуміла, що ні енд-ту-енд навчання VLA, ні моделі, такі як клонування поведінки, не змогли впоратися зі складністю завдань. Ця невдача допомогла команді чітко визначити справжню проблему.

02 Як мозок розподілу вирішує, хто вийде на поле

Основна ідея RoboHarness полягає у тому, щоб упакувати окремо розроблені системи керування, такі як VLA, WAM, RL-стратегії, TAMP, у агентні навички, які можна єдиною системою керувати, а вищий прийом рішень покладається на Coding Agent.

Цей дизайн ґрунтується на важливому припущенні: не змінювати та не переосвоювати жодну з базових стратегій. Кожна стратегія зберігає свою початкову реалізацію, не потребуючи спільної архітектури моделі, простору дій чи навчальних даних. RoboHarness додає лише рівень організації поверх них.

Вибрати правильну стратегію — не так-то просто.

Для кодувального агента одного лише вхідного зображення недостатньо, щоб надійно визначити, кому слід передати це завдання. Це рішення супроводжується багатьма кількісними питаннями, на які модель мови не може відповісти за допомогою семантичного розуміння. Вона може зрозуміти, що чашку треба покласти на тарілку, але не може обчислити ступінь подібності поточної сцени до розподілу тренувальних даних певної стратегії за допомогою RGB-зображення, а також не може оцінити надійність даних датчиків у цей момент.

Щоб вирішити цю проблему, система розробила три типи допоміжних навичок, які спеціально призначені для того, щоб допомогти Coding Agent виділити інформацію, необхідну для вирішення.

Агент напрямкується до тілесного світу: від мовної інтелігентності до «головного командира» робота

Розуміння навичок — відповідає за перетворення вихідних даних у кількісні сигнали, наприклад: подібність зображень та даних навчання для кожної стратегії, стабільність позиції об’єкта в часовому вікні, чи відповідають поточне освітлення та якість зображення вимогам. Ці показники є справжньою основою для маршрутизації стратегій. Автор вважає, що суть цього модуля полягає у багатовимірному вимірюванні того, наскільки кожна стратегія підходить для поточної задачі.

Навички пам’яті, пошук історичного досвіду виконання для використання як еталону при виборі стратегії, а також обробка невідповідності розподілу станів між стратегіями за допомогою Memory Bridge — це найважливіший елемент дизайну системи, що детально розглядається нижче.

Evolution Skills, використовуючи онлайн-відгуки для постійного оновлення метаданих та логіки оркестрування, дозволяє системі вчитися на кожному виконанні, а не оцінювати кожну нову ситуацію з нуля.

Інформаційні потоки трьох типів навичок взаємодіють між собою, спільно підтримуючи прийняття рішень Coding Agent. У практичному виконанні цей механізм має дві основні функції: розбиття завдань — розбиття довгих інструкцій на підзавдання, що відповідають різним стратегіям; та динамічне переключення — коли поточна стратегія наближається до межі своїх можливостей, система вчасно переключається на більш підходящу стратегію, забезпечуючи взаємодоповнення між різними стратегіями.

У статті використано серію абляційних експериментів, щоб показати внесок кожного з цих двох етапів: лише за допомогою мовної моделі для розбиття завдання та надсилання його pi0.5, успішність вже значно зросла; додавання кількох гетерогенних стратегій дало подальше суттєве збільшення успішності. Правильне розбиття — це перший крок, а точне розподілення — другий; обидва необхідні.

Але є ще третя проблема, найскладніша, яку не можна вирішити лише вибором стратегії.

03 Рішення про перемогу в естафеті приймається в момент передачі

Дві незалежно навчені стратегії зазвичай існують у власних світах даних. Їхні формати вхідних даних різні, а також вони мають різні розподіли досвіду щодо стану робота. Позиція, де TAMP завершує дію і зупиняється, дуже ймовірно, збігається зі станом простору, який VLA ніколи не обробляв і не може стабільно запустити.

Це унікальна проблема, властива оркестрації гетерогенних стратегій.

Тому Memory Bridge, який відповідає за стабільне переключення між двома стратегіями, автор вважає найважливішим модулем у RoboHarness. Він визнає, що якщо коли-небудь у майбутньому загальна модель зможе ідеально охопити весь простір станів, Memory Bridge може стати непотрібним; але зараз будь-яка модель легко може впасти поза межі своїх можливостей у момент переключення.

Агент напрямкується до тілесного світу: від мовної інтелігентності до «головного командира» робота

Робота Memory Bridge поділяється на три етапи.

Пошук: на основі наступного підзавдання та поточного спостереження, за допомогою текстової та візуальної подібності знайти Top-K схожих траєкторій, у яких цільова стратегія раніше успішно виконувалася, і витягти положення кінцевого виконавчого пристрою, кутові положення суглобів та інші стани робота.

Моделювання: надання сигналів нагляду на основі відносного прогресу кожного стану у траєкторії, реалізація онлайн-регресії для реального часу наближення діапазону станів цільової стратегії «прийняття на себе».

Мост: відбір та оцінка кандидатів на стан з урахуванням впевненості у входженні до зони комфорту цільової стратегії та вартості руху, вибір найбільш підходящої цілі для моста та генерація перехідної траєкторії; після досягнення роботом цього стану керування передається наступній стратегії.

Цей механізм повністю залежить від історичних даних виконання для онлайн-навчання, підходить для будь-якої стратегії «вставив і використовував», не вимагає змін у нижньому рівні реалізації чи спільного навчання.

У експериментах з абляцією, після видалення Memory Bridge прогрес у завданні знизився не настільки сильно, що свідчить про те, що вибір стратегії залишається в основному правильним, але загальна успішність різко впала з 86,0% до 60,4%. Багато завдань доходили до останнього кроку, але провалилися через несумісність станів передачі, що підтверджує цінність Memory Bridge.

04 Дві технічні лінії, тихе злиття

Відійшовши від цієї статті, ми хочемо описати більш широку картину ембодід-технологій.

Автор RoboHarness зауважив, що на тлі швидкого розвитку VLA за останні три роки традиційні TAMP та ієрархічне планування через значно слабшу узагальнювальну здатність у відкритих сценаріях на деякий час вийшли з уваги спільноти. Однак зі швидким прогресом у галузі агентних систем та кодуючих агентів цього року ієрархічні архітектури знову отримали нове життя: високорівневий агент може використовувати компонувані навички для розбиття завдань, виклику інструментів та динамічного планування, що значно підвищує узагальнювальну здатність та адаптивність традиційних ієрархічних методів. Внаслідок цього академічна спільнота знову звертає увагу на цей напрямок і починає досліджувати, як поєднати потужні високорівневі міркування з гетерогенними нижчорівневими стратегіями.

Автор цієї статті походить з кількох університетів та дослідних установ східної Канади. Автор відзначає, що в північноамериканських робототехнічних дослідженнях довгий час існували дві технологічні траєкторії з чітким академічним походженням: на західному узбережжі США, з такими інституціями, як Stanford та Berkeley, акцент робиться на learning та scaling, зосереджуючись на енд-ту-енд навчанні, обсязі даних та узагальненні моделей; тоді як на північному сході США та в Канаді, з такими інституціями, як MIT, Університет Торонто та MILA, протягом тривалого часу приділялася більша увага ієрархічним архітектурам, символічним міркуванням, логічному плануванню та структурованим рішенням.

Автори RoboHarness знаходяться на продовженні цієї лінії.

Диференціація технічних шляхів залишила чіткий слід у промисловості ембодієнту інтелекту. За останні роки швидко розвивалися команди, які поступово сформували технічний спектр від foundation model scaling до agentic hierarchy: одна група зосереджена на загальних ембодієнтичних базових моделях, VLA та world model, постійно розширюючи межі узагальнення шляхом єдиної моделі, масштабу даних та підвищення здатностей моделі; інша група зосереджена на повторно використовуваних операційних навичках та ієрархічній архітектурі, виконуючи складні завдання шляхом планування завдань, комбінування навичок та координації нижчого рівня контролю. У Китаї команди, такі як Zhiyuan, ближчі до першого підходу, тоді як Suduo Technology, Magic Atom тощо акцентують другий. За кордоном серія pi від Physical Intelligence довгий час була символом шляху scaling, тоді як Gemini Robotics продовжує ієрархічну традицію «високорівневого мислення та планування + виконання навичок нижчого рівня».

Цікаво, що диференціація цієї технологічної спадковості не є статичною протилежністю, а формується в процесі постійної еволюції як доповнення. У останні місяці обидві технологічні лінії почали проявляти помітну тенденцію до злиття. Наприклад, Physical Intelligence у pi0.7 підняла контролюваність та комплект навичок до більш центрального місця; одночасно команди, такі як NVIDIA, продовжують розробляти більш ієрархічні robot agentic systems, поєднуючи розуміння та здатність до міркування базових моделей з VLA. Загалом, foundation model scaling та agentic hierarchy поступово еволюціонують від двох відносно незалежних технологічних шляхів до доповнюючих здатностей в одній системі робота.

05 Шлях до більш універсального інтелекту через оркестрування

RoboHarness має чіткі обмеження: він може планувати лише існуючі стратегії і не може вирішити те, чого не можуть зробити всі стратегії. Надійність Memory Bridge залежить від достатньої кількості історичних даних виконання; оцінка здатностей ново підключених стратегій на початкових етапах супроводжується великою невизначеністю.

Основний тезис статті не заперечує необхідність єдиної великої моделі.

Автор підкреслює, що оркестрування довготривалих завдань — це не просто комбінація існуючих здібностей, а й постійне джерело даних про виконання, які охоплюють різні здібності та сценарії, що важко отримати окремим моделем. Ці дані фіксують переключення між стратегіями, їх зв’язування, відновлення після невдач та взаємодію — і саме вони можуть стати важливим джерелом для навчання наступного покоління універсальних робототехнічних моделей. Виходячи з цієї ідеї, команда RoboHarness також досліджує можливість повторного використання даних, отриманих під час гібридного оркестрування та виконання, для навчання базових стратегій: досвід гетерогенного оркестрування додає нові знання, що покращують фундаментальні здібності моделей.

Від пошуку найпотужніших моделей до організації найбільш підходящих здібностей, конкуренція у сфері ембодієнту інтелекту тихо поширюється на рівень дизайну систем. Гетерогенні стратегії оркестрування та єдина велика модель — це подорожі вздовж двох різних хребтів, які в кінцевому підсумку ведуть до однієї й тієї ж мети: надати роботам більш універсальний і надійний інтелект.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.