[100 годин егокентричних даних, опублікованих Axis: як перетворити дії людини на дані для навчання роботів] @KaitoAI X @axisrobotics Посилання на участь у Axis (реферальне): https://t.co/hUbWSVsBVR Коли людина піднімає чашку, вона не розраховує кути пальців або траєкторії запястя. Вона просто природно бере чашку перед собою і кладе її куди треба. Навчити робота цьому — інша історія. Потрібно розбити дію на етапи: коли рука наближається до об’єкта, коли вона його дійсно торкається, коли піднімає його, як рухається в просторі та коли кладе назад. Для людини це єдиний, безперервний рух, але робот має навчитися розуміти, що саме відбувається всередині цього руху, і перетворити це на дані. Axis-ego-samples, оновлений у вересні, демонструє цей процес перетворення дій людини на дані для навчання роботів — на прикладі реальних файлів. Наразі опубліковано 100 годин егокентричних відео. Це відео з першої особи, зняті з точки зору працівника, класифіковані за сценами: навчання, проживання, роздрібна торгівля, склад, ремесла, кейтеринг, офіс, виробництво, логістика тощо. Дані структуровано у форматі LeRobot і містять первинну щільну анотацію дій у тому ж наборі. Дії, зображені у відео, не є незвичайними. Це витягування предметів і розміщення їх у інших місцях, використання інструментів, прибирання робочих поверхонь — звичайні сцени з повсякденного життя чи робочого середовища. Але щоб такі звичайні дії стали даними для навчання робота, їх потрібно зробити набагато детальнішими. У анотаціях міститься 101 кліп, а фрейм-за-фрейм мовна анотація поділена на 80 090 сегментів. Замість того щоб призначати одне ім’я завдання на все відео, сегменти визначаються саме в моменти зміни дії — фіксуючи, що саме відбувається у кожен момент часу. Навіть перенесення однієї чашки розбивається за цим принципом. Період наближення руки до чашки — це інше, ніж момент фактичного захоплення; стан під час переміщення — окремий етап; а момент покладання — ще один. Для людського ока це одна природна дія, але в даних вона поділена на кілька етапів. Цей процес необхідний тому, що тіла людей і роботів не однакові. Людська рука має багато суглобів і пальців, якими можна вільно керувати, тоді як у робота діапазон руху залежить від його конструкції. Хтось використовує простий захоплювач, а хтось — з камерою, і їхнє розташування вар’юється. Просто скопіювати рухи людської руки як дії робота — неможливо. Спочатку потрібно знайти у відео дії та стани об’єктів, а потім перетворити їх на представлення дій, які саме цей робот може виконати. Також використовуються різні пристрої для зйомки. У axis-ego-samples опубліковано зразки з різних пристроїв: dual fisheye, шестикамерна RGB+SLAM, MEgo, Gen DAS Ego, FEAGINE EGO, GI Labs тощо. Навіть якщо фіксується одна й та ж дія, зображення може виглядати по-різному залежно від конфігурації камер: кут огляду змінюється, положення рук на екрані вар’юється, а метод отримання просторової інформації також вар’юється між пристроями. При масштабному збиранні даних у реальних умовах неможливо уникнути таких вар’ювань. Потрібно не просто припустити один тип пристрою та одну умову зйомки — потрібно структурувати дані так, щоб вони могли навчатися на різних типах входових даних. Окремо у папці sample-150h-10cat опубліковано 10 епізодів з 150-годинного корпусу доставки — по одному на кожну категорію. Але публічний репозиторий містить лише цих 10 зразків — повний корпус з 150 годинами ще не опубліковано. Загальний обсяг всього файлового набору axis-ego-samples становить близько 770 ГБ. Також можна побачити, як цей набір даних пов’язаний з іншими продуктами Axis. Mobile Egocentric App створюється для того, щоб у реальному часi визначати позу рук людини під час її руху та перетворювати цей рух на роботизоване перемiщення. У браузернiй симуляцiї людина безпосередньо керує вiртуальним роботом, формуючи стани та дiї. У егокентричному захопленнi спочатку фiксуються реальнi дiї людини у фiзичному просторi, а потiм у них знаходяться дiї, кориснi для навчання робота. Один пiдхiд — створювати данi шляхом прямого керування роботом; інший — перетворювати на данi дiї, якими людина й так займається. Тут виникає одна цікава ідея: Щоб надати роботу досвiд, не обов’язково постiйно перемiщувати самого робота. Люди щодня безлiч разiв працюють з предметами: беруть чашки, вiдкривають дверi, складають коробки, користуються інструментами — це повторюється повсюди. Якщо такi дiї можна точно зафiксувати та правильно пов’язати з можливостями робота — тодi саме повсякденнi дiї людини можуть стати джерелом даних для навчання робота. Як ця ідея застосовується у реальних дослiдженнях робототехнiки — можна побачити й у дослiдженнi EgoScale, яке не пов’язане безпосередньо з Axis.EgoScale, опублікований у лютому 2026 року, спочатку попередньо навчав VLA на більш ніж 20 854 годинах дійових егокоцентричних відео з людьми, а потім додатково навчався на даних, що вирівнюють людину та робота. На оцінці роботизованої руки з 22 ступенями свободи середній показник успішності кінцевої політики був на 54% вищим, ніж у базової моделі без попереднього навчання. EgoScale — це дослідження, не пов’язане з Axis, і це не означає, що просто додавання багатьох відео з людьми автоматично робить робота досконалим. Це приклад того, як продуктивність покращується, коли спочатку навчають широкого досвіду на діях людей, а потім додають дані, що відповідають реальному тілу та діям робота. Axis також застосовує ці дані до реальних спільних завдань. У співпраці з Dexmal, про яку було оголошено 28 серпня, Axis взяв на себе відповідальність за створення великих обсягів егокоцентричних, симуляційних та реальних даних для використання у VLA та world model Dexmal. Деякі деталі ще не опубліковані: масштаб даних, переданих Dexmal, і те, як саме ці дані вплинули на продуктивність моделей, не були розкриті. Проте навіть за наявними публічними даними можна чітко зрозуміти, якими завданнями займається Axis. Дані LeRobot обсягом 100 годин фактично опубліковано, а фрейм-по-фрейм анотації розділено на 80 090 сегментів. Також опубліковано зразки, отримані з різних пристроїв зйомки. Це процес: запис коротких, природних дій, які люди виконують у реальному світі, подальше розбиття цих дій на межі, визначення руху об’єктів і рук, а потім перетворення їх у формат, придатний для навчання робота. Для людини це кілька секунд, що проходять без уваги — для робота це один епізод навчання. Те, що Axis зараз публікує — це результат реального створення цього процесу на основі справжніх даних. #PhysicalAI #RobotLearning
Grid (❖,❖) 🟩 🐬TermMax 🚢Поділитися

Джерело:Показати оригінал
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації.
Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.