source avatarGrid (❖,❖) 🟩 🐬TermMax 🚢

Поделиться

[Axis представила 100 часов эгокинетических данных: как превратить человеческие действия в данные для обучения роботов] @KaitoAI X @axisrobotics Ссылка на участие в Axis (реферальная): https://t.co/hUbWSVsBVR Когда человек берет чашку, он не рассчитывает углы пальцев или траекторию запястья. Он просто естественно берет чашку перед собой и ставит ее в другое место. Чтобы научить робота тому же самому, нужно подойти иначе. Действие нужно разбить на этапы: момент приближения руки к объекту, момент контакта, подъема, перемещения и помещения обратно. Для человека это единое, непрерывное движение, но роботу нужно разложить его на данные, чтобы понять, что именно происходило в каждый момент. Axis-ego-samples, обновленные Axis в начале сентября, демонстрируют этот процесс преобразования человеческих действий в данные для обучения роботов на реальных файлах. На данный момент доступно 100 часов эгокинетических видео. Это видео с точки зрения оператора, отснятое в реальных рабочих средах — образовании, жилье, ритейле, складе, ремесле, кейтеринге, офисе, производстве и логистике — с категоризацией по сценам. Данные структурированы в формате LeRobot и включают первичную плотную аннотацию действий в том же наборе. Поведение, показанное в видео, не является необычным. Это извлечение предметов и их перемещение, использование инструментов, уборка рабочих поверхностей — обычные сцены из повседневной жизни или рабочего пространства. Но даже такие простые действия требуют гораздо более детальной обработки, чтобы стать данными для обучения роботов. В аннотационном обзоре содержится 101 клип, а фрейм-по-фрейм языковая аннотация разделена на 80 090 сегментов. Вместо того чтобы присваивать всей длинной видеозаписи одно название действия, каждый сегмент разделяется по моментам смены действия — фиксируется, какое движение произошло в какой момент. Даже перемещение одной чашки разбивается таким же образом. Интервал приближения руки к чашке отличается от момента фактического захвата; состояние во время перемещения и момент опускания также выделяются отдельно. То, что для человеческого глаза — одно естественное действие — в данных разбивается на несколько этапов. Это необходимо потому, что тело человека и тело робота не одинаковы. Человеческая рука свободно использует множество суставов и пальцев, тогда как у робота диапазон движений зависит от его конструкции. У одних роботов — простые захватывающие устройства, у других — камеры в разных положениях. Простое копирование движений человеческой руки в действия робота не решит задачу. Сначала нужно выявить в видео интервалы действий и состояния объектов, а затем сопоставить их с представлением действий, которые конкретный робот может реально выполнить. Также используются различные типы оборудования для съемки. В axis-ego-samples представлены образцы, полученные с разных устройств: dual fisheye, шестикамерная RGB+SLAM, MEgo, Gen DAS Ego, FEAGINE EGO, GI Labs и др. Даже при записи одного и того же действия видеоряд может отличаться в зависимости от конфигурации камер: меняется угол обзора, положение рук на кадре и способ получения информации о позиции — все это различается между устройствами. При сборе больших объемов данных в реальных условиях избежать этих различий невозможно. Необходимо не просто предполагать использование одного типа оборудования и одного режима съемки — нужно также подготовить данные так, чтобы они могли использоваться для обучения с различными входными данными. В отдельной папке sample-150h-10cat опубликованы 10 эпизодов из 150-часового корпуса доставки, отобранных по категориям. Однако в публичном репозитории доступны только эти 10 образцов — весь 150-часовой корпус не опубликован. Общий размер всех файлов в репозитории axis-ego-samples составляет около 770 ГБ. Также можно увидеть, как эти данные связаны с другими продуктами Axis. Mobile Egocentric App разрабатывается для того, чтобы в реальном времени отслеживать позу рук человека во время движения и преобразовывать эти движения в роботизированные действия. В браузерной симуляции человек напрямую управляет виртуальным роботом, создавая состояния и действия. В эгокинетической съемке сначала записываются реальные действия человека в физическом пространстве, а затем из них извлекаются действия, полезные для обучения робота. Один подход — создавать данные путем прямого управления роботом; другой — преобразовывать уже существующие человеческие действия в данные. Здесь возникает один интересный момент: Чтобы дать роботу опыт, не обязательно постоянно двигать самого робота. Люди уже ежедневно многократно взаимодействуют с объектами: берут чашки, открывают двери, укладывают коробки, используют инструменты — такие действия происходят повсюду вокруг нас. Если эти действия можно достаточно точно записать и связать с движениями робота, то сами повседневные действия человека станут источником данных для обучения роботов. Как эта идея применяется в реальных исследованиях роботов — можно увидеть и в исследовании EgoScale, не связанном напрямую с Axis.EgoScale, опубликованная в феврале 2026 года, сначала предварительно обучила VLA на более чем 20 854 часах действий, помеченных в эгокинетических видео людей, а затем дополнительно обучила на данных, согласованных с человеком и роботом. На оценке с 22-DOF ловким роботизированным рукой средний показатель успешности окончательной политики был на 54% выше, чем у базовой модели без предварительного обучения. EgoScale — это независимое исследование, и простое добавление большого количества видео людей не означает, что роботы сразу начнут хорошо двигаться. Это пример, когда производительность улучшается после того, как сначала обучают широкому опыту на действиях людей, а затем добавляют данные, соответствующие конкретной физической реализации и действиям робота. Axis также связывает эти данные с реальными совместными применениями. В ходе сотрудничества с Dexmal, объявленного 28 августа, Axis взял на себя ответственность за создание масштабных наборов эгокинетических, симуляционных и реальных данных для использования в VLA и world model Dexmal. Некоторые детали пока не были раскрыты: Объем данных, переданных Dexmal, и то, как именно эти данные повлияли на производительность модели, пока не сообщались. Однако даже по имеющимся на данный момент данным можно достаточно четко понять, какие задачи выполняет Axis. Фактически опубликованы данные LeRobot объемом 100 часов, а разметка кадр за кадром разделена на 80 090 сегментов. Также были опубликованы образцы, полученные с различных устройств захвата. Это процесс: запись коротких действий, которые люди естественно выполняют в реальном мире, выделение границ этих действий, структурирование движений объектов и рук, а затем преобразование их в форму, пригодную для обучения роботов. Несколько секунд, которые для человека проходят незаметно, становятся для робота одним опытом обучения. То, что Axis сейчас публикует — это результат превращения этого процесса в реальные данные. #PhysicalAI #RobotLearning

No.0 picture
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.