[La méthode d'Axis pour transformer 100 heures de données égocentriques humaines en données d'apprentissage pour les robots] @KaitoAI X @axisrobotics Lien de participation Axis (référence) : https://t.co/hUbWSVsBVR Lorsqu'une personne prend une tasse, elle ne calcule pas les angles des doigts ni la trajectoire du poignet. Elle prend simplement naturellement la tasse devant elle et la dépose ailleurs. Enseigner la même tâche à un robot est une tout autre affaire. Il faut diviser le geste en étapes : le moment où la main approche l'objet, le moment précis où elle le touche, le trajet suivi après l'avoir soulevé, et le moment où elle le repose. Ce qui est pour l'humain un mouvement fluide et continu doit être décomposé en données pour que le robot puisse l'apprendre. Le dataset axis-ego-samples mis à jour par Axis début septembre montre concrètement ce processus de transformation des comportements humains en données d'apprentissage robotique. Les vidéos égocentriques actuellement publiées totalisent 100 heures. Ces vidéos, filmées du point de vue de l'opérateur, sont classées par catégories de scènes : éducation, hébergement, commerce de détail, entrepôt, artisanat, restauration, bureau, production, logistique, etc. Les données sont structurées au format LeRobot et incluent une première annotation dense des actions dans le même ensemble. Les comportements observés dans les vidéos ne sont pas exceptionnels. Il s'agit simplement de prendre des objets pour les déposer ailleurs, d'utiliser des outils ou de ranger un plan de travail. Ce sont des scènes courantes dans la vie quotidienne ou au travail. Mais pour que ces gestes ordinaires deviennent des données d'apprentissage robotique, ils doivent être beaucoup plus précis. L'analyse des annotations comprend 101 clips, répartis en 80 090 segments d'annotations linguistiques frame par frame. Au lieu d'attribuer un seul nom de tâche à toute la vidéo, les segments sont découpés à chaque changement d'action, enregistrant précisément quel mouvement s'est produit à quel instant. Même le geste de déplacer une tasse est découpé selon ce principe. La phase où la main approche la tasse est distincte du moment exact où elle la saisit ; l'état pendant le déplacement et le moment du repos sont également séparés. Ce qui apparaît à l'œil humain comme un seul geste naturel est divisé en plusieurs étapes dans les données. Cette précision est nécessaire parce que le corps humain et celui du robot ne sont pas identiques. La main humaine utilise librement plusieurs articulations et doigts, tandis que chaque robot a des limites de mouvement propres à sa structure. Certains utilisent un simple effecteur de saisie, d'autres ont des caméras placées à des emplacements variés. Il n'est pas possible de copier directement les mouvements humains en actions robotiques. Il faut d'abord identifier les segments d'action et l'état des objets dans la vidéo, puis les relier à une représentation d'action que le robot spécifique peut effectivement exécuter. Les équipements de capture sont également variés. Le dataset axis-ego-samples inclut des échantillons provenant de différents dispositifs de capture : dual fisheye, six caméras RGB+SLAM, MEgo, Gen DAS Ego, FEAGINE EGO, GI Labs, etc. Même pour une même tâche, les vidéos peuvent varier selon la configuration des caméras : l'angle de vue change, la position des mains dans l'image varie, et la manière d'obtenir les informations de position diffère selon les appareils. Il est difficile d'éviter ces différences lorsqu'on collecte des données à grande échelle dans des environnements réels. Il faut donc prévoir non seulement des données issues d'un seul type d'équipement ou d'une seule condition de prise de vue, mais aussi structurer les données pour qu'elles puissent apprendre à partir d'entrées variées. Un dossier séparé, sample-150h-10cat, contient 10 épisodes extraits du corpus de 150 heures dédié à la livraison, classés par catégorie. Cependant, seuls ces 10 échantillons sont publiés sur le dépôt public ; le corpus complet de 150 heures n'est pas encore disponible. La taille totale des fichiers du dépôt axis-ego-samples s'élève actuellement à environ 770 Go. On peut également voir comment ces données s'intègrent aux autres produits d'Axis. L'application Mobile Egocentric vise à suivre en temps réel la posture de la main pendant les mouvements humains et à les convertir en mouvements robotiques. Dans la simulation par navigateur, l'utilisateur manipule directement un robot virtuel pour générer des états et des actions. Dans la capture égocentrique, on enregistre d'abord les tâches réalisées par un humain dans le monde réel, puis on extrait les comportements utiles à l'apprentissage robotique. L'un consiste à créer des données en manipulant directement un robot ; l'autre consiste à transformer en données les actions que l'humain effectue déjà naturellement. Un point intéressant émerge ici : Pour permettre à un robot d'acquérir de l'expérience, il n'est pas nécessaire de le déplacer continuellement. Les humains manipulent déjà quotidiennement un grand nombre d'objets : ils prennent des tasses, ouvrent des portes, rangent des boîtes et utilisent des outils — ces gestes se répètent constamment dans la vie réelle. Si ces comportements peuvent être enregistrés avec suffisamment de précision et reliés aux mouvements possibles du robot, alors les gestes quotidiens naturels de l'humain deviennent eux-mêmes une source précieuse de données d'apprentissage robotique. Cette idée est également explorée dans d'autres recherches indépendantes d'Axis, comme EgoScale.EgoScale, dévoilé en février 2026, a d'abord été pré-entraîné sur plus de 20 854 heures de vidéos égocentriques humaines étiquetées par action, puis affiné avec des données alignées humain-robot. Sur l'évaluation d'une main robotique dextrans de 22 DoF, le taux de réussite moyen de la politique finale était de 54 % supérieur à celui de la base-line sans pré-entraînement. EgoScale n'est pas une recherche liée à Axis, et il ne signifie pas qu'ajouter simplement beaucoup de vidéos humaines permet immédiatement aux robots de bien bouger. Il s'agit d'un cas où la performance s'améliore après avoir d'abord appris une large expérience à partir du comportement humain, puis en ajoutant des données spécifiques à l'embodiment et aux actions réelles du robot. Axis relie également ces données à des applications pratiques en collaboration. Dans le cadre d'un partenariat annoncé le 28 août avec Dexmal, Axis a déclaré être chargé de produire une grande quantité de données égocentriques, de simulation et du monde réel pour le VLA et le modèle mondial de Dexmal. Certaines informations ne sont pas encore publiées. La taille exacte des données transmises à Dexmal et leur impact précis sur les performances du modèle n'ont pas été révélées. Cependant, même avec les seules informations actuellement publiées, il est possible de comprendre clairement les activités menées par Axis. Des données LeRobot de 100 heures ont effectivement été publiées, avec des annotations frame par frame divisées en 80 090 segments. Des échantillons provenant de plusieurs dispositifs de capture sont également mis à disposition. Il s'agit d'un processus consistant à filmer des actions courtes et naturelles effectuées par des humains dans le monde réel, à délimiter les frontières des actions au sein de ces vidéos, à annoter les mouvements des objets et des mains, puis à les transformer en un format exploitable pour l'apprentissage robotique. Ce que les humains perçoivent comme quelques secondes insignifiantes devient une expérience d'apprentissage pour les robots. Ce qu'Axis publie aujourd'hui est le résultat concret de ce processus, sous forme de données réelles. #PhysicalAI #RobotLearning
Grid (❖,❖) 🟩 🐬TermMax 🚢Partager

Source:Afficher l'original
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations.
Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.