source avatarGrid (❖,❖) 🟩 🐬TermMax 🚢

Compartir

[Axis revela 100 horas de datos egocéntricos: cómo convertir acciones humanas en datos de entrenamiento para robots] @KaitoAI X @axisrobotics Enlace de participación en Axis (referido): https://t.co/hUbWSVsBVR Cuando una persona toma una taza, no calcula los ángulos de los dedos ni la trayectoria de la muñeca. Simplemente toma la taza frente a ella de forma natural y la coloca en otro lugar. Enseñarle lo mismo a un robot es completamente diferente. Hay que dividir el comportamiento en momentos específicos: cuando la mano se acerca al objeto, el instante exacto en que lo toca, la trayectoria tras levantarlo, y el momento en que lo vuelve a colocar. Para una persona, es un movimiento continuo, pero para que un robot lo aprenda, es necesario descomponerlo en datos que expliquen qué sucedió en cada etapa. El axis-ego-samples actualizado por Axis a principios de septiembre muestra este proceso de transformación de acciones humanas en datos de entrenamiento para robots, con archivos reales. Actualmente, los videos egocéntricos públicos suman 100 horas. Son grabaciones en primera persona desde la perspectiva del operario, clasificadas por escenarios reales como educación, alojamiento, retail, almacén, artesanía, catering, oficina, producción y logística. Los datos están organizados en formato LeRobot e incluyen anotaciones densas de acciones de primera generación dentro del mismo paquete. Los comportamientos mostrados en los videos no son especiales: sacar objetos y colocarlos en otro lugar, usar herramientas, organizar mesas de trabajo. Son escenas comunes que se ven diariamente en casa o en el trabajo. Pero para que estos comportamientos comunes sirvan como datos de entrenamiento para robots, deben volverse mucho más detallados. El conjunto de revisión de anotaciones contiene 101 clips, y las anotaciones lingüísticas frame por frame se dividen en 80.090 segmentos. En lugar de etiquetar todo el video largo con un solo nombre de tarea, se dividen los segmentos según los cambios de acción, registrando exactamente qué movimiento ocurrió en cada instante. Incluso el acto de mover una taza se divide de esta manera: el intervalo en que la mano se acerca a la taza es distinto del momento exacto en que la agarra; el estado durante el movimiento y el instante en que se coloca también se separan claramente. Lo que para los ojos humanos es un solo movimiento natural, dentro de los datos se descompone en múltiples etapas. Esta necesidad surge porque los cuerpos humanos y los robots no son iguales. La mano humana utiliza múltiples articulaciones y dedos con libertad total, mientras que los robots varían según su estructura y su rango de movimiento. Algunos usan pinzas simples, otros tienen cámaras en posiciones distintas. No se puede copiar directamente el movimiento humano como acción robótica. Primero se deben identificar los segmentos de acción y el estado del objeto en el video, luego mapearlos a representaciones de acción que el robot específico pueda ejecutar realmente. También se utilizan diversos equipos de captura. El repositorio axis-ego-samples incluye muestras obtenidas de dispositivos distintos: dual fisheye, seis cámaras RGB+SLAM, MEgo, Gen DAS Ego, FEAGINE EGO, GI Labs, entre otros. Incluso al grabar la misma tarea, la configuración de la cámara puede cambiar el video: el ángulo de visión varía, la posición de la mano dentro del encuadre cambia, y los métodos para obtener información de ubicación también difieren entre dispositivos. Cuando se recopilan grandes volúmenes de datos en entornos reales, es inevitable enfrentar estas diferencias. Es necesario no solo asumir un solo tipo de equipo o condición de grabación, sino también organizar los datos para que puedan aprenderse a partir de entradas diversas. En una carpeta separada llamada sample-150h-10cat se publican 10 episodios seleccionados por categoría de un corpus de 150 horas dedicado a entregas. Sin embargo, solo estos 10 ejemplos están disponibles en el repositorio público; el corpus completo de 150 horas no se ha liberado aún. El tamaño total actual del repositorio axis-ego-samples es aproximadamente 770 GB. También se puede ver cómo estos datos se conectan con otros productos de Axis. La aplicación móvil egocéntrica está diseñada para rastrear en tiempo real la postura de la mano mientras una persona se mueve y convertir esos movimientos en acciones robóticas. En simulaciones por navegador, las personas manipulan directamente un robot virtual para generar estados y acciones. En capturas egocéntricas, primero se registran las tareas realizadas por personas en el mundo real, luego se extraen los comportamientos útiles para el entrenamiento robótico. Uno es un método donde se generan datos moviendo directamente un robot; el otro transforma acciones ya realizadas por personas en datos. Aquí surge un punto interesante: Para que un robot adquiera experiencia, no es necesario moverlo constantemente. Las personas ya manejan innumerables objetos cada día: toman tazas, abren puertas, organizan cajas, usan herramientas. Estos comportamientos ocurren repetidamente en todos los entornos cotidianos. Si estos movimientos pueden registrarse con suficiente precisión y vincularse adecuadamente a las acciones robóticas, entonces las actividades cotidianas humanas mismas pueden convertirse en una fuente valiosa de datos para el entrenamiento robótico. Esta idea también puede observarse en investigaciones independientes de Axis, como EgoScale.EgoScale, lanzado en febrero de 2026, primero preentrenó una VLA con más de 20.854 horas de videos egocéntricos de humanos etiquetados con acciones, y luego continuó el entrenamiento con datos alineados humano-robot. En la evaluación de una mano robótica dextrosa de 22 GDL, la tasa de éxito promedio de la política final fue un 54 % superior a la línea base sin preentrenamiento. EgoScale no es un estudio independiente de Axis, ni significa que simplemente al incluir más videos humanos, los robots puedan moverse bien de inmediato. Se trata de un ejemplo en el que el rendimiento mejora cuando se aprende primero una amplia experiencia a partir de acciones humanas y luego se añaden datos específicos adaptados a la embodiment y acciones reales del robot. Axis también está conectando estos datos con aplicaciones prácticas de colaboración. En la colaboración anunciada el 28 de agosto con Dexmal, Axis se encargó de la producción a gran escala de datos egocéntricos, de simulación y del mundo real para ser utilizados por el VLA y el modelo mundial de Dexmal. Aún hay partes que no se han hecho públicas. No se ha revelado la escala exacta de los datos transmitidos a Dexmal ni cómo estos datos han impactado el rendimiento del modelo. Con solo la información actualmente disponible, ya es posible comprender claramente qué tipo de trabajo está realizando Axis. Ya se han publicado 100 horas de datos de LeRobot, y las anotaciones frame por frame se dividen en hasta 80.090 segmentos. También se han publicado muestras obtenidas de varios dispositivos de captura. Se trata de un proceso en el que se graban acciones cortas realizadas naturalmente por humanos en entornos reales, se delimitan los límites de las acciones dentro de esas grabaciones, se organizan los movimientos de los objetos y las manos, y finalmente se transforman en formatos adecuados para el aprendizaje robótico. Lo que para los humanos es un simple instante sin importancia se convierte en una experiencia de aprendizaje para los robots. Lo que Axis está publicando ahora es el resultado concreto de este proceso en forma de datos reales. #PhysicalAI #RobotLearning

No.0 picture
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.