[Axis가 공개한 100시간 Egocentric Data, 사람의 작업을 로봇 학습 데이터로 정리하는 방법] @KaitoAI X @axisrobotics Axis 참여 링크 (레퍼럴): https://t.co/hUbWSVsBVR 사람은 컵을 집을 때 손가락 각도나 손목 궤적을 계산하지 않습니다. 눈앞에 있는 컵을 자연스럽게 집어 다른 곳에 놓을 뿐입니다. 로봇에게 같은 일을 가르치려면 이야기가 달라집니다. 손이 물체에 가까워진 시점, 실제로 닿은 순간, 들어 올린 뒤 이동한 경로, 다시 내려놓는 시점까지 행동을 나눠야 합니다. 사람에게는 한 번에 이어지는 동작이지만 로봇이 배우려면 그 안에서 무슨 일이 있었는지를 데이터로 풀어내야 합니다. Axis가 9월 초 다시 업데이트한 axis-ego-samples는 이런 사람의 행동을 로봇 학습 데이터로 바꾸는 과정을 실제 파일로 보여줍니다. 현재 공개된 egocentric video는 100시간입니다. 작업자의 시야에서 촬영한 1인칭 영상으로 교육, 숙박, 리테일, 창고, 공예, 케이터링, 사무, 생산, 물류 등 실제 작업 환경이 scene category로 나뉘어 있습니다. 데이터는 LeRobot format으로 정리돼 있고 1차 dense action annotation도 같은 묶음에 포함돼 있습니다. 영상에 등장하는 행동은 특별하지 않습니다. 물건을 꺼내 다른 곳에 놓거나, 도구를 쓰거나, 작업대를 정리하는 식입니다. 일상이나 일터에서 자주 볼 수 있는 장면들입니다. 이런 평범한 행동도 로봇 학습 데이터가 되려면 훨씬 세밀해집니다. Annotation review에는 101개 clip이 들어 있고 frame-by-frame language annotation은 80,090개 segment로 나뉘어 있습니다. 긴 영상 전체에 하나의 작업 이름만 붙이는 게 아니라 행동이 바뀌는 시점에 맞춰 구간을 나눠 어느 순간에 어떤 동작이 일어났는지를 기록한 형태입니다. 컵 하나를 옮기는 장면도 같은 방식으로 쪼개집니다. 손이 컵에 가까워지는 구간과 실제로 잡는 순간이 다르고 이동하는 동안의 상태와 내려놓는 시점도 따로 구분됩니다. 사람 눈에는 하나의 자연스러운 행동이지만 데이터 안에서는 여러 단계로 나뉩니다. 이 과정이 필요한 이유는 사람과 로봇의 몸이 같지 않기 때문입니다. 사람 손은 여러 관절과 손가락을 자유롭게 쓰지만 로봇은 구조마다 움직일 수 있는 범위가 다릅니다. 단순한 gripper를 쓰는 경우도 있고 카메라가 달린 위치도 제각각입니다. 사람의 손 움직임을 그대로 robot action으로 복사하는 방식으로는 해결되지 않습니다. 영상에서 행동 구간과 물체 상태를 먼저 찾아낸 뒤 해당 로봇이 실제로 실행할 수 있는 action representation으로 다시 연결하는 작업이 필요합니다. 촬영 장비도 여러 종류가 쓰입니다. axis-ego-samples에는 dual fisheye, six-camera RGB+SLAM, MEgo, Gen DAS Ego, FEAGINE EGO, GI Labs 등 서로 다른 capture device에서 얻은 sample이 공개돼 있습니다. 같은 작업을 찍더라도 카메라 구성에 따라 영상은 달라질 수 있습니다. 시야각이 달라지고 손이 화면에 잡히는 위치도 달라지며 위치 정보를 얻는 방식 역시 장비마다 차이가 있습니다. 실제 환경에서 데이터를 대규모로 모으려면 이런 차이를 피하기 어렵습니다. 한 종류의 장비와 한 가지 촬영 조건만 가정하기보다 서로 다른 입력을 학습에 쓸 수 있는 형태로 정리하는 과정까지 함께 필요해집니다. 별도의 sample-150h-10cat 폴더에는 150시간 분량의 delivery corpus에서 category별로 가져온 10개 episode가 공개돼 있습니다. 다만 public repository에 올라온 것은 이 10개 sample이고 150시간 corpus 전체가 공개된 것은 아닙니다. 현재 axis-ego-samples repository 전체 파일 크기는 약 770GB입니다. 이 데이터가 Axis의 다른 제품과 어떻게 이어지는지도 볼 수 있습니다. Mobile Egocentric App은 사람이 움직이는 동안 hand pose를 실시간으로 추적하고 그 움직임을 robotic motion으로 바꾸는 방향으로 만들어지고 있습니다. 브라우저 simulation에서는 사람이 가상 로봇을 직접 조작하면서 state와 action을 만듭니다. egocentric capture에서는 현실 공간에서 사람이 수행하는 작업을 먼저 기록한 뒤 그 안에서 로봇 학습에 필요한 행동을 찾아냅니다. 하나는 로봇을 직접 움직이며 데이터를 만드는 방식이고 다른 하나는 사람이 이미 하고 있는 행동을 데이터로 바꾸는 방식입니다. 여기서 한 가지 재미있는 점이 생깁니다. 로봇에게 경험을 쌓게 하려면 반드시 로봇을 계속 움직여야 하는 건 아닙니다. 사람은 이미 매일 수많은 물체를 다루고 있습니다. 컵을 집어 옮기고 문을 열고 상자를 정리하고 도구를 사용하는 행동이 현실 곳곳에서 반복됩니다. 이런 행동을 충분히 정확하게 기록하고 로봇의 움직임과 연결할 수 있다면 사람이 살아가면서 만들어내는 일상적인 행동 자체가 로봇 학습 데이터의 원천이 될 수 있습니다. 이 아이디어가 실제 로봇 연구에서 어떻게 쓰이는지는 Axis와 별개의 연구인 EgoScale에서도 참고할 수 있습니다.EgoScale, được công bố vào tháng 2 năm 2026, đã được tiền huấn luyện VLA bằng hơn 20.854 giờ video egocentric con người có nhãn hành động, sau đó tiếp tục học thêm dữ liệu đồng bộ hóa giữa con người và robot. Trong đánh giá trên tay robot linh hoạt 22-DoF, tỷ lệ thành công trung bình của chính sách cuối cùng cao hơn 54% so với baseline không tiền huấn luyện. EgoScale không phải là nghiên cứu mang tính Axis, và việc chỉ thêm nhiều video con người không có nghĩa là robot sẽ tự động hoạt động tốt. Đây là một ví dụ về việc cải thiện hiệu suất bằng cách học trải nghiệm rộng từ hành động con người trước, sau đó bổ sung dữ liệu phù hợp với embodiment và hành động thực tế của robot. Axis đang kết nối dữ liệu này với các ứng dụng hợp tác thực tế. Trong hợp tác với Dexmal được công bố ngày 28 tháng 8, Axis đã xác nhận rằng họ sẽ phụ trách sản xuất lượng lớn dữ liệu egocentric, mô phỏng và thực tế để sử dụng trong VLA và world model của Dexmal. Vẫn còn một số phần chưa được công khai. Quy mô dữ liệu thực tế được chuyển đến Dexmal và những thay đổi mà dữ liệu này mang lại cho hiệu suất mô hình vẫn chưa được tiết lộ. Tuy nhiên, chỉ với các tài liệu đã công khai hiện tại, chúng ta đã có thể xác định rõ Axis đang thực hiện những công việc gì. 100 giờ dữ liệu LeRobot đã thực sự được đăng tải, và ghi chú frame-by-frame đã được chia thành 80.090 đoạn. Các mẫu thu được từ nhiều thiết bị ghi hình khác nhau cũng đã được công khai cùng nhau. Quá trình này bao gồm việc quay lại các hành động ngắn mà con người thực hiện một cách tự nhiên trong đời thực, xác định ranh giới hành động trong đó, tổng hợp chuyển động của vật thể và bàn tay, rồi chuyển đổi chúng thành định dạng phù hợp để robot học. Mấy giây trôi qua vô tình với con người lại trở thành một trải nghiệm học tập cho robot. Những gì Axis đang công khai hiện nay là kết quả của quá trình này được hiện thực hóa bằng dữ liệu thực tế. #PhysicalAI #RobotLearning
Grid (❖,❖) 🟩 🐬TermMax 🚢Chia sẻ

Nguồn:Hiển thị bản gốc
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này.
Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụng và Tiết lộ rủi ro của chúng tôi.