source avatarGrid (❖,❖) 🟩 🐬TermMax 🚢

分享

[Axis 公開的 100 小時 Egocentric 數據:將人類行為整理為機器人學習數據的方法] @KaitoAI X @axisrobotics Axis 參與連結(推薦):https://t.co/hUbWSVsBVR 人類拿起杯子時,並不會計算手指的角度或手腕的軌跡, 只是自然地將眼前杯子拿起,放到其他地方。 但若要教機器人做同樣的事,情況就不同了。 必須將動作拆解為:手接近物體的時刻、實際觸碰的瞬間、提起後移動的路徑、以及再次放下的時點。 對人類而言是一氣呵成的動作,但對機器人來說,必須將其中每一個細節轉化為數據。 Axis 於 9 月初更新的 axis-ego-samples,正是以實際檔案呈現將人類行為轉換為機器人學習數據的過程。 目前公開的 egocentric 影片總長為 100 小時, 這些第一人稱視角影片根據實際工作環境分為教育、住宿、零售、倉儲、工藝、餐飲、辦公、生產、物流等 scene category。 數據已整理為 LeRobot 格式,並包含一階 dense action 標註。 影片中出現的行為並無特殊之處, 例如取出物品並放置到其他位置、使用工具、整理工作台等, 都是日常或工作場景中常見的畫面。 然而,即使這些平凡的行為要成為機器人學習數據,也需要極其細緻的處理。 在 annotation review 中包含 101 個 clip,而 frame-by-frame 語言標註則細分為 80,090 個 segment。 並非僅為整段影片標註一個任務名稱,而是根據行為變化的時點切分區段,精確記錄每一瞬間發生了什麼動作。 即使是移動一個杯子的場景,也會以同樣方式拆解: 手接近杯子的區段與實際抓取的瞬間不同,移動過程中的狀態與放下的時點也各自分開。 對人類而言是單一自然的動作,但在數據中卻被細分為多個階段。 這項處理之所以必要,是因為人類與機器人的身體結構並不相同。 人類的手能自由運用多個關節與手指,但機器人則因結構不同而運動範圍各異; 有些僅使用簡單的夾爪,有些則安裝了不同位置的攝影機。 無法直接複製人類手部動作作為機器人行動。 必須先從影像中辨識出行為區段與物體狀態,再將其重新對應至該機器人實際可執行的 action representation。 拍攝設備也有多種類型。 axis-ego-samples 中公開了來自 dual fisheye、six-camera RGB+SLAM、MEgo、Gen DAS Ego、FEAGINE EGO、GI Labs 等不同採集裝置的樣本。 即使拍攝相同任務,因攝影機配置不同,影像也會有所差異: 視角不同、手部在畫面中的位置不同,以及獲取位置資訊的方式也因設備而異。 要在真實環境中大規模收集數據,難以避免這些差異。 因此,不僅需假設單一設備與單一拍攝條件,還需將不同輸入整合為可被學習的形式。 在獨立的 sample-150h-10cat 資料夾中,公開了從 150 小時 delivery corpus 中依類別選取的 10 個 episode。 但目前僅上架這 10 個樣本,150 小時的完整 corpus 並未公開。 目前 axis-ego-samples 倉儲總檔案大小約為 770 GB。 您也可看到這些數據如何與 Axis 的其他產品相連接。 Mobile Egocentric App 正朝著在人類移動時即時追蹤手部姿勢,並將其轉換為機器人運動的方向開發。 在瀏覽器模擬中,人類可直接操控虛擬機器人以生成 state 與 action。 而在 egocentric 捕獲中,則先記錄人類在現實空間中的實際操作,再從中提取機器人學習所需的行為。 一種是直接操控機器人來產生數據,另一種則是將人類已有的行為轉化為數據。 這裡出現了一個有趣的觀點: 要讓機器人累積經驗,並不一定需要持續驅動機器人本身。 人類每天早已反覆處理大量物體:拿起杯子、打開門、整理箱子、使用工具——這些行為在現實生活中不斷重複。 若能足夠精確地記錄這些行為,並將其與機器人的動作建立關聯, 那麼人類日常生活中自然產生的行為本身,即可成為機器人學習數據的來源。 這個概念如何應用於實際機器人研究中,也可參考與 Axis 無關的 EgoScale 研究。EgoScale 於 2026 年 2 月公開,先以超過 20,854 小時的 action-labeled egocentric human video 對 VLA 進行預訓練,再額外學習 human-robot aligned 數據。 在 22-DoF 靈巧機械手評估中,最終策略的平均成功率比無預訓練基線高出 54%。 EgoScale 是與 Axis 無關的研究,並非僅僅加入大量人類影片就能讓機器人立即良好運作。 這是先以人類行為學習廣泛經驗,再補充與實際機器人體現和動作相符的數據後,性能得以提升的案例。 Axis 正將此數據與實際協作相結合。 在 8 月 28 日公布的與 Dexmal 的合作中,Axis 表示將負責為 Dexmal 的 VLA 和 world model 提供大規模的 egocentric、模擬與真實世界數據生產。 仍有一些部分尚未公開。 實際傳遞給 Dexmal 的數據規模,以及這些數據對模型性能產生的具體影響,尚未公布。 僅憑目前公開的資料,已足以確認 Axis 正在進行哪些工作。 100 小時的 LeRobot 數據已實際上線,frame-by-frame 標註已細分至 80,090 個 segment。 同時也公開了來自多種捕捉設備的樣本。 這是將人類在現實中自然執行的短暫行為拍攝下來,劃分行為邊界、整理物體與手部動作,再轉換為機器人可學習格式的過程。 對人類而言毫不費力的幾秒鐘,對機器人而言卻是一次完整的學習經驗。 Axis 目前公開的,正是將這一過程轉化為實際數據的成果。 #PhysicalAI #RobotLearning

No.0 picture
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露