source avatarGrid (❖,❖) 🟩 🐬TermMax 🚢

共有

[Axisが公開した100時間のEgocentricデータ:人間の作業をロボット学習データとして整理する方法] @KaitoAI X @axisrobotics Axis参加リンク(リファラル):https://t.co/hUbWSVsBVR 人間はコップを掴むとき、指の角度や手首の軌道を計算しない。 目の前のコップを自然に掴み、別の場所に置くだけだ。 同じことをロボットに教えるには話が異なる。 手が物体に近づく瞬間、実際に接触する瞬間、持ち上げて移動した経路、再び置く瞬間まで、行動を段階に分ける必要がある。 人間にとっては一連の流れだが、ロボットが学習するには、その中で何が起きたかをデータとして分解しなければならない。 Axisが9月初めに更新したaxis-ego-samplesは、このような人間の行動をロボット学習データに変換するプロセスを実際のファイルで示している。 現在公開されているエゴセントリック動画は100時間分だ。 作業者の視点で撮影された第一人称映像で、教育、宿泊、小売、倉庫、工芸、ケータリング、事務、生産、物流などの実際の作業環境がシーンカテゴリとして分類されている。 データはLeRobotフォーマットで整理されており、1次密度行動アノテーションも同梱されている。 映像に登場する行動は特別なものではない。 物を取り出して別の場所に置く、道具を使う、作業台を片付けるなど、日常や職場でよく見かける光景だ。 こうした平凡な行動もロボット学習データとするには、はるかに細かく分解する必要がある。 アノテーションレビューには101個のクリップが含まれており、フレーム単位の言語アノテーションは80,090個のセグメントに分割されている。 動画全体に一つの作業名を付けるのではなく、行動が変わる瞬間ごとに区切りを設け、どの瞬間にどのような動作が起きたかを記録している。 コップ一つを移動させるシーンも同様に分割される。 手がコップに近づく区間と実際に掴む瞬間は別であり、移動中の状態と置く瞬間もそれぞれ区別される。 人間の目には一つの自然な行動だが、データ内では複数のステップに分かれている。 このプロセスが必要な理由は、人間とロボットの身体構造が異なるからだ。 人間の手は多数の関節と指を自由に使えるが、ロボットは構造ごとに動ける範囲が異なる。 単純なグリッパーを使う場合もあれば、カメラが取り付けられた位置もそれぞれ異なる。 人間の手の動きをそのままロボットアクションとしてコピーする方法では解決できない。 まず映像から行動区間と物体の状態を特定し、その後、そのロボットが実際に実行可能なアクション表現に再変換する作業が必要だ。 撮影装置も複数種類使用されている。 axis-ego-samplesには、dual fisheye、six-camera RGB+SLAM、MEgo、Gen DAS Ego、FEAGINE EGO、GI Labsなど、異なるキャプチャデバイスから得られたサンプルが公開されている。 同じ作業を撮影しても、カメラ構成によって映像は異なる可能性がある。 視野角が異なり、手が画面上に映る位置も異なり、位置情報を取得する方法も機器ごとに異なる。 実環境で大規模なデータを収集するには、こうした差異を避けることは難しい。 一つのデバイスや一つの撮影条件だけを想定するのではなく、異なる入力を学習に活用できる形で整理するプロセスも必要だ。 別途sample-150h-10catフォルダーには、150時間分の配達コーパスからカテゴリ別に抽出した10エピソードが公開されている。 ただしパブリックリポジトリにアップロードされているのはこの10サンプルだけであり、150時間分のコーパス全体が公開されたわけではない。 現在のaxis-ego-samplesリポジトリ全体のファイルサイズは約770GBである。 このデータがAxisの他の製品とどのようにつながっているかも確認できる。 Mobile Egocentric Appは、人が動いている間にハンドポーズをリアルタイムで追跡し、その動きをロボットモーションに変換することを目指して開発されている。 ブラウザシミュレーションでは、人が仮想ロボットを直接操作しながら状態とアクションを作成する。 エゴセントリックキャプチャでは、現実空間で人が行う作業をまず記録し、その中からロボット学習に必要な行動を見出す。 一つはロボットを直接動かしてデータを作る方法であり、もう一つは人がすでに実行している行動をデータ化する方法である。 ここで一つ興味深い点が生まれる。 ロボットに経験を積ませるためには、必ずしもロボットを継続的に動かす必要はない。 人間はすでに毎日多くの物体を取り扱っている。 コップを持ち上げる、ドアを開ける、箱を整える、道具を使うといった行動は現実の至るところで繰り返されている。 こうした行動を十分に正確に記録し、ロボットの動きと結びつけることができれば、人が日常生活の中で生み出す平凡な行動そのものが、ロボット学習データの源泉となる可能性がある。 このアイデアが実際のロボット研究でどのように活用されているかについては、Axisとは別の研究であるEgoScaleでも参考になる。2026年2月に公開されたEgoScaleは、20,854時間以上のアクションラベル付きエゴセントリック人間動画を用いてVLAを事前学習した後、人間-ロボットアラインメントデータを追加で学習しました。 22-DoFの機敏なロボットハンド評価において、最終ポリシーの平均成功率は、事前学習なしのベースラインより54%高くなりました。 EgoScaleはAxisとは無関係な研究であり、単に人間の映像を多く取り込むだけでロボットがすぐにうまく動くという意味ではありません。 これは、人間の行動から広範な経験をまず学習した後、実際のロボットのエンボディメントとアクションに合わせたデータを追加することで性能が向上した事例です。 Axisはこのデータを実際の協働にも活用しています。 8月28日に発表されたDexmalとの共同研究において、AxisはDexmalのVLAおよびワールドモデルに使用する大規模なエゴセントリック、シミュレーション、リアルワールドデータの生成を担当すると発表しました。 まだ公開されていない部分もあります。 Dexmalに実際に渡されたデータの規模や、そのデータがモデル性能にどのような変化をもたらしたかについては、発表されていません。 現在公開されている資料だけでも、Axisがどのような作業を進めているかは十分に確認できます。 100時間分のLeRobotデータが実際に公開されており、フレームごとのアノテーションは80,090個のセグメントまで分割されています。 複数のキャプチャデバイスから収集したサンプルも併せて公開されています。 これは、人間が現実で自然に行う短い行動を撮影し、その中で行動の境界を分割し、物体と手の動きを整理した後、ロボットが学習できる形式に変換するプロセスです。 人間にとっては無意識に過ぎる数秒が、ロボットにとっては一つの学習経験になります。 Axisが現在公開しているのは、そのプロセスを実際のデータとして具現化した結果です。 #PhysicalAI #RobotLearning

No.0 picture
免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。