具身知能業界の競争はデータのボトルネックに集中しており、窮徹知能は阿里雲と提携し、クラウド上の自動化データ処理ラインを構築しました。UMIソリューションを用いてロボット操作データを収集しますが、収集後には姿勢復元、魚眼キャリブレーション、動作分割、マルチモーダルアノテーションなどの複雑なプロセスを経る必要があります。阿里雲は分散計算能力を提供し、フルプロセスの自動化を実現。データスループットは10倍以上向上し、クラウド上の計算リソースは10万CU以上に弾力的に拡張可能となり、モデル訓練の効率は約50%向上しました。この協業により、ロボットデータが規模拡大・標準化された生産体制を構築可能であることが実証され、モデルの継続的イテレーションを支える持続的なデータ供給基盤となり、具身知能企業の新基盤能力として確立されました。記事執筆者、出典:ゲークパーカー
2025年がエムボディードAIが爆発する年であるならば、今年は業界の競争が新たな段階に入り始めている。
国内外のロボット企業が次々と新製品を発表し、資本が継続的に投入される中、エンボディード・インテリジェンスはAI分野で最も注目されている分野の一つとなっている。しかし、業界の急速な発展に伴い、新たなコンセンサスが形成されつつある。それは、ロボットの進化速度を制限する要因が、もはやモデルではなく、データであるということだ。
大規模言語モデルがインターネットの膨大なテキストを利用できるのとは異なり、ロボットは現実世界での操作能力を学習する必要があります。1回のグリップ、1つの搬送、1つの整理タスクはすべて現実で発生し、視覚、動作、軌跡などのマルチモーダル情報を同時に記録する必要があります。高品質なデータを継続的に取得し、それらのデータをモデルが学習できるデータセットに迅速に変換することは、ますます多くのエムボディードAI企業が直面する新たな課題となっています。
国内のエムボディードAI企業として、Qiongche Intelligenceは「データ—トレーニング—デプロイ」のフローに基づいてロボットインフラを構築してきました。最近、Qiongche Intelligenceは阿里雲と提携し、クラウドベースの自動化データ処理ラインを構築しました。これにより、ロボットデータ処理を人手に依存し、単一マシンで動作する従来のモデルから、スケーラブルな産業レベルのプロセスへと昇格させ、モデルの反復改善に継続的なデータ支援を提供することを目指しています。
01
ロボットの時代において、本当に希少なのはデータである
エージェント型AIにとって、データの課題は「収集できない」ことだけでなく、「処理できない」ことにもある。
穹徹インテリジェンスは、UMI(Universal Manipulation Interface)ソリューションを用いてデータ収集を行います。オペレーターが手持ちデバイスを用いてつかむ、ドアを開ける、運搬するなどの自然な動作を行うだけで、デバイスが第一視点の映像、グリッパーの姿勢、運動軌跡などの情報を同期して記録し、ロボットのトレーニングに高品質な操作データを提供します。
しかし、本当の課題は、収集後に発生することが多いです。
これらの原始データをモデル訓練に使用するには、姿勢復元、魚眼カメラキャリブレーション、動作分割、マルチモーダルアノテーションなど、複数の複雑なステップを経る必要があります。視覚的SLAMによる再構築には大量のGPU計算リソースを消費し、魚眼画像はフレームごとに歪み補正とキャリブレーションが必要です。連続した動作は、個々の原子タスクに分割し、対応する自然言語の説明を付与しなければなりません。データ収集規模が拡大するにつれ、数百時間に及ぶ動画データは全体の計算負荷を大幅に増大させています。
これらの作業は計算量が膨大であり、プロセス全体が複数の処理ステップを含むため、いずれかのステップで中断が発生すると、バッチ全体の再計算に影響を及ぼす可能性があります。エムボディードインテリジェンス企業にとって、データ処理は新たなインフラストラクチャ能力となっており、弾力的な計算リソースのサポート、自動スケジューリング、フルプロセスのトレーサビリティ、およびモデルトレーニングの協調を可能にする一貫したシステムが必要です。
02
雲の上を走るデータ生産ライン
ボットのトレーニングを高速化するには
これらの課題を解決するため、Qiongche Intelligenceは阿里雲と協力して、エンドツーエンドのUMI Data + AIパイプラインを構築し、従来の散在したデータ処理プロセスを自動化されたデータ生産ラインに変えることを目指しています。
データ処理段階で、阿里雲のMaxCompute MaxFrameは分散計算機能を提供し、動画の歪み補正、SLAMポーズ復元、マルチモーダルアノテーションなどのタスクをクラウドリソース上で並列実行します。かつては単一マシンに依存していた大規模計算が、今ではタスクの規模に応じて計算能力を柔軟に拡張でき、全体の処理効率が向上しました。また、大規模モデルの機能がデータ処理プロセスに直接組み込まれ、動作セグメントの自動セマンティックアノテーションを実現し、人手によるアノテーションコストを削減しています。
データ処理の全体のフローはDataWorksによって一括してオーケストレーションされます。周期的なスケジューリング、過去データの再実行、異常時の自動回復など、すべてが統一プラットフォーム上で実行され、手動の介入を削減し、データ生産ライン全体を安定して継続的に運用します。
処理が完了したデータはHologresに統合され、後続のサンプル検索、データ監査、トレーニング管理にリアルタイムのデータサービスを提供します。その後、PAIプラットフォームに移行してモデルのトレーニング、パフォーマンス最適化、デプロイ検証が実施され、データ生産からモデルトレーニング、そして効果フィードバックまでの完全なクローズドループが構築されます。
この提携により、実際の効果ももたらされました。穹徹智能のデータ処理はフルプロセスの自動化を実現し、全体のスループットが10倍以上向上しました。マルチモーダルアノテーションは規模拡大して自動で完了可能になり、クラウド上の計算リソースは10万CU以上まで柔軟に拡張でき、モデルのトレーニング効率は約50%向上しました。
エージェントインテリジェンス業界にとって、この協力は一つの事実を検証した:ロボットデータも規模化・自動化されたデータ生産システムを構築できるということだ。データ収集、処理、トレーニングが段階的に標準化プロセスとして確立されれば、ロボットモデルのイテレーション速度もさらに向上する。業界競争がモデル能力からデータインフラストラクチャへと拡大する中、データ生産能力に関する探求は、次段階のエージェントインテリジェンス発展における重要な競争力となるだろう。
