窮車智能與阿里雲共建機器人訓練自動化數據管道

iconMetaEra
分享
AI summary icon精華摘要
窮車智能與阿里雲合作推出基於雲端的機器人訓練數據管道,利用 UMI 收集與處理機器人操作數據。該系統採用姿態恢復、魚眼校準與動作分割技術,將數據吞吐量提升超過 10 倍。阿里雲的分散式運算支援高達 100,000+ CU,使模型訓練效率提升 50%。隨著通脹數據影響全球市場,此類創新可能對加密貨幣新聞與 AI 驅動領域產生影響。
具身智能行業競爭聚焦數據瓶頸,穹徹智能聯手阿里雲打造雲端自動化數據處理產線。採用 UMI 方案採集機器人操作數據,但採集後需經歷位姿恢復、魚眼標定、動作切分、多模態標註等複雜環節。阿里雲提供分散式計算能力,實現全流程自動化處理,數據吞吐提升超過 10 倍,雲端算力彈性擴展至 10 萬+ CU,模型訓練效率提升約 50%。該合作驗證了機器人數據可建立規模化、標準化生產體系,為模型迭代提供持續數據支援,成為具身智能企業的新基建能力。

文章作者、來源:極客公園

如果說 2025 年是具身智能爆發的一年,那麼今年,行業競爭已經開始進入新的階段。

從海內外越來越多機器人公司發布新產品,到資本持續加碼,具身智能正成為 AI 領域最受關注的方向之一。但隨著行業快速發展,一個新的共識正在形成:真正限制機器人進化速度的,不再只是模型,而是數據。

與大語言模型可利用互聯網海量文本不同,機器人需要學習的是現實世界中的操作能力。一次抓取、一段搬運、一場整理任務,都需真實發生,並同步記錄視覺、動作、軌跡等多模態資訊。如何持續獲得高質量數據,並將這些數據快速轉化為模型能夠學習的數據集,成為越來越多具身智能企業面臨的新挑戰。

作為國內具身智能企業,穹徹智能一直圍繞「數據—訓練—部署」構建機器人基礎設施。近期,穹徹智能聯合阿里雲打造了一套雲端自動化數據處理產線,希望將機器人數據處理從依賴人工、單機運行的模式,升級為能夠規模化運轉的工業化流程,為模型迭代提供持續的數據支撐。

01

在機器人時代,真正稀缺的是數據

對於具身智能而言,數據難題不僅在於「採不到」,更在於「處理不了」。

Qiongche Intelligence uses the UMI (Universal Manipulation Interface) solution for data collection. Operators simply perform natural actions such as grasping, opening doors, and moving objects while holding the device, and the system synchronously records first-person perspective footage, gripper pose, and motion trajectories to provide high-quality operational data for robot training.

但真正的挑戰,往往發生在採集之後。

這些原始數據要進入模型訓練,還需經歷姿態恢復、魚眼相機標定、動作切分、多模態標註等多個複雜環節。其中,視覺 SLAM 重建需要消耗大量 GPU 算力;魚眼圖像需要逐幀去畸變和標定;連續動作需要切分為一個個原子任務,並配上對應的自然語言描述;隨著採集規模擴大,數百小時的影片數據也為整體計算帶來巨大壓力。

這些工作不僅計算量龐大,而且整個流程涉及多個處理環節,一旦某一步中斷,就可能影響整批數據重新計算。對於具身智能企業來說,數據處理正成為一項新的基礎設施能力,需要能夠支撐彈性算力、自動調度、全流程追蹤以及模型訓練協同的完整體系。

02

一條運行於雲端的數據生產線

如何加快機器人訓練速度

為了解決這些問題,穹徹智能聯手阿里雲搭建了一套端到端的 UMI Data + AI Pipeline,希望將原本零散的數據處理流程,轉變為一條自動化運行的數據生產線。

在數據處理階段,阿里雲 MaxCompute MaxFrame 提供分散式計算能力,將影片去畸變、SLAM 位姿恢復、多模態標註等任務拆分至雲端資源並行執行。過去需依賴單機完成的大規模計算,如今可根據任務規模靈活擴展算力,提升整體處理效率。同時,大模型能力也直接嵌入數據處理流程,實現動作片段的自動語義標註,降低人工標註成本。

整個數據處理流程則由 DataWorks 統一編排。無論是週期調度、歷史數據重跑,還是異常自動恢復,都能夠在統一平台完成,減少人工干預,讓整條數據產線持續穩定運行。

處理完成的數據將進入 Hologres 進行統一管理,為後續的樣本檢索、數據審核和訓練管理提供實時數據服務;隨後再進入 PAI 平台完成模型訓練、性能優化和部署驗證,形成從數據生產到模型訓練,再到效果反饋的完整閉環。

這項合作也帶來了實際成效。穹徹智能的數據處理實現了全流程自動化,整體吞吐量提升超過 10 倍,多模態標註實現規模化自動完成,雲端算力可彈性擴展至 10 萬+ CU,模型訓練效率提升約 50%。

對於具身智能行業而言,這次合作驗證了一件事:機器人數據同樣可以建立起規模化、自動化的數據生產體系。當數據採集、處理、訓練逐步形成標準化流程,機器人模型也將獲得更快的迭代速度。隨著行業競爭逐漸從模型能力延伸到數據基礎設施,圍繞數據生產能力的探索,也將成為下一階段具身智能發展的重要競爭力。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露