在我瀏覽 @continuumlabs_ 的 GitHub 時,有一點讓我特別注意到:收集機器人資料並不是最終目標。 這實際上是另一個問題的起點:你該如何處理這些原始資料? 想像一下,你錄製了數千次機器人示範。 有些動作可能過於嘈雜,有些軌跡可能存在不一致,有些資料根本對訓練毫無用處。你不能把所有東西一股腦丟進模型裡,然後指望運氣好。 這時,Continuum Data Cleaning 就派上用場了。 它是 Axis 生態中專注於在資料進入下游流程前,處理與評估機器人軌跡的工具包。 坦白說,這部分很少被討論。我們聽太多關於「收集更多資料」的事,但更多資料並不等於更好的資料。 把機器人軌跡想成是完成一項任務時所有發生事件的錄音。 如果錄音中包含不必要的雜訊或不規則之處,模型可能會學到這些缺陷,而非你真正感興趣的行為。 因此,資料需要被檢查與處理。Continuum Data Cleaning 包含如軌跡平滑與重取樣等工具,以及能協助評估軌跡品質的指標。 例如,平滑可以減少運動資料中的不必要雜訊;重取樣能讓軌跡的資料點在時間上的分佈更一致。 而評估指標則能幫助你判斷軌跡是否合理,而非假設每一段錄製的示範都有用。此外還有任務層級的驗證。 這很重要,因為一段軌跡可能在技術上看起來沒問題,卻仍未能完成實際任務。 機器人移動順暢,不代表它成功完成了應做的任務。因此,你必須同時問兩個問題: 「這段軌跡乾淨嗎?」 和 「機器人真的完成任務了嗎?」 當你為物理 AI 建立資料集時,這個區別至關重要。 Axis 的有趣之處在於,你可以開始看到不同倉庫如何相互配合。Continuum Task Gen 幫助建立任務。 人類可透過遠端操作示範這些任務,這些互動會產生軌跡。 接著,像 Continuum Data Cleaning 這樣的工具就能協助處理與評估這些軌跡資料。只有完成這些步驟後,你才真正接近訓練就緒的資料。這是一種更完整的機器人視角。 它不只是: → 收集盡可能多的資料。 而是: → 收集 → 檢查 → 清理 → 驗證 → 改善 → 訓練。 因為如果機器人要從人類示範中學習,這些示範的品質至關重要。 這也是為什麼我認為,管道中那些不那麼炫目的部分——資料清理、驗證與評估——最終可能與每個人都在談論的炫目 AI 模型一樣重要。 明天,我將更深入探討你使用 @continuumlabs_ 清理與處理機器人軌跡時實際發生了什麼。


