source avatarAlong cân 3

分享

我曾經以為更多人工修正自動代表更好的機器人訓練。結果發現,這種直覺是錯的。 在閱讀了 Axis 的這項實驗後,最令我印象深刻的是他們如何篩選資料,而非收集的資料量之大。 考慮一個非常簡單的任務:將一塊豆腐放到盤子上。 當機器人即將失敗時,使用者可透過 Axis Hub 直接手動介入進行修正,總共記錄了 660 次干預。 然而,@axisrobotics 並未將所有干預用於訓練。 僅有 161 段,佔總量的 24.4%,通過了篩選。 這樣的推理完全合理。 僅僅因為一個軌跡最終成功,並不意味著其中每個人類動作都值得學習。其中可能包含冗餘動作、迂迴路徑或無任何有用訊號的停頓。 因此,每次修正都必須通過三個關卡: → 在模擬中成功重播 → 證明原始策略確實失敗 → 提取關鍵片段並進行閉環檢查,確認機器人能否自行恢復 這部分是我最喜歡的: 人類回饋的價值,不在於「人類成功完成了任務」這個事實本身。 而在於精準定位哪個動作將失敗狀態轉變為機器人能自行複製的恢復過程。 660 次修正聽起來是個龐大的數字。 但 161 個經過驗證的訊號,價值遠高得多。 或許,這正是社群提供的資料如何真正轉化為可擴展資料引擎的方式。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露