Google DeepMind 剛剛推出了今年最雄心勃勃的機器人公告。於 7 月 30 日揭幕的 Gemini Robotics 2 設計為一個單一的 AI 大腦,可運行於幾乎任何機器人身體上,從類人機器人到工業手臂,並能在數小時內適應新硬體,而非數月。
Gemini Robotics 2 究竟做什麼
該系統基於三個不同的模型構建,每個模型負責機器人智能的不同層面。視覺-語言-行動(VLA)模型管理全身控制和精細運動技能。具身推理(ER)模型作為高層大腦,協調可持續數分鐘的多步任務序列。而一種於裝置上的變體則在本地運行,意味著機器人在每次拿起杯子時都不必連接到雲端伺服器。
該系統與硬體無關。單一模型檢查點可運行於完全不同的機器人平台。Google 已在 Apptronik 的 Apollo 2 人形機器人和 Franka 的機械臂系統上展示了此功能,於截然不同的物理形態上運行相同的智慧層。
Gemini Robotics 2 可在少於 200 個訓練樣本的情況下學習操作新的機器人實體,僅需數小時的資料收集即可實現。作為參考,傳統的機器人 AI 系統通常需要數千甚至數萬次示範,才能在單一平台上達到基本的熟練程度。
運行於此系統上的機器人可處理進階任務,包括雙足行走、物體操作和多機器人協作,多台機器可協調其動作,無需人工細緻管理。
為何這不僅限於機器人實驗室
Google 正通過 Google AI Studio 和合作夥伴計劃提供 ER 模型和 VLA 模型。DeepMind 也為其所謂的「代理行為」建立了專門的基準,用以衡量這些 AI 系統在做出自主決策時的安全運作情況。
這對投資者意味著什麼
Google DeepMind 的硬體無關方法可能顯著重塑競爭格局。如果 Gemini Robotics 2 能實現其承諾,它將使機器人硬體商品化,同時將價值集中在智慧層面。已與 DeepMind 合作的公司,如 Apptronik,可能受益於更易進入市場,但同時也將更依賴 Google 的 AI 技術堆疊。
特斯拉的 Optimus 計畫、Figure AI 以及越來越多的機器人初創公司,都在爭相實現類似的目標。谷歌的優勢在於規模:它擁有計算基礎設施、基礎 AI 模型,以及通過 Google AI Studio 和合作夥伴計劃提供的分發平台。
