Google DeepMind 剛推出了 Gemini Robotics ER 2,這是一次讓你重新思考機器人實際能力的更新。新模型不僅讓單個機器人更聰明,還讓完全不同的機器人群體像擁有同一個大腦一樣協同工作。
波士頓動力的 Spot 與 Apptronik 的 Apollo,這兩台外觀迥異、功能不同的機器人,現已能透過由 Google AI 提供的共享語義理解進行協調。
Gemini Robotics ER 2 究竟做什麼
這裡的核心創新是 DeepMind 所稱的「時間智能」。用英文說:機器人可以透過連續的影片串流觀察正在發生的事,理解自己在多步驟任務中的位置,並據此規劃下一步行動。
這些數字講述了一個有趣的故事:模型在進度分類上的準確率為 57.4%,在時刻定位上的準確率為 91.3%,平均誤差僅為 0.96 秒。進度分類(即理解任務進展程度的能力)仍有提升空間;但時刻定位(精準定位視頻流中特定事件發生的時刻)已達到亞秒級的驚人精準度。
與 Google 的 Gemini Live API 整合增添了另一層功能。它實現了 AI 模型與機器人之間的低延遲、雙向串流,意味著系統能夠即時調整,避開了早期機器人控制器所困擾的尷尬停頓。
安全性也得到了實質性的提升。改進的指令遵循基準和更佳的距離檢測功能,意味著這些機器人對人類同事造成傷害的可能性更低。
這些基礎元件可追溯至 2025 年
ER 2 並非憑空出現,它建立在 Google 從 2025 年 3 月開始奠定的基礎之上,當時推出了最初的 Gemini 機器人模型,隨後在同年 9 月進行了更新。每一次迭代都逐步擴展了機器人運用生成式 AI 的能力,從基本任務執行邁向能夠即時做出情境化決策的代理行為。
Google 也不是在真空中運作。支援波士頓動力和 Apptronik 等第三方硬體的決定,表明 Google 想成為機器人的作業系統層,而不僅僅是硬體供應商。
