Google DeepMindは、今年最も野心的なロボティクスの発表を発表しました。7月30日に公開されたGemini Robotics 2は、ヒューマノイドから産業用アームまで、ほぼあらゆるロボットのボディに搭載できる単一のAIブレインとして設計されており、新しいハードウェアへの対応が数ヶ月から数時間に短縮されます。
Gemini Robotics 2が実際に何をするか
このシステムは、それぞれ異なるレベルのロボット知能を担う3つの独自のモデルで構成されています。ビジョン・ランゲージ・アクション(VLA)モデルは、全身の制御と繊細な運動能力を管理します。エンボディッド・リーズニング(ER)モデルは高レベルの脳として機能し、数分に及ぶ複数ステップのタスクシーケンスを調整します。また、デバイス内バージョンはローカルで動作するため、ロボットがコップを拾うたびにクラウドサーバーに接続する必要はありません。
システムはハードウェアに依存しません。1つのモデルチェックポイントで、まったく異なるロボットプラットフォームを動作させることができます。Googleは、ApptronikのヒューマノイドApollo 2とFrankaのロボットアームシステムで、まったく異なる物理的形態に同じインテリジェンス層を実行することでこれを実証しました。
Gemini Robotics 2は、200未満のトレーニング例で新しいロボット実装の操作を学習できます。これは数時間のデータ収集で達成可能です。従来のロボティクスAIシステムは、単一のプラットフォームで基本的な能力を発揮するのに通常、数千から数万のデモが必要です。
このシステムで動作するロボットは、二足歩行、物体操作、複数ロボットの協調作業などの高度なタスクを処理できます。複数のマシンは、人間による細かい管理なしに行動を調整します。
これがロボティクス実験室を超えてなぜ重要なのか
Googleは、Google AI Studioおよびパートナープログラムを通じて、ERモデルとVLAモデルの両方を提供しています。DeepMindはまた、「エージェント行動」と呼ぶものに特化したベンチマークを確立し、これらのAIシステムが自律的な意思決定を行う際の安全性を測定しています。
これは投資家にとって何を意味するか
Google DeepMindのハードウェア非依存アプローチは、競争環境を大きく再構築する可能性がある。Gemini Robotics 2がその約束を実現すれば、ロボットハードウェアが商品化され、価値は知能層に集中する恐れがある。すでにDeepMindと提携しているApptronikのような企業は、市場参入が容易になる恩恵を受けるが、一方でGoogleのAIスタックへの依存度も高まる。
テスラのOptimusプログラム、Figure AI、そして増加するロボティクススタートアップたちは、すべて類似した目標に向かって競争しています。グーグルの利点はスケールです。グーグルは計算インフラ、基礎的なAIモデル、およびGoogle AI Studioとパートナープログラムを通じた配信プラットフォームを有しています。
