Google DeepMindが剛剛、Gemini Robotics ER 2をリリースしました。このアップデートは、ロボットが実際にどのような可能性を有しているかを再考させるものです。新しいモデルは、個々のロボットをより賢くするだけでなく、まったく異なるロボット同士がまるで同じ脳を持っているかのように協力して動作できるようにします。
ボストン・ダイナミクスのSpotとApptronikのApolloは、外見も機能も全く異なるが、GoogleのAIによって実現された共有セマンティック理解を通じて連携できるようになった。
Gemini Robotics ER 2が実際に行うこと
ここでの核心的な革新は、DeepMindが「時間的知性」と呼ぶものである。英語では、ロボットは継続的な動画フィードを通じて周囲の状況を観察し、複数ステップからなるタスクにおける自身の位置を理解して、それに基づいて次の行動を計画できる。
数字は興味深い物語を語っています。モデルは進捗分類の精度が57.4%、瞬間検出の精度が91.3%で、平均誤差はわずか0.96秒です。タスクの進捗度を理解する進捗分類にはまだ改善の余地がありますが、動画ストリーム内で特定のイベントが発生した正確な瞬間を特定する瞬間検出は、サブ秒単位で非常に正確です。
GoogleのGemini Live APIとの統合により、さらに一層の機能が追加されました。これにより、AIモデルとロボットの間で低遅延の双方向ストリーミングが可能になり、システムは以前のロボットコントローラーを悩ませていた不自然な待ち時間なく、リアルタイムで調整できます。
セーフティも大幅に向上しました。改善された指示従順性ベンチマークとより優れた近接検出により、これらのロボットは人間の同僚に危害を及ぼす可能性が低くなりました。
構成要素は2025年にさかのぼります
ER 2は突然現れたわけではありません。これは、2025年3月にGoogleが初期のGeminiロボティクスモデルで築き始めた基盤の上に構築されており、同年9月に更新が行われました。各バージョンは、ジェネレーティブAIを用いたロボットの機能を段階的に拡張し、基本的なタスク実行から、機械が状況に応じて即座に意思決定を行うような能動的行動へと進化してきました。
グーグルもまた、単独で行動しているわけではない。ボストン・ダイナミクスやアプリトロニックのロボットのようなサードパーティ製ハードウェアをサポートするという決定は、グーグルがハードウェアベンダーであるだけでなく、ロボティクスのオペレーティングシステム層になりたいという意図を示している。
