ChainThinkのメッセージによると、4月14日、1M AI Newsの監視によると、Google DeepMindがGemini Robotics-ER 1.6をリリースし、これはロボットの高レベル推論モデルとして位置づけられています。このモデルは、前世代のER 1.5およびGemini 3.0 Flashと比較して、空間推論とマルチビュー理解において顕著な向上を実現しており、現在はGemini APIおよびGoogle AI Studioを通じて開発者に公開されています。
主要升级包含三项能力:一是指向精度提升,可实现精确的物体检测、计数、空间关系推理及运动轨迹规划,并能正确拒绝指向画面中不存在的物体;二是多视角成功检测,可综合多个摄像头的画面判断任务完成情况,即使在遮挡或动态环境下仍能保持准确;三是新增仪表读取能力,可解读圆形压力表、垂直液位指示器、数字显示屏等工业仪表,通过agentic vision实现逐步推理。
この計器読み取り機能は、DeepMindとBoston Dynamicsの共同開発によるものです。Boston Dynamicsは同日、GeminiおよびGemini Robotics-ER 1.6をOrbit AIVI-Learning製品に統合し、4月8日にすべてのAIVI-Learning顧客向けにリリースしたことを発表しました。統合により、新しくダッシュボード対応が追加され、四足ロボットSpotが工業施設内で自律的に巡回し、圧力計などの計器データを読み取ることが可能になりました。
ボストン・ダイナミクスは、Geminiの推論能力を活用することで、AIVI-Learningが従来の視覚巡回、パレット数え、液体漏れ検出などのタスクにおける基準性能と精度を向上させたと述べています。DeepMindは、ER 1.6を「最も安全なロボットモデル」と位置づけ、対抗的空間推論タスクにおける安全指令の順守率がER 1.5を上回っていると述べています。また、実際の負傷報告に基づく安全リスク識別テストでは、ERシリーズモデルはGemini 3.0 Flashよりもテキストシナリオで6%、動画シナリオで10%優れています。
