رسالة من ChainThink، في 14 أبريل، وفقًا لمراقبة 1M AI News، أطلقت Google DeepMind Gemini Robotics-ER 1.6، المُعرَّف كنموذج استدلال عالي المستوى للروبوتات. يُظهر هذا النموذج تحسنًا ملحوظًا في الاستدلال المكاني وفهم الزوايا المتعددة مقارنةً بالإصدار السابق ER 1.5 وGemini 3.0 Flash، وهو متاح حاليًا للمطورين عبر Gemini API وGoogle AI Studio.
تشمل الترقيات الأساسية ثلاث قدرات: أولاً، تحسين دقة الإشارة، مما يمكّن من الكشف الدقيق عن الأجسام، وحسابها، واستنتاج العلاقات المكانية، وتحديد مسارات الحركة، بالإضافة إلى رفض الإشارات المتعلقة بأجسام غير موجودة في المشهد؛ ثانياً، الكشف الناجح من زوايا متعددة، حيث يمكنه تقييم حالة إنجاز المهمة من خلال دمج لقطات من كاميرات متعددة، مع الحفاظ على الدقة حتى في ظل التغطية أو البيئات الديناميكية؛ ثالثاً، إضافة قدرة قراءة العدادات، حيث يمكنه تفسير عدادات الضغط الدائرية، ومؤشرات مستوى السوائل الرأسية، وشاشات العرض الرقمية، وغيرها من العدادات الصناعية، من خلال الرؤية الوكيلة لتحقيق استدلال تدريجي.
يُعزى قدرة هذا العداد على القراءة إلى شراكة DeepMind مع Boston Dynamics. وفي نفس اليوم، أعلنت Boston Dynamics أنها دمجت Gemini وGemini Robotics-ER 1.6 في منتج Orbit AIVI-Learning، والذي تم إطلاقه لجميع عملاء AIVI-Learning في 8 أبريل. بعد الدمج، تدعم لوحة القيادة الجديدة الروبوت رباعي الأرجل Spot في إجراء فحوصات ذاتية في المرافق الصناعية وقراءة بيانات العدادات مثل عدادات الضغط.
تقول بوسطن ديناميكز إن AIVI-Learning قد تحسّنت أداؤه ودقته الأساسية في المهام القائمة مثل الفحص البصري، وحساب عدد المنصات، وكشف تجمع السوائل بفضل قدرات الاستدلال الخاصة بـ Gemini. وتقول DeepMind إن ER 1.6 هو "أفضل نموذج روبوت أمانًا" لديها، حيث يتفوق في الامتثال للتعليمات الأمنية في مهام الاستدلال المضاد مقارنة بـ ER 1.5؛ وفي اختبارات تحديد المخاطر الأمنية بناءً على تقارير إصابات حقيقية، فإن نماذج ER تتفوق على Gemini 3.0 Flash بنسبة 6% في السيناريوهات النصية و10% في السيناريوهات الفيديو.
