ChainThink संदेश, 14 अप्रैल, 1M AI News के अनुसार, गूगल डीपमाइंड ने Gemini Robotics-ER 1.6 जारी किया, जिसे रोबोटिक्स के लिए उच्च स्तरीय तर्क मॉडल के रूप में स्थित किया गया है। यह मॉडल पिछले ER 1.5 और Gemini 3.0 Flash की तुलना में स्थानिक तर्क और बहु-दृष्टिकोण बुद्धि में महत्वपूर्ण सुधार करता है, और इसे अब Gemini API और Google AI Studio के माध्यम से विकासकर्ताओं के लिए उपलब्ध कराया गया है।
मुख्य अपग्रेड में तीन क्षमताएँ शामिल हैं: पहली, निर्देशित सटीकता में सुधार, जो सटीक वस्तु संसाधन, गिनती, स्थानिक संबंध तर्क और गति पथ योजना को सक्षम करती है, और जो चित्र में मौजूद नहीं होने वाली वस्तुओं को सही ढंग से अस्वीकार करती है; दूसरी, बहु-दृष्टिकोण सफलतापूर्वक पता लगाना, जो कई कैमरा दृश्यों को समेकित करके कार्य पूरा होने की स्थिति का निर्णय करता है, और अवरोधन या गतिशील परिस्थितियों में भी सटीकता बनाए रखता है; तीसरी, नया बोर्ड पठन क्षमता, जो गोलाकार दबाव मापक, ऊर्ध्वाधर स्तर सूचक, डिजिटल डिस्प्ले आदि औद्योगिक बोर्ड को पढ़ने में सक्षम है, और agentic vision के माध्यम से कदम-दर-कदम तर्क करता है।
यह डैशबोर्ड पढ़ने की क्षमता DeepMind और Boston Dynamics के सहयोग से प्राप्त हुई है। Boston Dynamics ने उसी दिन घोषणा की कि उन्होंने Gemini और Gemini Robotics-ER 1.6 को Orbit AIVI-Learning उत्पाद में एकीकृत कर दिया है, जो 8 अप्रैल को सभी AIVI-Learning ग्राहकों के लिए लाइव हो गया है। एकीकरण के बाद, चार पैरों वाला रोबोट Spot औद्योगिक सुविधाओं में स्वतंत्र रूप से घूम सकता है और दबाव मीटर जैसे उपकरणों के डेटा को पढ़ सकता है।
बोस्टन डायनामिक्स के अनुसार, जेमिनी की तर्क क्षमता के साथ, AIVI-लर्निंग ने विजुअल इंस्पेक्शन, पैलेट काउंटिंग, लिकेज डिटेक्शन जैसे कार्यों पर अपनी बेसलाइन प्रदर्शन और सटीकता में सुधार किया है। डीपमाइंड ने कहा कि ER 1.6 उनका "सबसे सुरक्षित रोबोट मॉडल" है, जो प्रतिरोधी स्पेस रीजनिंग कार्यों में ER 1.5 की तुलना में सुरक्षित निर्देश पालन में बेहतर है; वास्तविक चोट की रिपोर्ट्स पर आधारित सुरक्षा जोखिम पहचान परीक्षण में, ER सीरीज़ मॉडल टेक्स्ट सीन में Gemini 3.0 Flash से 6% अधिक और वीडियो सीन में 10% अधिक हैं।
