ChainThink, 14 avril : selon 1M AI News, Google DeepMind a lancé Gemini Robotics-ER 1.6, un modèle de raisonnement de haut niveau pour robots. Ce modèle présente une amélioration significative en matière de raisonnement spatial et de compréhension multivue par rapport à ses prédécesseurs ER 1.5 et Gemini 3.0 Flash, et est désormais disponible pour les développeurs via l'API Gemini et Google AI Studio.
Les améliorations principales incluent trois capacités : premièrement, une précision accrue en pointage, permettant une détection précise d'objets, un comptage, un raisonnement sur les relations spatiales et une planification de trajectoires de mouvement, tout en rejetant correctement les pointages d'objets non présents dans l'image ; deuxièmement, une détection réussie à partir de plusieurs angles, permettant d'évaluer l'achèvement de la tâche en combinant les images provenant de plusieurs caméras, tout en conservant une précision même en cas d'occlusion ou dans des environnements dynamiques ; troisièmement, une nouvelle capacité de lecture de instruments, permettant d'interpréter des manomètres circulaires, des indicateurs de niveau vertical, des écrans numériques et autres instruments industriels, grâce à un raisonnement progressif par vision agente.
La capacité de lecture de ce tableau de bord provient du partenariat entre DeepMind et Boston Dynamics. Ce même jour, Boston Dynamics a annoncé avoir intégré Gemini et Gemini Robotics-ER 1.6 dans le produit Orbit AIVI-Learning, disponible pour tous les clients AIVI-Learning le 8 avril. Après intégration, le nouveau tableau de bord permet au robot quadrupède Spot d'effectuer des inspections autonomes dans les installations industrielles et de lire les données des instruments tels que les manomètres.
Boston Dynamics affirme que, grâce à la capacité de raisonnement de Gemini, AIVI-Learning a amélioré ses performances de base et sa précision sur des tâches telles que l'inspection visuelle, le décompte des palettes et la détection de liquides accumulés. DeepMind déclare que ER 1.6 est son « modèle robotique le plus sûr », avec une meilleure conformité aux instructions de sécurité que ER 1.5 dans les tâches de raisonnement spatial adversarial ; lors de tests de détection des risques sécuritaires basés sur des rapports de blessures réels, les modèles de la série ER surpassent Gemini 3.0 Flash de 6 % dans les scénarios textuels et de 10 % dans les scénarios vidéo.
