ChainThink mensagem, 14 de abril: segundo monitoramento da 1M AI News, o Google DeepMind lançou o Gemini Robotics-ER 1.6, posicionado como um modelo de raciocínio de alto nível para robôs. Em comparação com as versões anteriores ER 1.5 e Gemini 3.0 Flash, o modelo apresenta melhorias significativas em raciocínio espacial e compreensão de múltiplas perspectivas, e já está disponível para desenvolvedores por meio da Gemini API e do Google AI Studio.
A atualização principal inclui três capacidades: primeiro, melhoria na precisão de apontamento, permitindo detecção precisa de objetos, contagem, raciocínio sobre relações espaciais e planejamento de trajetórias de movimento, além de rejeitar corretamente apontamentos para objetos que não existem na cena; segundo, detecção bem-sucedida em múltiplas perspectivas, capaz de avaliar o status da tarefa combinando imagens de várias câmeras, mantendo precisão mesmo em ambientes obstruídos ou dinâmicos; terceiro, nova capacidade de leitura de instrumentos, capaz de interpretar manômetros circulares, indicadores de nível vertical, telas digitais e outros instrumentos industriais, por meio de raciocínio progressivo realizado pelo agentic vision.
A capacidade de leitura deste painel decorre da parceria entre o DeepMind e a Boston Dynamics. No mesmo dia, a Boston Dynamics anunciou que integrou o Gemini e o Gemini Robotics-ER 1.6 ao produto Orbit AIVI-Learning, lançado para todos os clientes do AIVI-Learning em 8 de abril. Com a integração, foi adicionado suporte a painéis, permitindo que o robô quadrúpede Spot realize inspeções autônomas em instalações industriais e leia dados de instrumentos, como manômetros.
A Boston Dynamics afirma que, com a capacidade de raciocínio do Gemini, o AIVI-Learning melhorou o desempenho e a precisão básicos em tarefas já existentes, como inspeção visual, contagem de paletes e detecção de acúmulo de líquidos. O DeepMind afirma que o ER 1.6 é seu "modelo de robô mais seguro", apresentando melhor adesão a instruções de segurança em tarefas de raciocínio espacial adversarial em comparação com o ER 1.5; em testes de identificação de riscos de segurança com base em relatos reais de acidentes, os modelos da série ER superaram o Gemini 3.0 Flash em 6% em cenários textuais e 10% em cenários de vídeo.
