Google DeepMind acaba de lanzar Gemini Robotics ER 2, y es el tipo de actualización que te hace replantearte qué son realmente capaces de hacer los robots. El nuevo modelo no solo hace que robots individuales sean más inteligentes. Hace que grupos de robots completamente diferentes trabajen juntos como si compartieran el mismo cerebro.
Boston Dynamics’ Spot y Apollo de Apptronik, dos robots que no se parecen en nada y realizan cosas muy diferentes, ahora pueden coordinarse mediante una comprensión semántica compartida impulsada por la IA de Google.
Qué hace realmente Gemini Robotics ER 2
La innovación principal aquí es lo que DeepMind llama "inteligencia temporal". En inglés: el robot puede observar lo que está sucediendo a través de una transmisión de video continua, comprender dónde se encuentra en una tarea de múltiples pasos y planificar su siguiente movimiento en consecuencia.
Los números cuentan una historia interesante. El modelo alcanza una precisión del 57,4% para la clasificación de progreso y del 91,3% para la detección de momentos, con un error medio de solo 0,96 segundos. La clasificación de progreso, la capacidad de entender cuánto avanza una tarea, aún tiene margen de mejora. Pero la detección de momentos, que localiza exactamente cuándo ocurre un evento específico en un flujo de video, es notablemente precisa con precisión subsegunda.
La integración con la API de Gemini Live de Google añade otra capa. Permite transmisión bidireccional de baja latencia entre el modelo de IA y el robot, lo que significa que el sistema puede ajustarse en tiempo real sin las pausas incómodas que afectaban a los controladores robóticos anteriores.
La seguridad también recibió una mejora significativa. Los benchmarks mejorados para seguir instrucciones y una detección de proximidad más precisa significan que estos robots tienen menos probabilidades de causar daño a sus compañeros humanos.
Los bloques de construcción se remontan a 2025
ER 2 no apareció de la nada. Se basa en una base que Google comenzó a construir en marzo de 2025 con los primeros modelos de robótica Gemini, seguidos por una actualización en septiembre del mismo año. Cada iteración ha ampliado progresivamente lo que los robots pueden hacer con la inteligencia artificial generativa, pasando de la ejecución básica de tareas al tipo de comportamiento agente que permite a las máquinas tomar decisiones contextuales en tiempo real.
Google tampoco opera en un vacío. La decisión de respaldar hardware de terceros, como los robots de Boston Dynamics y Apptronik, sugiere que Google desea ser la capa de sistema operativo para la robótica, no solo un proveedor de hardware.
