Google DeepMind vient de dévoiler ce qui pourrait être l'annonce la plus ambitieuse en robotique de l'année. Gemini Robotics 2, présenté le 30 juillet, est conçu pour être un cerveau IA unique capable de fonctionner dans presque n'importe quel corps robotique, des humanoïdes aux bras industriels, en s'adaptant à de nouveaux matériels en quelques heures plutôt qu'en plusieurs mois.
Ce que fait réellement Gemini Robotics 2
Le système est construit autour de trois modèles distincts, chacun gérant une couche différente de l'intelligence du robot. Le modèle vision-langage-action (VLA) gère le contrôle du corps entier et les compétences motrices fines. Le modèle de raisonnement incarné (ER) agit comme le cerveau de haut niveau, orchestrant des séquences de tâches en plusieurs étapes pouvant s'étendre sur plusieurs minutes. Une variante exécutée sur l'appareil fonctionne localement, ce qui signifie que le robot n'a pas besoin de se connecter à un serveur cloud à chaque fois qu'il saisit une tasse.
Le système est indépendant du matériel. Un seul point de contrôle de modèle peut faire fonctionner des plateformes robotiques complètement différentes. Google l'a démontré sur l'humanoïde Apollo 2 d'Apptronik et les systèmes de bras robotique de Franka, en exécutant la même couche d'intelligence sur des formes physiques radicalement différentes.
Gemini Robotics 2 peut apprendre à opérer une nouvelle incarnation de robot avec moins de 200 exemples d'entraînement, réalisables en quelques heures de collecte de données. À titre de comparaison, les systèmes d'IA robotique traditionnels nécessitent souvent des milliers ou des dizaines de milliers de démonstrations pour atteindre une compétence de base sur une seule plateforme.
Les robots fonctionnant sur ce système peuvent effectuer des tâches avancées, notamment la marche bipède, la manipulation d'objets et la collaboration entre plusieurs robots, où plusieurs machines coordonnent leurs actions sans supervision humaine détaillée.
Pourquoi cela importe au-delà du laboratoire de robotique
Google met à disposition les modèles ER et VLA via Google AI Studio et ses programmes partenaires. DeepMind a également établi des références spécifiques pour ce qu'il appelle le « comportement agentic », mesurant la sécurité avec laquelle ces systèmes d'IA opèrent lors de prises de décisions autonomes.
Ce que cela signifie pour les investisseurs
L'approche indépendante du matériel de Google DeepMind pourrait redéfinir significativement le paysage concurrentiel. Si Gemini Robotics 2 tient ses promesses, elle risque de rendre le matériel robotique une marchandise standardisée tout en concentrant la valeur au niveau de l'intelligence. Les entreprises comme Apptronik, qui collaborent déjà avec DeepMind, pourraient bénéficier d'une entrée plus facile sur le marché, mais deviendront également plus dépendantes de la pile d'IA de Google.
Le programme Optimus de Tesla, Figure AI et une liste croissante de startups en robotique poursuivent tous des objectifs similaires. L'avantage de Google réside dans son échelle : il dispose de l'infrastructure de calcul, des modèles d'IA fondamentaux et d'une plateforme de distribution via Google AI Studio et ses programmes partenaires.
