Google DeepMind только что представила, возможно, самое амбициозное объявление в области робототехники этого года. Gemini Robotics 2, представленный 30 июля, предназначен быть единым ИИ-мозгом, способным работать внутри практически любого роботизированного тела — от гуманоидов до промышленных манипуляторов, адаптируясь к новому оборудованию за часы, а не месяцы.
Что на самом деле делает Gemini Robotics 2
Система построена вокруг трех различных моделей, каждая из которых отвечает за другой уровень роботизированного интеллекта. Модель «видео-язык-действие» (VLA) управляет контролем всего тела и мелкой моторикой. Модель «воплощенного рассуждения» (ER) действует как высокий уровень мозга, координируя многошаговые последовательности задач, которые могут длиться несколько минут. Кроме того, локальная версия модели работает непосредственно на устройстве, что означает, что роботу не нужно каждый раз обращаться к облачному серверу, чтобы поднять чашку.
Система не зависит от аппаратного обеспечения. Одна точка сохранения модели может работать на совершенно разных робототехнических платформах. Google продемонстрировала это на гуманоидном роботе Apollo 2 от Apptronik и роботизированной руке от Franka, запустив один и тот же уровень интеллекта на радикально разных физических формах.
Gemini Robotics 2 может научиться управлять новой робототехнической платформой с использованием менее чем 200 обучающих примеров, что достигается за несколько часов сбора данных. Для сравнения, традиционные системы ИИ для робототехники часто требуют тысячи или десятки тысяч демонстраций для достижения базовой компетентности на одной платформе.
Роботы, работающие на этой системе, могут выполнять сложные задачи, включая двухногую ходьбу, манипуляцию объектами и взаимодействие нескольких роботов, когда несколько машин координируют свои действия без человеческого контроля.
Почему это важно за пределами робототехнической лаборатории
Google предоставляет доступ к моделям ER и VLA через Google AI Studio и партнерские программы. DeepMind также разработала эталонные показатели, специально предназначенные для так называемого «агентного поведения», измеряя, насколько безопасно эти ИИ-системы работают при принятии автономных решений.
Что это означает для инвесторов
Подход Google DeepMind, не зависящий от аппаратного обеспечения, может значительно изменить конкурентную среду. Если Gemini Robotics 2 оправдает свои обещания, это угрожает превратить аппаратное обеспечение роботов в товар, сосредоточив ценность на уровне интеллекта. Компании, такие как Apptronik, уже сотрудничающие с DeepMind, могут получить преимущество в виде более легкого выхода на рынок, но при этом станут более зависимыми от AI-стека Google.
Программа Optimus от Tesla, Figure AI и растущий список стартапов в области робототехники все стремятся к схожим целям. Преимущество Google заключается в масштабе: у него есть вычислительная инфраструктура, фундаментальные ИИ-модели и платформа для распространения через Google AI Studio и партнерские программы.
