Google DeepMind щойно представила, можливо, найамбітніше оголошення з робототехніки цього року. Gemini Robotics 2, представлений 30 липня, розроблений як єдиний штучний інтелект, здатний працювати всередині майже будь-якого робототехнічного тіла — від гуманоїдів до промислових маніпуляторів, адаптуючись до нового обладнання за години, а не місяці.
Що насправді робить Gemini Robotics 2
Система побудована навколо трьох різних моделей, кожна з яких відповідає за інший рівень інтелекту робота. Модель vision-language-action (VLA) керує контролем всього тіла та дрібною моторикою. Модель embodied reasoning (ER) діє як високорівневий мозок, координуючи багатокрокові послідовності завдань, які можуть тривати кілька хвилин. А локальна версія працює безпосередньо на пристрої, що означає, що роботу не потрібно з’єднувати з хмарним сервером кожного разу, коли він піднімає чашку.
Система не залежить від апаратного забезпечення. Один чекпоінт моделі може працювати з абсолютно різними роботичними платформами. Google продемонстрував це на гуманоїді Apollo 2 від Apptronik та роботизованій руці Franka, запускаючи той самий рівень інтелекту на радикально різних фізичних формах.
Gemini Robotics 2 може навчитися керувати новою робототехнічною платформою за допомогою менше ніж 200 навчальних прикладів, що досягається за кілька годин збору даних. Для порівняння, традиційні системи штучного інтелекту для робототехніки часто вимагають тисяч або десятків тисяч демонстрацій, щоб досягти базової компетентності на одній платформі.
Роботи, що працюють на цій системі, можуть виконувати складні завдання, включаючи двоногий хід, маніпулювання об’єктами та взаємодію між кількома роботами, коли кілька машин координують свої дії без людського контролю.
Чому це має значення поза робототехнічною лабораторією
Google надає доступ до моделей ER та VLA через Google AI Studio та партнерські програми. DeepMind також створив еталони, спеціально призначені для вимірювання так званої «агентної поведінки», щоб оцінити, наскільки безпечно ці AI-системи працюють під час прийняття автономних рішень.
Що це означає для інвесторів
Підхід Google DeepMind, що не залежить від апаратного забезпечення, може значно змінити конкурентну ситуацію. Якщо Gemini Robotics 2 виконає свої обіцянки, він загрожує превратити апаратне забезпечення роботів у товар, концентруючи цінність у шарі інтелекту. Компанії, як-от Apptronik, що вже співпрацюють з DeepMind, можуть отримати переваги від легшого входу на ринок, але одночасно стають більш залежними від AI-стеку Google.
Програма Optimus від Tesla, Figure AI та зростаючий список стартапів у сфері робототехніки всі прагнуть до схожих цілей. Перевага Google — у масштабі: у нього є інфраструктура для обчислень, фундаментальні AI-моделі та платформа для розповсюдження через Google AI Studio та партнерські програми.
