
Google DeepMind представила новое семейство Gemini Robotics 2, предназначенное для управления роботами. Эти модели помогают гуманоидным роботам передвигаться, наклоняться, сохранять равновесие и взаимодействовать с объектами, а также позволяют нескольким устройствам координировать свои действия в рамках одной задачи.
Gemini Robotics ER 2 уже доступна для разработчиков в тестовом режиме через Google AI Studio и Gemini API. В рамках Gemini Enterprise Agent Platform модель была запущена в закрытом тестировании. Подробности можно найти в материале Postium.
Читайте также: Как бесплатно использовать Gemini 3.6 Flash
Три ИИ-модели Gemini Robotics 2: возможности каждой
Gemini Robotics 2 относится к категории vision-language-action (VLA). Она принимает изображения и текстовые команды, после чего преобразует их в движения робота. Модель контролирует все части тела гуманоидного робота — от ног до пальцев. Она совместима с роботами, имеющими два манипулятора, многопалые руки и стандартные двухпальцевые захваты.
В демонстрации гуманоидного робота Apptronik Apollo 2 по команде он подходил к столу, брал лейку, переносил её на полку и ставил в нижнюю секцию. Ранее версии системы в основном управляли верхней частью тела и выполняли действия за столом. Новая версия объединяет ходьбу, наклоны, перенос предметов и манипуляции руками в единый процесс. Google отмечает, что скорость движений пока требует улучшений.

Модель также управляет манипулятором SharpaWave, который имеет пять пальцев и 22 степени свободы. В ходе тестирования робот смог завязать мусорный пакет, закрутить лампочку и закрыть пакет с застёжкой. Результаты варьируются в зависимости от типа действия: робот успешно откручивал лампочку в 92% случаев, но завязывал пакет лишь в 44%, а закрывал застёжку — в 40%. При использовании стандартных захватов показатели оказались выше. Например, точные манипуляции на платформе Franka Duo завершались успешно в 89,6% случаев.
Gemini Robotics ER 2 отвечает за планирование. Модель анализирует окружающее пространство, разбивает задачу на этапы, вызывает функции управления роботом и следит за их выполнением. Она может обрабатывать последовательности продолжительностью несколько минут, выявлять необходимые моменты в видеопотоке и определять, завершил ли робот конкретный этап.
В ER 2 также реализована координация нескольких роботов. Система распределяет части одного процесса между разными устройствами и отслеживает общий результат. Для разработчиков Google выпустила обычную версию gemini-robotics-er-2-preview и потоковую gemini-robotics-er-2-streaming-preview, которая принимает непрерывные аудио- и видеоданные через Live API.
Gemini Robotics On-Device 2 выполняет действия локально, что избавляет робота от необходимости постоянного подключения к облаку. Google утверждает, что модель может быть адаптирована к новой платформе с двумя манипуляторами за считанные часы, используя менее 200 примеров. Она спроектирована для работы на устройствах с различной формой корпуса, набором датчиков и количеством степеней свободы.
Как получить доступ
Gemini Robotics ER 2 можно протестировать в Google AI Studio или подключить через Gemini API. Модель принимает текст, изображения, видео и аудио, поддерживает выполнение кода и вызов пользовательских функций для управления роботами. Входной контекст составляет до 131 072 токенов.
Чтобы подключить основную VLA-модель или On-Device 2, разработчику нужно подать заявку в программу раннего доступа. Google не сообщила, когда эти модели станут доступны для широкой публики и на каких коммерческих условиях они будут предложены.
Тем не менее, тесты Google показывают, что модель уже успешно справляется с переносом предметов и работой с обычными захватами, но сложные движения отдельных пальцев остаются нестабильными. Результаты лабораторных демонстраций также не позволяют понять, как система будет функционировать при длительной работе в незнакомом окружении.
Google предупреждает, что разработчики должны самостоятельно обеспечивать безопасность физического оборудования. Компания не рекомендует использовать ER 2 в критически важных системах, где ошибка может привести к травмам или повреждениям имущества, включая транспортные средства и медицинское оборудование.
Почему это важно? Ранее разработчикам часто требовались отдельные системы для ходьбы, управления манипуляторами и планирования последовательности действий. Gemini Robotics 2 объединяет эти уровни: одна модель преобразует команды в движения, другая отвечает за планирование этапов и координацию действий роботов.
Итог: Gemini Robotics 2 сочетает в себе управление всем телом, работу с предметами и координацию нескольких роботов, однако основные модели на данный момент доступны лишь в рамках программы раннего доступа.


