Что произошло

Google DeepMind представила Gemini Robotics 2 — семейство AI-моделей, которые дают роботам управление всем телом, более тонкую манипуляцию и возможность совместной работы над сложными задачами. В отличие от предыдущей модели, контролировавшей преимущественно верхнюю часть тела, Gemini Robotics 2 управляет гуманоидом целиком — с головы до ног. Релиз состоялся 30 июля 2026 года.

ℹ Ключевое достижение
Gemini Robotics 2 — первый в мире AI от DeepMind, который управляет полным гуманоидом: ногами, торсом, руками и многопальцевыми кистями под единой обученной политикой (learned policy).

Три модели — три уровня задач

Релиз включает три отдельные модели: VLA (vision-language-action), воплощённую рассуждающую VLM и бортовой VLA.

МодельТипДоступНазначение
Gemini Robotics 2 VLAVision-Language-ActionРанний доступ (партнёры)Управление роботами любого типа — от манипуляторов до полных гуманоидов
Gemini Robotics ER 2Embodied Reasoning (воплощённое рассуждение)Открытый предпросмотр через Gemini APIВысокоуровневый «мозг»: общение с людьми, планирование задач на несколько минут
Gemini Robotics On-Device 2Бортовой VLAРанний доступ (партнёры)Работа без облака, прямо на железе робота

Gemini Robotics ER 2 — это воплощённая рассуждающая модель, которая выступает высокоуровневым «мозгом»: общается с людьми, понимает физический мир и планирует многошаговые задачи продолжительностью несколько минут.

По карточке модели, ER 2 основан на Gemini 3.5 Flash, принимает перемежающиеся текст, изображения, видео и аудио в контекстном окне до 128k токенов и генерирует текст до 64K токенов.


Loco-manipulation: задача, которую решили

Инженерная проблема, которую решает Gemini Robotics 2, имеет название в исследовательском сообществе — loco-manipulation (локомоционная манипуляция). Она подразумевает способность робота одновременно передвигаться по среде и манипулировать объектами, координируя баланс, локомоцию и захват через единую систему управления всем телом.

Предыдущие модели контролировали только верхнюю часть тела гуманоида для настольных задач, тогда как Gemini Robotics 2 расширяет физический AI до движений всем телом.


graph TD
    A[Команда голосом / текстом] --> B[Gemini Robotics ER 2\nПланирование задачи]
    B --> C[Gemini Robotics 2 VLA\nУправление моторикой]
    C --> D[Ходьба + захват объекта]
    D --> E[Размещение / выполнение]
    C --> F[Многопальцевая\nманипуляция]
    B --> G[ASIMOV-Agentic\nПроверка безопасности]
    G -->|Небезопасно| H[Запрос помощи человека]
    G -->|Безопасно| C


Реальные показатели: что умеет и где пробелы

В одной из демонстраций гуманоид Apptronik Apollo 2 получил команду положить лейку в зелёный контейнер на нижней полке: робот дошёл до объекта, поднял его, переместился к стеллажу и точно положил в нужное место.

Тесты с Apollo 2 показали успешность 68,4% при подборе объектов со стола, 45,7% — с пола и 76,3% — с полки.

Показатели точной пальцевой моторики пока неоднородны: 92% при откручивании лампочки, 44% при завязывании мусорного мешка, 40% при запечатывании зип-пакета и 32% при задаче с совком.

⚠ Ограничения текущей версии
Многопальцевая манипуляция остаётся слабым звеном: разброс успешности составляет от 32% до 92% в зависимости от типа задачи. Google DeepMind признаёт, что движения роботов ещё нужно делать быстрее и надёжнее.

Бортовая модель и адаптация без данных

Для применений без доступа к интернету Google представила Gemini Robotics On-Device 2: модель работает локально на железе робота и способна адаптироваться к совершенно новым конструкциям двуруких роботов менее чем по 200 обучающим примерам, собранным за несколько часов.

DeepMind продемонстрировала бортовую модель на платформах Dexmate, SO101 и Trossen — ни одна из них не входила в обучающие данные.


Безопасность: ASIMOV-Agentic

«Вопрос безопасности стоит ещё острее, потому что роботы оказываются во всё большем числе ситуаций — и неопределённость там будет нарастать» — Каролина Парада, глава робототехники Google DeepMind

Google также представила ASIMOV-Agentic — новый бенчмарк для оценки безопасности роботов, включая способность отказываться от опасных действий, распознавать неопределённость и запрашивать помощь человека.

Gemini Robotics ER 2 стала самой безопасной моделью DeepMind по следованию ограничениям безопасности и обнаружению близости людей: она лучше определяет, когда рядом находится человек, запускает защитные инструменты и останавливает робота, если кто-то подходит слишком близко.

Сам бенчмарк ASIMOV-Agentic опубликован на Hugging Face под лицензией CC-BY-4.0.


Партнёры и экосистема

Среди официальных партнёров по развёртыванию — Apptronik (Apollo 2), Franka (Franka Duo) и Agile Robots. Boston Dynamics также указана как партнёр в технических материалах — в соответствии с соглашением, объявленным в мае 2026 года, по которому Google DeepMind получила парк роботов Atlas для интеграции моделей Gemini Robotics.

Google работает с западными партнёрами, включая Apptronik, Boston Dynamics и Agile Robots, а также более чем с 50 проверенными тестировщиками.

💡 Как попробовать
Gemini Robotics ER 2 уже доступна в публичном предпросмотре через Gemini API. Модели VLA и On-Device 2 пока закрыты и доступны только партнёрам DeepMind по раннему доступу.

Значение для отрасли

Большинство роботов сегодня запрограммированы заранее или управляются оператором для узких, повторяющихся задач — им не хватает способности самостоятельно учиться или адаптироваться к непредсказуемым условиям, а перенос навыков с одного корпуса робота на другой остаётся крайне сложной задачей.

Gemini Robotics 2 открывает интеллектуальное управление всем телом, продвинутую точность и многороботное сотрудничество: модель позволяет гуманоиду ходить, приседать, тянуться и манипулировать объектами — например, убирать захламлённую комнату, а при необходимости объединиться с другим роботом, чтобы завершить работу быстрее.

При этом Google не планирует в ближайшее время выпускать потребительских роботов — технология пока остаётся на этапе исследований и партнёрских развёртываний. Тем не менее выход Gemini Robotics 2 обозначает принципиальный сдвиг: из эпохи роботов-манипуляторов отрасль движется к полноценным мобильным агентам, способным думать, двигаться и взаимодействовать как единое целое.