Gemini Robotics-ER 1.6: как Google учит роботов думать перед действием
Google DeepMind выпустила Gemini Robotics-ER 1.6 — модель, которая планирует действия робота через пространственное рассуждение и вызов инструментов. Разбираем, что она умеет и где проходит граница между демо и реальным цехом.

Google DeepMind представила Gemini Robotics-ER 1.6 — обновление модели «embodied reasoning», которая отвечает не за движение манипулятора напрямую, а за уровень выше: понять сцену, разбить задачу на шаги, вызвать нужный инструмент или низкоуровневую модель управления. По сути это «мозг-планировщик», который смотрит на камеру робота и решает, что делать, прежде чем что-то физически произойдёт. Доступ к ER-модели открыт через Gemini API в Google AI Studio, что отличает её от закрытых демонстраций прошлых лет.
Что такое embodied reasoning и зачем отдельная модель
Классическая большая языковая модель хорошо рассуждает о тексте, но плохо понимает физический мир: где лежит предмет относительно другого, поместится ли объект в контейнер, в каком порядке брать детали, чтобы не уронить стопку. Embodied reasoning* — это как раз про такое пространственно-временное понимание сцены и планирование действий в ней.
Google разделяет стек на два уровня. Есть Gemini Robotics — модель типа vision-language-action, которая переводит инструкцию и картинку напрямую в команды на моторы. И есть Gemini Robotics-ER — модель, которая не двигает роботом сама, а рассуждает: анализирует изображение с камеры, определяет координаты объектов, строит последовательность шагов и при необходимости вызывает внешние инструменты или отдаёт подзадачу исполнительной модели.
Ценность ER-подхода не в том, что робот «поумнел», а в том, что планирование и исполнение разведены. Ошибку рассуждения теперь можно поймать до того, как манипулятор её совершит.
Что нового в версии 1.6
Google описывает 1.6 как шаг в сторону более надёжного пространственного понимания и более длинных цепочек рассуждения. Ключевые заявленные улучшения:
- более точное определение положения объектов и точек захвата на изображении;
- работа с многошаговыми задачами, где один неверный шаг ломает всю цепочку (например, разложить предметы в правильном порядке);
- вызов инструментов — модель может обратиться к поиску, к внешнему API или к специализированной модели управления, а не пытаться решить всё «в голове»;
- ориентация на разработчиков: модель доступна через Gemini API, её можно встраивать в свой конвейер управления роботом.
Конкретные цифры бенчмарков и проценты успеха Google приводит в собственных материалах, и здесь важно не выдавать их за отраслевой стандарт: методики замеров у разных лабораторий отличаются, а «успех на 95% задач» в лабораторной кухне не переносится один в один на склад.
Где это работает, а где пока нет
Сильная сторона ER-модели — задачи, которые люди описывают словами, а не координатами. «Убери со стола посуду и сложи в раковину» разворачивается в план: найти чашки, определить порядок, рассчитать захват, проверить, что путь свободен. Модель хорошо себя показывает там, где нужно рассуждение над сценой, а не миллиметровая точность на скорости.
Слабые места остаются типичными для всей области робототехники:
- Задержка. Цепочка «камера → рассуждение → инструмент → команда» добавляет латентность, критичную для быстрых операций.
- Хрупкие сцены. Отражающие поверхности, плохой свет, нестандартная упаковка сбивают распознавание.
- Перенос между роботами. Модель рассуждения универсальнее исполнительной, но нижний уровень управления всё равно привязан к конкретному железу.
- Безопасность. Ошибка планировщика рядом с человеком — это не битый пиксель, а физический риск, поэтому реальные внедрения обкладываются ограничителями.
Два уровня стека: чем ER отличается от VLA
| Характеристика | Gemini Robotics-ER | Gemini Robotics (VLA) |
|---|---|---|
| Роль | Планирование, рассуждение о сцене | Прямое управление действиями |
| Выход | План, координаты, вызовы инструментов | Команды на приводы робота |
| Вызов инструментов | Да | Ограниченно |
| Привязка к железу | Слабая | Сильная |
| Где полезнее | Многошаговые задачи, новые сцены | Отработанные повторяющиеся движения |
На практике эти два уровня работают в паре: ER рассуждает и планирует, VLA исполняет. Разработчику это даёт гибкость — можно заменить исполнительный слой под конкретного робота, оставив планировщик прежним.
Что это значит для разработчиков
Главное практическое изменение — модель отдана через Gemini API, а не заперта в исследовательском демо. Это открывает сценарий, когда небольшая команда собирает прототип: берёт готовую ER-модель как планировщик, подключает свою камеру и свой низкоуровневый контроллер.
Разумный порядок пробного внедрения выглядит так:
- Определите, какая часть вашей задачи требует рассуждения, а какая — точного движения. ER берёт на себя первое.
- Проверьте доступ и лимиты в Google AI Studio — тарифы и квоты Gemini API меняются, сверяйте актуальные на странице документации.
- Соберите тестовую сцену, близкую к боевой: свет, фон, реальные предметы, а не идеальный стол.
- Замеряйте не только успех задачи, но и латентность и поведение при ошибке — падает ли система безопасно.
- Только потом думайте про масштаб и человека рядом с роботом.
Стоит держать в голове и рыночный контекст: в области embodied AI одновременно работают несколько крупных игроков и стартапов, и заявления о возможностях моделей часто опережают их устойчивую работу вне лаборатории. Оценивайте по своему тесту, а не по ролику.
* Embodied reasoning — рассуждение агента, «встроенного» в физическое тело или среду: модель учитывает пространство, объекты и последствия действий, а не только текст.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google DeepMind — Gemini Robotics, Google AI for Developers — Gemini API documentation
Частые вопросы
Gemini Robotics-ER 1.6 сама управляет роботом?
Можно ли попробовать модель без своего робота?
Чем ER-версия отличается от обычной Gemini?
Насколько точны заявленные показатели успеха?
Подходит ли модель для промышленного внедрения прямо сейчас?
Привязана ли модель к конкретному роботу?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.