Gemini Robotics-ER 2: как модель учит роботов думать
Google DeepMind позиционирует Gemini Robotics-ER как модель-«мозг» для роботов: она разбирает видео, планирует задачи и координирует несколько машин. Разбираем, что это меняет для разработчиков.

Google DeepMind продолжает линейку моделей для робототехники, построенных на базе Gemini. Ключевая идея семейства Robotics-ER (ER — embodied reasoning, «телесное рассуждение») в том, чтобы отделить «мозг» от «тела»: одна модель отвечает за понимание сцены, планирование и координацию, а низкоуровневое управление приводами остаётся за отдельным контроллером. Это принципиально иной подход, чем монолитная модель, которая напрямую выдаёт команды на моторы.
Ниже — что заявлено в этом классе моделей, чем ER отличается от «обычной» мультимодальной модели вроде Gemini и почему для инженера-робототехника это важнее, чем очередной прирост в бенчмарках. Точные названия версий, доступность в API и лимиты быстро меняются — их стоит сверять в актуальной документации Google DeepMind и Google AI, а не полагаться на цифры из статей.
Что такое embodied reasoning и зачем он роботам
Языковая модель хорошо отвечает на вопросы, но не знает, что кружка стоит слева от чайника, а провод свисает со стола так, что робот его заденет. Embodied reasoning — это способность рассуждать о физическом мире: пространственные отношения, последовательность действий, физические ограничения.
Модель Robotics-ER задумана как слой, который принимает на вход видеопоток и текстовую задачу, а на выходе выдаёт не текст «в вакууме», а структурированный план: что взять, куда переместить, в каком порядке, с какими промежуточными проверками. Само движение манипулятора при этом рассчитывает отдельный низкоуровневый контроллер.
Разделение на «модель, которая думает» и «модуль, который двигает» — это не архитектурная мелочь. Оно позволяет менять железо, не переучивая рассуждение, и наоборот.
Три заявленные способности
- Понимание видео. Модель разбирает не отдельный кадр, а поток: отслеживает объекты во времени, замечает, что предмет переместился или исчез из поля зрения.
- Оркестрация задач. Сложную инструкцию («убери со стола и рассортируй по коробкам») модель раскладывает на подзадачи и следит за их выполнением, а не выдаёт одну команду.
- Координация нескольких роботов. Модель может распределять шаги между несколькими манипуляторами или машинами, работающими над общей задачей.
Чем ER отличается от базового Gemini
Базовые мультимодальные модели умеют описывать изображение и рассуждать о нём. Но между «на фото стоит стакан» и «возьми стакан, не опрокинув соседнюю тарелку, и поставь его в верхний ящик» — пропасть, которую закрывает как раз специализация под робототехнику.
| Свойство | Базовая мультимодальная модель | Robotics-ER |
|---|---|---|
| Вход | Изображение, текст, иногда видео | Видеопоток сцены плюс задача |
| Выход | Текст, разметка на изображении | Структурированный план действий, пространственные привязки |
| Пространственное рассуждение | Ограниченное | Приоритетная способность |
| Роль в системе | Ассистент, генератор | Планировщик поверх низкоуровневого контроллера |
Смысл в том, что ER-модель не заменяет контроллер движения — она стоит над ним. Инженер получает высокоуровневый планировщик, который можно подключить к уже существующему стеку управления роботом.
Оркестрация: главный практический выигрыш
Реальные задачи редко умещаются в одну команду. «Собери заказ на складе» разворачивается в десятки шагов: найти ячейку, подъехать, идентифицировать товар, взять, проверить, положить в тару, отметить выполнение. Раньше эту логику писали руками — конечными автоматами и деревьями поведения. Модель, которая сама раскладывает задачу и переигрывает план при сбое, сокращает объём такого ручного кода.
Ключевой момент — реакция на неожиданность. Если объект не там, где ожидалось, или захват сорвался, планировщик должен перестроить последовательность, а не встать в ступор. Именно устойчивость к отклонениям, а не идеальный прогон в лаборатории, определяет пригодность модели для производства.
Мультиробот: координация вместо конкуренции
Когда над одной задачей работают несколько манипуляторов, появляются классические проблемы распределённых систем: кто за какой предмет отвечает, как не столкнуться, как поделить зону. Заявленная координация нескольких роботов означает, что модель распределяет подзадачи и учитывает действия соседей. Насколько это работает вне демонстраций — вопрос, на который честно ответит только тестирование на вашем железе.
Что это значит для разработчиков
Если вы строите робототехническое приложение, разделение слоёв даёт несколько практических следствий:
- Высокоуровневую логику можно доверить модели, а не описывать деревьями поведения вручную.
- Низкоуровневый контроллер под конкретное железо остаётся вашим — модель к нему подключается сверху.
- Обновление рассуждающей модели не требует переучивания управления моторами.
- Отладку удобнее вести на уровне плана: видно, какую подзадачу модель поняла неверно.
Обратная сторона — зависимость от облачной модели там, где важна задержка и работа без сети. Для промышленного робота секунда ожидания ответа от удалённого API может быть неприемлема. Уточняйте в документации, какие режимы работы и какая латентность заявлены для вашего сценария, прежде чем закладывать модель в критичный контур.
Осторожно с ожиданиями
Демонстрации робототехнических моделей почти всегда показывают удачные прогоны в контролируемой обстановке. Реальный склад или кухня — это переменное освещение, отражающие поверхности, частично перекрытые объекты и люди, которые двигаются непредсказуемо. Разрыв между демо и продакшеном в робототехнике исторически огромен.
Поэтому к любым заявленным способностям стоит относиться как к отправной точке для собственных тестов, а не как к гарантии. Проверяйте на своих задачах, своём железе и своих условиях освещения — и закладывайте деградацию точности при переходе из лаборатории в поле.
Robotics-ER — это ставка на то, что «мозг» робота можно вынести в отдельную модель, обучаемую независимо от тела. Если ставка сыграет, робототехника получит то же, что дал разработке облачный API: возможность собирать сложные системы из готовых слоёв, а не переизобретать каждый с нуля.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google DeepMind — Robotics, Gemini API documentation — Google AI
Частые вопросы
Robotics-ER напрямую управляет моторами робота?
Чем ER отличается от обычного Gemini?
Можно ли использовать модель для нескольких роботов сразу?
Подойдёт ли модель для задач, где важна минимальная задержка?
Где взять точные версии, цены и лимиты API?
Насколько результаты демонстраций отражают реальную работу?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.