Роботы, которые учатся: как VLA-модели меняют робототехнику
Google DeepMind, Nvidia и стартапы вроде Physical Intelligence переносят подход больших языковых моделей на роботов. Итог — машины, которые складывают бельё и открывают ящики без ручного программирования под каждую задачу.

Летом 2024 года Physical Intelligence показала робота, который складывает футболки, вынутые из сушилки, — задача, на которой годами спотыкались инженеры, потому что мятая ткань не имеет фиксированной формы. Робот не был запрограммирован под футболки. Он обучился на видеозаписях манипуляций так же, как языковая модель учится на текстах. Это и есть главный сдвиг последних лет: роботов перестают программировать под каждое движение и начинают обучать по данным.
Классический промышленный робот на конвейере повторяет один и тот же путь миллион раз и падает, если деталь сместилась на сантиметр. Новое поколение строится вокруг моделей, которые связывают зрение, язык и действие — их называют VLA1. Такой робот получает на вход камеру, текстовую команду вроде «убери кружку в раковину» и выдаёт на выходе движения суставов.
Что изменилось технически
Прорыв не в железе. Манипуляторы и камеры существуют десятилетиями. Изменился способ управления ими: вместо жёстких правил — нейросеть, обученная на огромных наборах демонстраций.
Ключевых сдвигов три:
- Общие модели вместо узких. Раньше каждая задача требовала отдельного кода. Теперь одна модель обобщает на новые объекты и команды, которых не было в обучении.
- Обучение по демонстрациям. Человек управляет роботом через телеуправление или показывает движение своей рукой, и это записывается как обучающий пример. Тысячи таких эпизодов заменяют ручное программирование.
- Перенос из симуляции. Робот тренируется в физическом симуляторе, где можно прогнать миллионы попыток за часы, а затем навык переносится на реальное железо.
Кто двигает рынок
За 2023–2024 годы в область пришли и крупные лаборатории, и хорошо профинансированные стартапы.
Google DeepMind выпустила семейство моделей RT (Robotics Transformer) и в 2024 году показала RT-2, которая переносит знания из веб-данных в физические действия. Nvidia продвигает платформу для обучения роботов в симуляции и объявила о проекте гуманоидных моделей GR00T. Tesla разрабатывает гуманоида Optimus. Стартап Figure привлёк крупный раунд с участием OpenAI и Nvidia, а Physical Intelligence в 2024 году закрыла раунд, который оценил компанию в сумму, сопоставимую с миллиардами долларов.
Роботу больше не пишут инструкцию «повернуть сустав на 30 градусов». Ему показывают, что должно получиться, — и он сам ищет путь к результату.
Точные суммы раундов и оценки компаний меняются от сделки к сделке, поэтому свежие цифры стоит сверять по официальным анонсам самих компаний, а не по вторичным пересказам.
Два подхода к телу робота
Пока идёт спор, каким должно быть тело обучающегося робота.
| Подход | Плюс | Минус |
|---|---|---|
| Гуманоид (Figure, Optimus) | Работает в среде, спроектированной под человека, без переделки цехов | Дорого, сложно балансировать, много точек отказа |
| Специализированный манипулятор (рука на столе, колёсная база) | Проще, дешевле, надёжнее для узкой среды | Плохо переносится в другую обстановку |
Где это уже применяется
За пределами демороликов картина скромнее, чем хочется поверить. Обучающиеся роболаборатории пока чаще живут в исследовательских центрах, чем на складах. Но точки внедрения уже есть:
- Складская логистика — сортировка и перекладка разнородных товаров, где жёсткая программа не справляется с разнообразием форм.
- Производство электроники — точная сборка мелких компонентов.
- Лабораторная автоматизация — повторяемые манипуляции с образцами.
- Пилоты в сервисе и быту — уборка, разгрузка посудомоечной машины, пока в контролируемых условиях.
Почему это не завтра
Между впечатляющим демо и рабочим продуктом лежит несколько барьеров, и они серьёзные.
Данные. Языковую модель можно обучить на текстах из интернета. Данных о физических манипуляциях в таком объёме нет — их приходится собирать вручную, телеуправлением, эпизод за эпизодом. Это дорого и медленно.
Надёжность. Модель, которая справляется в 90 процентах случаев, для чата приемлема, а для робота, ворочающего тяжёлый предмет рядом с человеком, — нет. Оставшиеся проценты — это разбитая посуда или травма.
Обобщение. Робот, обученный на одной кухне, часто теряется на другой — при другом освещении, другой планировке, незнакомом объекте. Насколько хорошо навыки переносятся между обстановками, до сих пор открытый вопрос.
Стоимость. Гуманоид с приводами и сенсорами стоит дорого, и пока не ясно, какие задачи окупают эту цену по сравнению с обычной автоматизацией.
Разумный прогноз: ближайшие годы обучающиеся роботы будут закрепляться в узких, но ценных нишах — складах, производстве, лабораториях, — где повторяемость важна, а среда предсказуема. Универсальный домашний помощник, который сам разберётся на вашей кухне, остаётся целью, а не продуктом на полке.
1 VLA (vision-language-action) — тип модели, которая принимает изображение и текстовую команду, а на выходе выдаёт действия робота: движения суставов, захват, перемещение. Название подчёркивает, что зрение, язык и действие обрабатываются одной сетью.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google DeepMind — блог о робототехнике (RT-2), Physical Intelligence — официальный сайт
Частые вопросы
Чем обучающийся робот отличается от обычного промышленного?
Можно ли уже купить домашнего робота, который сам всему учится?
Что такое VLA-модель простыми словами?
Почему роботов сложнее обучать, чем чат-ботов?
Заменят ли такие роботы рабочих на складах в ближайшие годы?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.