One-shot imitation learning: как робот учится с одного показа
Классическому роботу нужны тысячи повторов, чтобы освоить действие. One-shot imitation learning обещает обучение с одной демонстрации — и это меняет экономику робототехники.

Обучить манипулятор перекладывать детали классическим reinforcement learning — это недели тренировки и сотни тысяч попыток в симуляторе. One-shot imitation learning ставит задачу иначе: показать роботу задачу один раз (человеческой рукой, телеоперацией или видео) и получить систему, которая обобщает этот показ на новые расположения объектов. Идею формализовали ещё в 2017 году в работе группы из OpenAI и Беркли под названием One-Shot Imitation Learning, и с тех пор она из академической экзотики превратилась в один из стержней современного роботообучения.
Цена вопроса прямая. Если каждую новую операцию на складе или кухне нужно программировать месяцами, роботы остаются дорогой игрушкой для трёх сценариев. Если операцию можно задать демонстрацией за минуту — открывается рынок, где робот перенастраивается под задачу почти как сотрудник, которому показали, куда ставить коробки.
Что такое one-shot imitation learning на самом деле
Термин путают с двумя соседними понятиями, и от этой путаницы стоит избавиться сразу.
- Imitation learning (обучение с демонстраций) — общий класс методов, где политика поведения строится по примерам действий эксперта, а не по функции вознаграждения. Самый простой вариант — behavior cloning, обычная регрессия «состояние → действие».
- One-shot imitation learning — режим, где на этапе применения система получает одну новую демонстрацию задачи и должна выполнить её вариацию. Ключевое: обучается не одна задача, а умение учиться по демонстрации. Модель заранее прогоняют через множество задач, чтобы она поняла общий принцип «смотри показ — повторяй суть».
- Few-shot — то же, но демонстраций несколько.
Разница принципиальна. One-shot-модель на этапе инференса не дообучается градиентным спуском под конкретную задачу — она использует демонстрацию как входные данные, наравне с текущим кадром с камеры. Демонстрация подаётся в контекст, и сеть по ней достраивает поведение.
Робот не запоминает движение. Он запоминает, как извлекать намерение из чужого движения — и это то, что позволяет одному показу масштабироваться на новую расстановку объектов.
Как это устроено внутри
Исторически сложились два больших подхода, и современные системы часто их комбинируют.
Метаобучение и контекст
Первый путь — метаобучение. Модель тренируют на распределении задач так, чтобы демонстрация служила условием (conditioning). На вход подают пару: последовательность кадров демонстрации и текущее наблюдение робота, на выход — действие. Здесь работают механизмы внимания: сеть сопоставляет объекты в показе с объектами в текущей сцене и переносит план.
Родственный приём — MAML (Model-Agnostic Meta-Learning) от Челси Финн и коллег: сеть учат так, чтобы из её весов один-два шага дообучения давали хорошую политику для новой задачи. Формально это уже ближе к few-shot с быстрой адаптацией, но идея та же — оптимизировать способность к обучению.
Визуальные и языковые фундаментальные модели
Второй путь появился с ростом больших моделей. Vision-language-action-модели (VLA) вроде RT-2 от Google DeepMind и открытого семейства OpenVLA берут предобученную на интернет-данных vision-language-основу и дообучают на роботных траекториях. Такая модель уже «знает», как выглядит кружка и что значит «поставь слева», поэтому одна демонстрация ложится на богатое общее представление о мире, а не на пустую сеть.
Почему это работает лучше
Классический behavior cloning на одной демонстрации переобучается: сеть запоминает конкретные координаты и рассыпается при малейшем сдвиге объекта. Предобученная модель уже устойчива к вариациям внешнего вида и положения, поэтому одна демонстрация задаёт что делать, а базовые представления отвечают за как справиться с новизной.
Сравнение подходов
| Подход | Что нужно на инференсе | Сильная сторона | Слабое место |
|---|---|---|---|
| Behavior cloning | Дообучение под задачу | Простота, прозрачность | Плохо обобщает с одного примера |
| MAML / быстрая адаптация | 1–2 шага градиента | Быстрая настройка | Чувствителен к распределению задач |
| Контекстный one-shot (attention) | Демонстрация как вход, без дообучения | Мгновенное применение | Требует большого разнообразия при обучении |
| VLA-модели | Демонстрация и/или текстовая команда | Обобщение за счёт интернет-данных | Дорогое предобучение, большие модели |
Где это уже применяют
Наиболее осязаемый прогресс — в манипуляции: захват предметов, сортировка, укладка, простая сборка. Проекты вроде RT-серии и открытых датасетов Open X-Embodiment, где несколько лабораторий объединили роботные траектории в общий корпус, показали, что модель, обученная на разнородных данных, переносит навык между разными роботами и задачами лучше, чем узкоспециализированная.
Практический сценарий выглядит так:
- Оператор один раз показывает задачу — телеоперацией или проведя рукой робота (kinesthetic teaching).
- Демонстрация кодируется и подаётся модели вместе с потоком с камеры.
- Робот выполняет вариацию задачи при смещённых или частично изменённых объектах.
- При сбое оператор добавляет ещё одну демонстрацию — режим плавно переходит в few-shot.
Чего ждать не стоит
Маркетинговая формулировка «робот учится с одного показа» скрывает главное: за этим одним показом стоят месяцы предобучения на тысячах задач и огромный датасет. One-shot экономит усилия конечного пользователя, а не разработчика.
Ограничения честнее перечислить прямо:
- Обобщение хрупкое. Смена освещения, новая форма объекта или задача вне распределения обучения ломают перенос.
- Точные и контактно-богатые задачи (вставить разъём, затянуть винт) даются хуже, чем перемещение предметов.
- Данные — узкое место. Роботных траекторий на порядки меньше, чем текста и картинок в интернете, и собирать их дорого.
- Безопасность. Модель, повторяющая намерение из показа, не гарантирует безопасное поведение в незнакомой ситуации.
Конкретные цифры точности сильно зависят от постановки эксперимента и набора задач, поэтому доверять стоит воспроизводимым бенчмаркам с открытым кодом, а не отдельным демороликам. При оценке систем сверяйтесь с оригинальными публикациями и их метриками, а не с пресс-релизами.
One-shot imitation learning — не про магию с одного взгляда, а про смещение стоимости настройки от программиста к оператору. Именно это делает подход интересным для бизнеса: там, где раньше нужен был инженер на неделю, теперь может хватить показа и минуты.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: One-Shot Imitation Learning (Duan et al., 2017), Open X-Embodiment: Robotic Learning Datasets and RT-X Models
Частые вопросы
Чем one-shot отличается от обычного обучения с демонстраций?
Робот правда учится с одного показа?
Нужно ли дообучать модель под каждую новую задачу?
Какие задачи даются хуже всего?
Можно ли перенести навык между разными роботами?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.