Third-person imitation learning: обучение агентов по чужому опыту
Робот смотрит, как задачу выполняет человек, а потом повторяет её сам — со своей камерой, своим телом и своим углом зрения. Разбираем, почему это сложнее, чем скопировать движения один в один.

Классическое обучение с подражанием (imitation learning) требует демонстраций от первого лица: агент получает те же самые наблюдения и действия, что и эксперт. Робот учится по данным, снятым его же камерой, с его же джойстика. Проблема в том, что таких данных почти нет, а собирать их дорого. Third-person imitation learning (обучение с подражанием от третьего лица) снимает это ограничение: агент смотрит на демонстрацию со стороны — как человек делает задачу — и должен воспроизвести её сам, несмотря на то что у него другое тело, другой ракурс и другая динамика.
Почему нельзя просто скопировать движения
Основная сложность — так называемый domain shift* между наблюдением эксперта и наблюдением агента. Человек берёт кружку рукой, у которой пять пальцев. Робот — двухпалым захватом. Демонстрация снята сбоку, а бортовая камера робота смотрит сверху. Прямое копирование пикселей или траекторий здесь бесполезно: одна и та же задача выглядит и исполняется по-разному.
Формально агент видит последовательность кадров эксперта, но не имеет доступа ни к действиям эксперта, ни к его состоянию. Ему нужно извлечь из чужого видео что нужно сделать (цель задачи), отбросив как это делалось в конкретном теле и ракурсе.
Задача не в том, чтобы повторить движения. Задача в том, чтобы понять намерение и переизобрести движения под своё тело.
Ключевая идея: инвариантные признаки
Работа Bradly Stadie, Pieter Abbeel и Ilya Sutskever «Third-Person Imitation Learning» (2017) предложила подход, который стал отправной точкой для направления. Его суть — научить модель извлекать признаки, которые не зависят от точки зрения.
Механизм построен на состязательности. В систему добавляется классификатор домена, который пытается по признакам угадать, откуда взято наблюдение — из демонстрации эксперта или из попытки агента. Энкодер признаков, наоборот, обучается так, чтобы этот классификатор ошибался. Когда классификатор больше не может отличить домены, признаки становятся инвариантными к ракурсу и телу — и на их основе уже можно строить награду для обучения с подкреплением.
Идея близка к domain-adversarial обучению из работ по переносу знаний: градиент от доменного классификатора разворачивается (gradient reversal), заставляя энкодер убирать из представления всё, что выдаёт источник данных.
Из чего складывается система
- Энкодер признаков — превращает кадр в вектор, из которого убрана информация о ракурсе и о том, кто действует.
- Доменный классификатор — противник, который на этапе обучения давит энкодер, требуя от него инвариантности.
- Функция награды — оценивает, насколько наблюдение агента похоже на успешное состояние из демонстрации.
- Политика (policy) — собственно стратегия действий агента, обучаемая методом с подкреплением на этой награде.
Чем это отличается от соседних подходов
Third-person imitation легко спутать с несколькими родственными направлениями. Разница — в том, что именно доступно агенту на входе.
| Подход | Что даётся агенту | Главная сложность |
|---|---|---|
| Behavioral cloning | Пары «наблюдение — действие» от первого лица | Ошибки накапливаются, нужен большой датасет |
| Inverse RL | Траектории эксперта от первого лица | Восстановить функцию награды дорого |
| Third-person imitation | Видео эксперта со стороны, без действий | Перенос между ракурсами и телами |
| Video pretraining (например, обучение по роликам) | Массив немаркированного видео | Извлечь полезный сигнал из шумных данных |
Отдельно стоит упомянуть эксперименты вроде обучения агентов Minecraft по видео с YouTube (OpenAI VPT, 2022) — там модель сначала училась размечать действия по кадрам, а потом обучалась на огромном массиве роликов. Это не то же самое, что third-person imitation в узком смысле, но мотивация общая: научиться на данных, которые не собирались специально под робота.
Где это реально нужно
Ценность подхода — в стоимости данных. Собрать телеметрию с самого робота — это часы работы оператора на каждый навык. А видео, где человек моет посуду, складывает бельё или собирает конструктор, уже существуют в избытке.
- Робототехника. Обучить манипулятор по видео человека, а не по дорогим кинестетическим демонстрациям, где оператор физически водит рукой робота.
- Игровые агенты. Учиться по записям чужих прохождений, снятых с чужого экрана и интерфейса.
- Симуляция и sim-to-real. Переносить поведение между разными телами агентов и между симулятором и реальностью, где картинка заведомо отличается.
Что мешает довести до продакшена
Состязательное обучение нестабильно: энкодер и доменный классификатор легко входят в дисбаланс, и обучение разваливается. Награда, построенная на близости признаков, бывает обманчивой — агент находит состояние, похожее на целевое по признакам, но бесполезное по сути (reward hacking).
Второй барьер — насколько сильно различаются тела. Пока ракурс и морфология близки, метод работает. Когда у эксперта рука человека, а у агента гусеничная платформа с одним манипулятором, соответствие между их действиями становится настолько неоднозначным, что одного инвариантного представления мало — нужны дополнительные предпосылки о структуре задачи.
Наконец, оценка. Понять, действительно ли агент понял намерение, а не просто подогнался под конкретную демонстрацию, тяжело: нужны новые ракурсы и новые условия на этапе теста, а не те же, что при обучении.
* Domain shift — расхождение между распределением данных, на которых модель училась, и данными, которые она видит в работе. В данном случае — разница между тем, как задача выглядит в демонстрации эксперта и в наблюдениях самого агента.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Stadie, Abbeel, Sutskever. Third-Person Imitation Learning (arXiv:1703.01703), OpenAI. Learning to Play Minecraft with Video PreTraining (VPT)
Частые вопросы
Чем third-person imitation отличается от обычного imitation learning?
Нужны ли размеченные действия эксперта?
Почему используется состязательное обучение?
Работает ли это, если робот сильно отличается от человека по устройству?
Это то же самое, что обучение агентов по видео с YouTube?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.