Как роботов учат хватать вслепую: домен-рандомизация и генеративные модели
Робот, обученный в симуляторе, в реальности промахивается мимо кружки. Домен-рандомизация и генеративные модели закрывают этот разрыв — и меняют экономику обучения манипуляторов.

Робот тренируется в симуляторе миллионы раз, доводит захват предмета до идеала, а потом на реальном столе промахивается мимо кружки. Причина не в железе — в разрыве между картинкой из симулятора и настоящей камерой: другие блики, тени, текстуры, шум сенсора. Этот разрыв называют sim-to-real gap, и два подхода к его закрытию — домен-рандомизация и генеративные модели — сейчас определяют, сколько стоит научить манипулятор брать незнакомые вещи.
Почему обучение в реальности почти не масштабируется
Собрать датасет захватов на живом роботе — дорого и медленно. Одна попытка занимает секунды, а между ними нужно вернуть предмет на место, иногда руками оператора. Известный проект Google «arm farm» в середине 2010-х гонял до 14 манипуляторов параллельно неделями, чтобы набрать сотни тысяч попыток. Симулятор делает то же самое за часы и без износа сервоприводов.
Проблема в том, что политика, идеально работающая в симуляторе, видит там стерильную сцену: ровный свет, чистые текстуры, точную физику трения. Реальная камера подсовывает совсем другое распределение пикселей. Модель, переобученная на «красивый» синтетический мир, в жизни ломается на первой же тени.
Что именно расходится
- Визуал — освещение, отражения, цвет и текстура поверхностей, фон, шум матрицы.
- Физика — коэффициенты трения, масса предмета, люфты и задержки привода.
- Геометрия — реальные объекты неидеальны: вмятины, прозрачность, блеск, которых не было в CAD-модели.
Домен-рандомизация: не угадать реальность, а перекрыть её
Идея, которую в 2017 году сформулировала команда OpenAI и соавторы, звучит контринтуитивно. Вместо того чтобы делать симулятор максимально похожим на реальность, его делают максимально разным. На каждой итерации обучения случайно меняют цвета, текстуры, положение и яркость источников света, углы камеры, параметры физики.
Если модель во время обучения видела тысячи вариантов освещения и текстур, реальный мир для неё становится просто ещё одним вариантом из уже знакомого распределения.
Робот перестаёт запоминать конкретные пиксели и учится опираться на устойчивые признаки — форму, границы, взаимное расположение. Именно так удавалось переносить обученную в симуляторе политику на реальный манипулятор без единой попытки на живом железе (zero-shot transfer).
Границы подхода
Рандомизация «в лоб» имеет цену. Чем шире диапазон вариаций, тем сложнее задача обучения: политике приходится справляться с абсурдными сочетаниями текстур и физики, которых в реальности не бывает. Обучение замедляется, а итоговая точность может просесть. Отсюда выросло направление автоматической домен-рандомизации, где диапазоны вариаций подстраивают по ходу обучения, а не задают руками.
Генеративные модели: синтетика, неотличимая от реальности
Второй путь противоположен по духу. Вместо намеренного хаоса — попытка сгенерировать данные, которые статистически близки к реальным. Здесь работают несколько семейств моделей:
- GAN и image-to-image перенос — берут синтетический кадр из симулятора и «перекрашивают» его в фотореалистичный стиль, сохраняя геометрию сцены. Классический пример подхода — CycleGAN для переноса стиля без парных данных.
- Диффузионные модели — генерируют разнообразные сцены с предметами, фонами и освещением по текстовому или структурному условию. Их всё чаще используют как «фабрику» синтетических датасетов для восприятия.
- Нейронные рендереры и 3D-генерация — восстанавливают объёмные модели предметов, которые можно расставлять в сцене под любым углом и светом.
Ключевое отличие от рандомизации: генеративная модель старается держаться внутри распределения реальных изображений, а не расширять его до бесконечности. Для задач, где важна фотореалистичность (прозрачное стекло, металлический блеск, мелкая текстура), это работает точнее.
Гибрид как рабочая практика
На практике два подхода всё чаще совмещают. Базовое разнообразие сцен даёт домен-рандомизация, а генеративная модель поверх «дотягивает» реализм визуала. Так покрывается и вариативность (робот не переобучается на один стиль), и достоверность (картинка похожа на то, что увидит камера).
Сравнение подходов
| Критерий | Домен-рандомизация | Генеративные модели |
|---|---|---|
| Основная идея | Расширить распределение до охвата реальности | Приблизить синтетику к реальному распределению |
| Стоимость данных | Низкая, всё в симуляторе | Выше: обучение и инференс генератора |
| Фотореализм | Не требуется и часто намеренно ломается | Ключевая цель |
| Риск | Слишком широкий диапазон тормозит обучение | Генератор может воспроизвести свои артефакты |
| Где сильнее | Устойчивость к неизвестным условиям | Сложные материалы: стекло, металл, блеск |
Что это меняет для инженера
Выбор между подходами — это выбор, где тратить бюджет: на вычисления в симуляторе или на разметку и генерацию реалистичных данных. Ориентиры простые:
- Если сцена геометрически проста, а объекты матовые — начинайте с домен-рандомизации, она дешевле и часто достаточна.
- Если в наборе прозрачные или зеркальные предметы, где физика бликов критична — подключайте генеративный реализм.
- Если zero-shot перенос не даёт нужной точности — оставьте небольшой набор реальных попыток на дообучение (fine-tuning), это обычно дешевле полного сбора данных.
- Проверяйте разрыв метрикой на реальном железе, а не только в симуляторе: успех в симе ничего не гарантирует.
Общий тренд последних лет — не спор «или-или», а конвейер: генеративная модель делает разнообразную реалистичную синтетику, поверх идёт рандомизация оставшихся параметров, а финальная калибровка происходит на минимальном объёме реальных данных.
Sim-to-real gap — расхождение между поведением модели в симуляторе и в реальном мире; из-за него политика, идеальная в симуляции, может проваливаться на живом роботе.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Tobin et al. Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (arXiv), OpenAI. Solving Rubik's Cube with a Robot Hand (Automatic Domain Randomization)
Частые вопросы
Чем домен-рандомизация принципиально отличается от простой аугментации данных?
Можно ли вообще обойтись без реальных данных?
Что дороже — домен-рандомизация или генеративные модели?
Не воспроизведёт ли генеративная модель собственные артефакты вместо реальности?
Подходят ли эти методы только для захвата или для других задач тоже?
Диффузионные модели вытеснят GAN в генерации обучающих данных?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.