Multi-goal RL: как один агент учится решать десятки задач
Мультицелевое обучение с подкреплением заставляет агента добиваться не одной цели, а любой из заданного множества. Разбираем, зачем это нужно в робототехнике и почему разреженные награды ломают привычные подходы.

Классический агент обучения с подкреплением решает одну задачу: довести шест до вертикали, дойти до выхода из лабиринта, набрать максимум очков в игре. В робототехнике так не работает. Манипулятор должен уметь взять кубик и поставить его в произвольную точку, а не в одну заранее прошитую. Отсюда мультицелевое обучение с подкреплением (multi-goal RL): агент получает цель как часть входа и учится достигать любой цели из непрерывного или дискретного множества. Ключевая боль такой постановки — разреженная награда: пока робот не попал точно в цель, сигнала почти нет, а случайно попасть в нужную точку в трёхмерном пространстве почти невозможно.
Что отличает multi-goal от обычного RL
В стандартной формулировке политика π(a|s) зависит только от состояния. В мультицелевой постановке добавляется цель g, и политика становится условной: π(a|s, g). Награда тоже зависит от цели — обычно это индикатор «достигли или нет» с порогом по расстоянию.
Именно бинарная награда делает задачу тяжёлой. Представьте робота-манипулятора, которому нужно передвинуть шайбу в заданную точку стола. Пока шайба не окажется в пределах, скажем, нескольких сантиметров от цели, агент получает ноль. Миллионы случайных движений подряд дают одинаковый нулевой сигнал, и градиенту не за что зацепиться.
Разреженная награда честнее плотной: она не заставляет инженера вручную придумывать, за что поощрять агента на каждом шаге. Но именно поэтому она почти неусваиваема без специальных приёмов переиспользования опыта.
Hindsight Experience Replay — главный трюк
Прорыв в области связан с идеей задним числом переосмысливать неудачи. Метод Hindsight Experience Replay (HER)1 работает так: агент промахнулся мимо цели g, но он куда-то всё же пришёл — в состояние g'. Значит, эту же траекторию можно сохранить в буфер как успешный пример достижения цели g'. Одна неудачная попытка превращается в обучающий сигнал.
Формально в реплей-буфер добавляются переходы с подменённой целью, и разреженная награда внезапно становится плотной: почти каждая траектория чему-то учит. HER обычно комбинируют с off-policy алгоритмами вроде DDPG, SAC или TD3 — им всё равно, из какого распределения пришли данные.
Стандартный набор сред для робототехники
Чтобы результаты разных команд можно было сравнивать, сложился набор эталонных сред на основе физического движка MuJoCo и симулятора манипулятора Fetch и антропоморфной кисти Shadow Hand. Эти окружения долго жили внутри Gym, а после реорганизации проекта переехали в отдельный пакет Gymnasium-Robotics.
| Среда | Что делает агент | Сложность |
|---|---|---|
| FetchReach | Довести схват до точки в пространстве | Базовая, решается быстро |
| FetchPush | Толкнуть кубик в целевую позицию | Средняя |
| FetchPickAndPlace | Взять кубик и поставить в точку, в том числе в воздухе | Высокая |
| FetchSlide | Толчком отправить шайбу в недосягаемую рукой зону | Высокая |
| HandManipulate | Повернуть объект кистью с 20+ степенями свободы в заданную ориентацию | Очень высокая |
Кисть Shadow Hand — самый жёсткий случай: пространство действий многомерное, контактная динамика хаотична, а цель задаётся кватернионом ориентации. Здесь даже HER выходит на плато, и именно поэтому среды остаются открытым вызовом.
Как устроено наблюдение
В мультицелевых средах наблюдение обычно приходит словарём с тремя ключами:
- observation — состояние робота и объектов: позиции, скорости, углы;
- achieved_goal — цель, которая по факту достигнута в текущем состоянии (например, реальная позиция кубика);
- desired_goal — цель, которую нужно достичь.
Такое разделение не косметика: именно наличие achieved_goal позволяет HER механически подменять цель, беря то, что уже произошло, как то, чего мы якобы добивались.
Почему это до сих пор открытая проблема
HER не панацея. На задачах с кистью и на длинных последовательных манипуляциях у методов остаются системные слабости.
- Плато на сложных средах. На поворотах объекта кистью успех застревает и не растёт даже при огромных бюджетах обучения.
- Перенос из симуляции в реальность. Политика, обученная в MuJoCo, ломается на реальном железе из-за разницы в динамике и шуме сенсоров — так называемый sim-to-real gap.
- Составные задачи. Когда цель требует нескольких подцелей подряд, разреженная награда снова становится непреодолимой без иерархии или декомпозиции.
- Эффективность по данным. Off-policy методы жадны до сэмплов; миллионы шагов симуляции — это дорого, а на реальном роботе почти нереально.
Отдельная тема — как задавать цели во время обучения. Если брать их равномерно, агент тратит время на слишком лёгкие и слишком трудные цели. Подходы вроде автоматической генерации учебной программы (automatic curriculum) пытаются подбирать цели «по силам» текущей политике, но универсального рецепта нет.
Мультицелевые среды ценны не тем, что их кто-то окончательно решил, а тем, что на них видно, где именно ломаются современные алгоритмы. Это скорее список нерешённых вопросов, чем витрина достижений.
С чего начать эксперименты
Практический маршрут для того, кто хочет воспроизвести baseline и двинуться дальше:
- поставьте Gymnasium-Robotics и MuJoCo, начните с FetchReach — она решается за минуты и проверяет, что связка работает;
- возьмите готовую реализацию SAC или TD3 с поддержкой словарных наблюдений и подключите HER-обёртку буфера;
- перейдите к FetchPush и FetchPickAndPlace — здесь без HER результат будет около нуля, и разница станет наглядной;
- только потом беритесь за HandManipulate, закладывая заметно больший бюджет шагов и терпение к плато.
Точные версии пакетов, интерфейсы сред и лицензию MuJoCo сверяйте по актуальной документации Gymnasium-Robotics — API менялось при миграции из Gym, и старые сниппеты из туториалов трёхлетней давности могут не запуститься как есть.
1 Hindsight Experience Replay (HER) — приём переиспользования опыта, при котором неудачная траектория сохраняется в буфер повторно, но с целью, которая по факту была достигнута. Это превращает разреженный нулевой сигнал в набор полезных положительных примеров.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Gymnasium-Robotics — документация сред, Andrychowicz et al., Hindsight Experience Replay (arXiv)
Частые вопросы
Чем multi-goal RL отличается от обычного обучения с подкреплением?
Почему разреженная награда так усложняет обучение?
Что делает Hindsight Experience Replay?
Какие среды считаются стандартными для этой области?
Почему задача до сих пор считается открытой, если HER уже придумали?
Можно ли обучать такие политики сразу на реальном роботе?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.