Мета-обучение с подкреплением: почему агент учится исследовать
Обычный RL-агент осваивает одну задачу за миллионы шагов. Мета-RL учит агента учиться быстро — но упирается в проблему исследования. Разбираем, где это ломается и что с этим делают.

С чем связана проблема
Классический агент обучения с подкреплением (RL) осваивает игру Atari или манипулятор за десятки миллионов взаимодействий со средой. Человек справляется с новой похожей задачей за пару попыток, потому что переносит опыт с прошлых. Мета-обучение с подкреплением (meta-RL) пытается воспроизвести именно это: не решить конкретную задачу, а научить агента быстро адаптироваться к целому семейству задач.
Идея звучит красиво, но на практике вся сложность стягивается в один узел — исследование (exploration). Чтобы адаптироваться к новой задаче за несколько эпизодов, агент должен сначала понять, чем эта задача отличается от других: где спрятана награда, как устроена динамика. Это отдельное поведение, которому тоже нужно научиться, и учится оно плохо.
Что такое meta-RL в двух определениях
В meta-RL агент обучается на распределении задач, а не на одной. Внутри одного «испытания» (trial) он получает несколько эпизодов взаимодействия с конкретной задачей и должен по ходу дела улучшать свою стратегию. Внешний цикл настраивает параметры так, чтобы на новой задаче из того же распределения агент адаптировался максимально быстро.
Формально задача из распределения — это отдельный марковский процесс принятия решений1 с общей структурой, но разными параметрами: положение цели, коэффициенты вознаграждения, переходы между состояниями.
Где ломается исследование
Разделим поведение агента на две фазы, которые в meta-RL часто смешиваются:
- Исследовательская фаза — агент собирает информацию о том, какая именно задача перед ним. Награда здесь может быть нулевой или даже отрицательной: агент жертвует текущим результатом ради знания.
- Эксплуатационная фаза — агент использует собранную информацию, чтобы максимизировать награду.
Проблема в том, что стандартная цель обучения награждает только за итоговый результат. Полезное исследование окупается с задержкой и не в том эпизоде, где оно случилось. Градиент почти не «видит» связь между разведкой в первом эпизоде и выигрышем в третьем. В результате агент часто выучивает вырожденную стратегию: не исследовать вовсе и играть по усреднённому сценарию, который на большинстве задач даёт средненький результат.
Агент, который не исследует, не проигрывает громко. Он проигрывает тихо — стабильно средним результатом на каждой задаче, и этого хватает, чтобы градиент перестал искать что-то лучше.
Проблема присвоения кредита во времени
Ключевая трудность — присвоение кредита (credit assignment) между эпизодами. Действие «сходить проверить дальний угол» приносит награду не сейчас, а когда агент вернётся туда за целью. Чем длиннее горизонт между разведкой и её окупаемостью, тем слабее обучающий сигнал.
Три семейства подходов
Способы научить агента исследовать делятся на несколько направлений. Ни одно не является универсальным — у каждого своя цена.
| Подход | Идея | Слабое место |
|---|---|---|
| Рекуррентные политики (RL²-подобные) | Скрытое состояние сети накапливает опыт по эпизодам, исследование возникает «само» | Часто сваливается в отказ от исследования; чувствителен к длине контекста |
| Градиентная адаптация (MAML-подобные) | Ищутся параметры, из которых пара шагов градиента даёт хорошую политику для задачи | Требует награды на новой задаче уже на этапе адаптации; исследование не выделено явно |
| Задачно-обусловленные / переменные задачи | Отдельно оценивается «переменная задачи», исследование награждается за снижение неопределённости | Нужен доступ к идентификатору задачи при обучении или модель неопределённости |
Почему разделение фаз помогает
Один из рабочих приёмов — явно отделить исследование от эксплуатации и вознаграждать разведку не за награду среды, а за уменьшение неопределённости о том, какая перед агентом задача. Тогда обучающий сигнал появляется сразу: собрал полезную информацию — получил внутреннюю награду, даже если внешняя пока ноль.
Цена такого подхода — необходимость как-то измерять неопределённость. Обычно это делают через ошибку предсказания модели среды или через расхождение апостериорных распределений над переменной задачи. И то, и другое — дополнительные движущиеся части, которые сами могут обучаться нестабильно.
Что стоит держать в голове перед экспериментом
- Проверьте, есть ли вообще стимул исследовать. Если задачи распределения слишком похожи, оптимальная стратегия — не исследовать, и это не баг алгоритма.
- Разведите фазы в метрике. Отдельно смотрите на награду в первом эпизоде испытания и в последнем: рост от первого к последнему и есть адаптация.
- Следите за коллапсом исследования. Если поведение агента не зависит от того, какая задача перед ним, — обучение свалилось в усреднённую политику.
- Оцените горизонт присвоения кредита. Чем позже окупается разведка, тем слабее сигнал и тем важнее внутренняя награда или память.
- Не сравнивайте с single-task RL напрямую. Мета-агент проигрывает на одной фиксированной задаче, но выигрывает на скорости адаптации по всему распределению.
Оценка: не путайте сходимость с адаптацией
Частая ошибка — оценивать meta-RL по финальной награде на одной задаче. Правильнее измерять кривую внутри испытания: насколько награда растёт от эпизода к эпизоду при фиксированных параметрах агента. Если она плоская — адаптации нет, даже если абсолютное число выглядит прилично.
1 Марковский процесс принятия решений (MDP) — формальная модель задачи RL: множества состояний и действий, функция переходов между состояниями и функция вознаграждения. «Марковский» означает, что будущее зависит только от текущего состояния, а не от всей истории.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: RL²: Fast Reinforcement Learning via Slow Reinforcement Learning (arXiv), Model-Agnostic Meta-Learning (MAML), arXiv
Частые вопросы
Чем meta-RL отличается от обычного transfer learning?
Почему агент вообще отказывается исследовать?
Обязательно ли знать идентификатор задачи при обучении?
Как понять, что мой агент действительно адаптируется?
Стоит ли ждать, что meta-RL обгонит single-task RL на одной задаче?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.