RL²: как научить агента учиться быстро через медленный RL
Идея RL² в том, чтобы обучить нейросеть не решать одну задачу, а быстро осваивать новые за считаные эпизоды. Разбираем, как это устроено и зачем это нужно.

Классический алгоритм обучения с подкреплением тратит миллионы шагов взаимодействия со средой, чтобы освоить одну задачу — например, пройти конкретный лабиринт. Человеку на новый лабиринт хватает нескольких попыток, потому что он уже знает, что такое лабиринты вообще. Подход RL² (Reinforcement Learning to Reinforcement Learn), предложенный в работе 2016 года группой исследователей во главе с Яном Дуаном, пытается перенести этот принцип в машину: обучить агента не решению задачи, а самой стратегии быстрого обучения.
Две петли обучения вместо одной
Название RL² — это «RL в квадрате»: обучение с подкреплением поверх обучения с подкреплением. У метода две вложенные петли.
- Медленная (внешняя) петля. Здесь обычным алгоритмом RL обучаются веса рекуррентной нейросети. Обучение идёт не на одной среде, а на целом распределении похожих задач — например, на множестве лабиринтов со случайной планировкой.
- Быстрая (внутренняя) петля. Когда обученная сеть встречает новую задачу, она адаптируется к ней прямо в процессе прохождения эпизодов, не меняя свои веса. Всю «память» о текущей задаче хранит скрытое состояние рекуррентной сети.
Ключевой трюк: агент видит не отдельные эпизоды, а серию эпизодов подряд как один длинный опыт. Награды, действия и флаг «эпизод закончился» подаются на вход сети следующего шага. Так сеть учится использовать неудачи первых попыток, чтобы действовать лучше в последующих — ровно то, что делает человек в новом лабиринте.
Веса сети кодируют не решение конкретной задачи, а алгоритм обучения. Обученная модель — это, по сути, выученный с нуля RL-алгоритм, зашитый в динамику рекуррентной сети.
Почему рекуррентность здесь принципиальна
Скрытое состояние RNN* играет роль рабочей памяти. Оно накапливает информацию обо всём, что агент уже попробовал в рамках текущей задачи: какие действия давали награду, где были стены, что сработало. Между задачами это состояние сбрасывается, а веса остаются прежними. Именно разделение «долгой» памяти в весах и «короткой» памяти в скрытом состоянии даёт эффект быстрой адаптации.
* RNN (рекуррентная нейросеть) — сеть, которая на каждом шаге получает не только текущий вход, но и своё состояние с предыдущего шага, за счёт чего может хранить контекст последовательности. В оригинальной работе RL² использовались ячейки GRU.
Что показали эксперименты
Авторы проверяли RL² на двух типах задач: искусственных, где известна теоретически оптимальная стратегия, и визуально сложных лабиринтах.
- Многорукие бандиты. Задача, где нужно выбирать между «ручками» с неизвестными вероятностями награды, балансируя разведку и эксплуатацию. Здесь есть почти оптимальные классические алгоритмы, и RL² подошёл к их уровню, не зная о них ничего — выучил похожее поведение сам.
- Табличные MDP. Небольшие случайно сгенерированные среды, где тоже можно посчитать, насколько агент близок к оптимуму.
- Визуальные лабиринты. Агент получал картинку от первого лица и должен был за несколько эпизодов найти цель в новом лабиринте. Первый эпизод уходил на разведку, последующие — на уверенное движение к цели по уже найденному маршруту.
Главный результат не в том, что RL² бьёт все методы по абсолютным цифрам, а в том, что он демонстрирует само явление: сеть, обученная на распределении задач, осваивает новую задачу за единицы эпизодов вместо миллионов шагов.
Где здесь конфликт и цена вопроса
RL² не бесплатный обед. Внешняя петля обучения по-прежнему требует огромного количества взаимодействий со средой — просто эта плата вносится один раз, заранее, на большом наборе задач. Ускорение получает только конечный пользователь модели на новых задачах из того же распределения.
Отсюда два практических ограничения:
- Обобщение только в пределах распределения. Если новая задача сильно отличается от тех, на которых училась внешняя петля, быстрой адаптации не будет — выученный «алгоритм обучения» рассчитан на знакомый класс сред.
- Длина эпизодов ограничена памятью RNN. Рекуррентное состояние удерживает контекст лишь до определённой длины последовательности, и на длинных горизонтах адаптации это становится узким местом.
Как RL² соотносится с соседними идеями
| Подход | Что адаптируется на новой задаче | Цена адаптации |
|---|---|---|
| Обычный RL | Веса сети под одну задачу | Миллионы шагов на каждую задачу |
| MAML (мета-обучение через градиент) | Веса, но из хорошей начальной точки | Несколько шагов градиентного спуска |
| RL² | Скрытое состояние RNN, веса заморожены | Несколько эпизодов, без дообучения весов |
RL² и MAML вышли примерно в одно время и решают одну проблему — мета-обучение, — но по-разному. MAML ищет удачную инициализацию весов, чтобы пара шагов градиентного спуска давали хороший результат. RL² вообще не трогает веса на новой задаче: вся адаптация происходит внутри прямого прохода сети.
Почему это важно сегодня
Идея «обучения через контекст без изменения весов» из RL² оказалась куда живучее самой статьи. То, что сегодня называют in-context learning у больших языковых моделей — способность решать новую задачу по нескольким примерам прямо в промпте, без дообучения, — это концептуально та же схема: медленное обучение зашивает в веса общую способность, а быстрая адаптация происходит в контексте на инференсе.
Для инженера, который строит агентов, вывод практичный: если у вас есть распределение похожих задач и дорогая среда, иногда выгоднее один раз заплатить за мета-обучение, чем каждый раз обучать агента с нуля. Но прежде чем закладывать это в проект, стоит честно оценить, насколько ваши будущие задачи действительно принадлежат одному распределению.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Duan et al. RL²: Fast Reinforcement Learning via Slow Reinforcement Learning (arXiv:1611.02779)
Частые вопросы
Чем RL² отличается от обычного обучения с подкреплением?
Меняются ли веса модели, когда RL²-агент решает новую задачу?
RL² быстрее классического RL?
Будет ли RL² работать на задаче, не похожей на обучающие?
Как RL² связан с in-context learning языковых моделей?
В чём разница между RL² и MAML?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.