Планировать онлайн, учиться офлайн: контроль на основе модели
Модель мира учится на прошлом опыте, а планирование происходит в момент действия. Такой подход помогает роботам и агентам исследовать среду быстрее, чем классическое обучение с подкреплением.

С чего начинается проблема
Классический агент обучения с подкреплением проходит миллионы шагов взаимодействия со средой, прежде чем начинает вести себя разумно. Для видеоигры это приемлемо: симулятор запускается быстро и стоит копейки. Для физического робота каждый шаг — это износ моторов, риск сломать оборудование и минуты реального времени. Идея PlanGAN и родственных подходов из семейства model-based control проста: разделить два процесса, которые обычно склеены в один. Модель среды учится медленно и офлайн, а решения принимаются онлайн — прямо во время действия, через планирование внутри выученной модели.
Термин из заголовка оригинальной работы — plan online, learn offline — описывает ровно эту развязку. Агент не заучивает готовую политику «состояние — действие». Он держит в голове модель динамики и в каждый момент прогоняет через неё несколько траекторий, выбирая ту, что ведёт к цели.
Что такое model-based control простыми словами
В model-free подходах (DQN, PPO, SAC) агент напрямую учит функцию, которая по состоянию выдаёт действие или его ценность. Модели среды у него нет — только накопленный опыт, свёрнутый в веса нейросети.
В model-based подходе агент сначала строит модель мира1 — функцию, которая по текущему состоянию и действию предсказывает следующее состояние. Дальше эту модель используют как внутренний симулятор: можно мысленно «проиграть» разные последовательности действий, не трогая реальную среду.
Обучение с подкреплением без модели похоже на заучивание маршрута наизусть. Model-based control — это карта: медленнее в построении, но по ней можно проложить путь к любой точке, а не только к той, которую вы уже проходили.
Ключевое различие в том, где происходит вычисление. Планирование онлайн означает, что в момент действия агент решает задачу оптимизации: какая траектория в модели даёт лучший результат. Обучение офлайн означает, что сама модель и вспомогательные компоненты обновляются отдельно, на собранных ранее данных.
Почему это ускоряет исследование
Исследование среды (exploration) — вечная боль RL. Агент должен пробовать новое, но случайные действия почти всегда бесполезны. Когда у агента есть модель, он может целенаправленно искать состояния, в которых модель ошибается или не уверена, и идти именно туда. Это превращает исследование из лотереи в осмысленный процесс: «сходи туда, где ты меньше всего знаешь».
Практический эффект — резкое снижение числа взаимодействий с реальной средой. Там, где model-free агенту нужны миллионы шагов, model-based методы нередко укладываются в десятки тысяч. Точные цифры зависят от задачи и реализации, и сравнивать их корректно можно только на одинаковых бенчмарках.
Как устроен цикл plan-online / learn-offline
Обобщённо петля выглядит так:
- Сбор данных. Агент действует в среде и записывает переходы «состояние, действие, следующее состояние, награда».
- Обучение модели офлайн. На накопленном буфере обучается модель динамики — часто ансамбль нейросетей, чтобы оценивать неопределённость.
- Планирование онлайн. В момент действия агент сэмплирует множество кандидатных траекторий, прогоняет их через модель и выбирает первое действие лучшей траектории. Дальше — пересчёт на следующем шаге.
- Обновление буфера. Новый реальный опыт возвращается в шаг 1, и цикл повторяется.
Планирование чаще всего строят на методах вроде Model Predictive Control (MPC) или его стохастических вариантов — CEM (cross-entropy method), MPPI. Все они об одном: сгенерировать пачку вариантов, оценить их в модели, сместить распределение в сторону лучших и повторить.
Роль неопределённости модели
Модель мира неизбежно врёт — особенно в областях, где данных мало. Если планировщик слепо доверяет её прогнозу, он найдёт «жульнические» траектории, которые в модели выглядят прекрасно, а в реальности разваливаются. Отсюда — ансамбли и оценка разброса предсказаний. Планировщик штрафует траектории, уходящие в зоны высокой неопределённости, либо, наоборот, поощряет заход туда на этапе исследования. Один и тот же сигнал используется двояко: осторожно при эксплуатации и жадно при разведке.
Сравнение подходов
| Свойство | Model-free (PPO, SAC) | Model-based control (plan online) |
|---|---|---|
| Что учится | Политика / функция ценности | Модель динамики среды |
| Где принимается решение | Прямой прогон политики | Планирование в момент действия |
| Данные из среды | Много (часто миллионы шагов) | Обычно на порядки меньше |
| Стоимость шага действия | Низкая (один прогон сети) | Выше (много прогонов при планировании) |
| Слабое место | Дорогое исследование | Ошибки модели накапливаются |
Вывод из таблицы не «один лучше другого», а разный профиль затрат. Model-free дёшев в момент действия, но прожорлив по данным. Model-based экономит взаимодействия, но платит вычислениями при каждом решении и рискует унаследовать ошибки модели.
Где это применимо на практике
- Робототехника. Реальный робот не может позволить себе миллионы падений. Экономия шагов здесь превращается в реальные деньги и целые манипуляторы.
- Управление процессами. Химические установки, энергосети, HVAC — среды, где эксперимент вживую дорог или опасен.
- Задачи с разреженной наградой. Когда положительный сигнал приходит редко, целенаправленное исследование через модель работает заметно лучше случайного тыка.
Чего ждать не стоит
Model-based control — не магия. На средах с очень сложной, хаотичной или частично наблюдаемой динамикой построить достаточно точную модель тяжело, и накопление ошибки на длинных горизонтах планирования сводит выигрыш на нет. В таких случаях гибриды — где модель ускоряет обучение политики, но не заменяет её полностью — часто оказываются устойчивее.
1 Модель мира (world model) — обучаемая функция, которая предсказывает, как изменится состояние среды в ответ на действие агента. Может предсказывать следующее состояние напрямую или его сжатое латентное представление.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Plan Online, Learn Offline: Efficient Learning and Exploration via Model-Based Control (arXiv)
Частые вопросы
Чем model-based RL отличается от model-free по сути?
Почему планирование делают онлайн, а обучение офлайн?
Что такое MPC и CEM в этом контексте?
Почему модель среды нельзя просто использовать как есть?
Насколько сильно этот подход экономит данные?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.