Почему policy gradient и soft Q-learning — это одно и то же
За entropy-регуляризованным RL стоит математический факт: градиент политики и мягкий Q-learning оптимизируют один и тот же критерий и в пределе дают одну и ту же политику. Разбираем, откуда берётся эквивалентность и что она даёт на практике.

Долгое время policy-based и value-based методы в подкреплённом обучении жили в разных лагерях. REINFORCE и его наследники (A2C, TRPO, PPO) оптимизируют параметры политики напрямую по градиенту ожидаемой награды. Q-learning и DQN учат функцию ценности действий и выводят политику как argmax. В 2017 году сразу несколько работ — прежде всего Schulman et al., «Equivalence Between Policy Gradients and Soft Q-Learning» и статья про Soft Actor-Critic от Haarnoja и соавторов — показали, что при добавлении энтропийной регуляризации эти два подхода не просто похожи, а описывают одну и ту же оптимизацию. Разберём, что именно совпадает и почему это важно для того, кто пишет обучающий цикл руками.
Что такое entropy-регуляризованный RL
Классический RL максимизирует ожидаемую сумму наград. Энтропийно-регуляризованный вариант добавляет к каждой награде бонус за неопределённость политики:
J(π) = E[ Σ_t ( r(s_t, a_t) + α · H(π(·|s_t)) ) ]
Здесь H — энтропия распределения действий в состоянии, α — температура, задающая, насколько сильно мы поощряем разнообразие. При α → 0 задача вырождается в обычный RL: политика становится детерминированной. При больших α агент предпочитает вести себя случайно, лишь бы сохранить энтропию.
Смысл добавки прикладной. Она улучшает исследование пространства действий, делает обучение устойчивее к локальным оптимумам и — как выясняется — вскрывает связь между двумя семействами алгоритмов.
Мягкая функция ценности
В этой постановке жёсткий максимум по действиям заменяется на «мягкий» — логарифм суммы экспонент (log-sum-exp). Оптимальная soft value-функция определяется так:
V*(s) = α · log Σ_a exp( Q*(s, a) / α )
Q*(s, a) = r(s, a) + γ · E[ V*(s') ]
А оптимальная политика оказывается не argmax, а softmax по Q-значениям с той же температурой:
π*(a|s) = exp( ( Q*(s, a) - V*(s) ) / α )
Именно эта формула — мост между подходами. Политика здесь напрямую выражена через Q-функцию, а не обучается отдельным градиентом.
Где возникает эквивалентность
Ключевое наблюдение Schulman и соавторов: если параметризовать политику как softmax по некоторой обучаемой функции f_θ(s, a), то шаг градиента политики (policy gradient) и шаг обновления soft Q-learning изменяют параметры в одном и том же направлении — с точностью до слагаемых, которые обнуляются в оптимуме.
Грубо говоря, есть два способа прийти к той же самой softmax-политике:
- Снизу, через политику. Берём градиент энтропийно-регуляризованной цели по параметрам политики и делаем шаг. Это policy gradient с энтропийным бонусом — ровно то, что делают A2C и PPO с энтропийным членом в лоссе.
- Сверху, через ценность. Учим Q-функцию по мягкому уравнению Беллмана (с log-sum-exp вместо max) и выводим политику как softmax. Это soft Q-learning.
В пределе, когда обе процедуры сошлись, они дают одну политику и одну функцию ценности. Разница только в том, что мы считаем «первичным» объектом — распределение действий или таблицу ценностей.
Policy gradient и soft Q-learning — не конкуренты, а два параметрических взгляда на одну оптимизационную задачу. Выбор между ними — вопрос удобства, а не принципа.
Почему это не совпадение
Связь глубже, чем алгебраическое сходство формул. Энтропийная регуляризация превращает жёсткое уравнение Беллмана в гладкую задачу с единственным оптимумом по политике при фиксированных Q. Softmax-политика — это точное решение внутренней оптимизации «максимизировать ожидаемое Q плюс энтропия». Поэтому шаг по Q и шаг по политике смотрят на один и тот же ландшафт, просто с разных сторон.
Сравнение двух взглядов
| Аспект | Entropy policy gradient | Soft Q-learning |
|---|---|---|
| Что параметризуется | Политика π_θ(a|s) | Функция ценности Q_θ(s,a) |
| Как получается политика | Напрямую из сети | Softmax по Q / α |
| Тип обучения | Обычно on-policy | Часто off-policy, с replay buffer |
| Использование старых данных | Ограничено (нужна коррекция) | Естественно переиспользует |
| Роль температуры α | Вес энтропийного бонуса в лоссе | Масштаб внутри softmax и log-sum-exp |
Практический вывод: если данные дорогие и хочется выжимать максимум из replay-буфера, ближе soft Q-learning и его развитие Soft Actor-Critic. Если среда даёт много дешёвых траекторий и важна стабильность, привычнее энтропийный policy gradient вроде PPO.
Что это даёт на практике
Из эквивалентности вытекает несколько инженерных следствий, которые полезно держать в голове при реализации.
- Энтропийный бонус в PPO — не эвристика. Тот самый член
+ β · entropyв лоссе, который часто добавляют «для исследования», на самом деле привязывает алгоритм к строго определённой soft-оптимальной политике. Температура α = β имеет точный смысл, а не роль магического коэффициента. - Actor-critic получает теоретическую опору. Soft Actor-Critic напрямую эксплуатирует связь: критик учит soft Q, актёр подтягивается к softmax по нему. Оба обновления согласованы, потому что оптимизируют одну цель.
- Температуру можно настраивать автоматически. Раз α — реальный параметр задачи, её выводят как отдельную переменную, задав целевую энтропию. Это убирает ручной подбор коэффициента исследования.
- Диагностика упрощается. Если известны и Q, и политика, можно проверять их согласованность: расхождение между
softmax(Q/α)и текущей π_θ сигнализирует, что обучение ещё не сошлось.
Где эквивалентность ломается
Совпадение точно только в пределе и при определённых допущениях. На практике мешают несколько вещей:
- Функциональная аппроксимация: нейросеть не выражает softmax по Q идеально, накапливается ошибка.
- Конечная и часто малая α: при слишком маленькой температуре log-sum-exp численно приближается к max, и мягкость теряется вместе со связью.
- Off-policy данные требуют коррекции распределения, иначе градиент смещён.
Поэтому эквивалентность — это концептуальный ориентир и объяснение, почему методы работают похоже, а не гарантия, что два ваших конкретных прогона совпадут число в число.
Итог короткий. Стоит добавить в цель энтропию, и граница между «учим политику» и «учим ценность» стирается. Softmax-политика оказывается точным решением, к которому оба семейства методов идут разными маршрутами. Понимание этого не только красиво выглядит на доске, но и подсказывает, какие гиперпараметры на самом деле связаны и почему стоит доверять энтропийному члену в лоссе.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Schulman, Chen, Abbeel — Equivalence Between Policy Gradients and Soft Q-Learning (arXiv:1704.06440), Haarnoja et al. — Soft Actor-Critic (arXiv:1801.01290)
Частые вопросы
Значит ли это, что PPO и Soft Actor-Critic взаимозаменяемы?
Что физически означает температура α?
Почему используют log-sum-exp вместо обычного max?
Эквивалентность работает для непрерывных действий?
Нужен ли энтропийный бонус, если он усложняет цель?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.