GAN, обратное обучение с подкреплением и EBM: одна идея
Три семейства моделей — GAN, инверсное обучение с подкреплением и энергетические модели — на бумаге выглядят по-разному. Но под капотом у них общая математика, и это меняет то, как их проектируют и отлаживают.

Генеративно-состязательные сети (GAN), инверсное обучение с подкреплением (IRL) и энергетические модели (EBM) выросли в разных сообществах: одно занималось картинками, другое — роботами и играми, третье — статистической физикой и вероятностными моделями. На поверхности это три несвязанных инструмента. Формально же между ними есть точное соответствие: дискриминатор GAN, функция вознаграждения в IRL и энергия в EBM — это по сути одна и та же скалярная функция, которую обучают отличать реальные данные от сгенерированных.
Мысль о связи первым явно сформулировал Чэлси Финн с соавторами в работе 2016 года «A Connection Between Generative Adversarial Networks, Inverse Reinforcement Learning, and Energy-Based Models». Они показали, что конкретный алгоритм максимальной энтропии в IRL — это частный случай GAN с определённой формой дискриминатора. Ниже — почему это важно на практике, а не только для теоретиков.
Что делает каждая из трёх моделей
Чтобы увидеть общее, полезно свести все три к одной задаче: у нас есть распределение реальных данных, и мы хотим либо научиться его повторять, либо приписать высокие значения тому, что на него похоже.
- GAN. Генератор выдаёт образцы, дискриминатор оценивает, реальный это образец или поддельный. Две сети играют в минимаксную игру: генератор минимизирует то, что дискриминатор максимизирует.
- IRL. Есть демонстрации эксперта (траектории). Нужно восстановить функцию вознаграждения, при которой поведение эксперта выглядит оптимальным. По этой функции затем обучают агента.
- EBM. Модель приписывает каждому объекту скалярную энергию. Низкая энергия — высокая вероятность. Обучение сдвигает энергию вниз на реальных данных и вверх на всём остальном.
Разными словами описывается одно: обучаемая функция, которая отделяет «настоящее» от «ненастоящего», и генеративный процесс, который пытается эту функцию обмануть.
Где именно совпадает математика
Энергия — это отрицательный логарифм вероятности
В энергетической модели вероятность образца записывается как экспонента от минус энергии, делённая на нормировочную константу1. Проблема EBM всегда одна: эту константу (partition function) обычно нельзя вычислить, потому что она требует суммирования по всему пространству объектов. Приходится оценивать её через сэмплирование.
Максэнтропийный IRL порождает то же выражение
В подходе maximum entropy IRL вероятность траектории пропорциональна экспоненте от суммы вознаграждений вдоль неё. Это в точности форма распределения Больцмана из EBM, где роль отрицательной энергии играет вознаграждение. То есть восстановленное вознаграждение — это негатив энергии, а нормировочная константа — та же неберущаяся сумма по всем траекториям.
Дискриминатор GAN даёт способ обойти нормировку
Ключевой результат Финн с соавторами: если в GAN зафиксировать дискриминатор в специальной форме, где он выражается через плотность генератора и обучаемую функцию энергии, то оптимизация этого GAN эквивалентна обучению max-ent IRL. Генератор играет роль сэмплера, который приближает распределение Больцмана, а обучаемая функция внутри дискриминатора — это и есть вознаграждение (оно же отрицательная энергия). Так состязательная схема заменяет прямой подсчёт нормировочной константы.
Дискриминатор, функция вознаграждения и энергия — три названия одной обучаемой скалярной функции. Меняется только то, что играет роль сэмплера: явный генератор, политика агента или процедура MCMC.
Сравнение трёх ролей
| Что обучаем | GAN | Max-ent IRL | EBM |
|---|---|---|---|
| Скалярная функция | дискриминатор | вознаграждение | энергия (со знаком минус) |
| Источник образцов | генератор | политика агента | MCMC / сэмплер |
| Главная сложность | нестабильность игры | вложенная RL-оптимизация | оценка partition function |
| Данные | образцы (картинки и т. п.) | траектории эксперта | любые объекты |
Зачем это знать инженеру, а не только автору статьи
Связь между тремя семействами — не украшение для введения в диссертацию. Она даёт переносимые приёмы отладки и проектирования.
- Трюки стабилизации переносятся. Приёмы, которые придумали для стабилизации обучения GAN — градиентные штрафы, спектральная нормализация, регуляризация дискриминатора — применимы к энергетической функции в EBM и к вознаграждению в состязательном IRL, потому что это одна и та же функция.
- Диагностика становится общей. Если в GAN генератор коллапсирует в узкий набор образцов (mode collapse), в терминах EBM это значит, что сэмплер не покрывает моды энергетического ландшафта. Один и тот же симптом, один и тот же язык описания.
- Выбор архитектуры. Понимая, что состязательный IRL — это GAN, можно взять готовый каркас GAN и подставить в него политику вместо генератора. Именно так устроен алгоритм GAIL (Generative Adversarial Imitation Learning), появившийся в том же 2016 году.
Где связь ломается
Эквивалентность точная только при конкретных допущениях: специальная форма дискриминатора, максэнтропийная постановка IRL, доступ к плотности генератора. В обычном GAN дискриминатор не обязан иметь эту форму, и тогда прямого равенства нет — есть лишь родство идей. Не стоит выдавать это за то, что «любой GAN — это EBM»: это неверно. Верно, что существует семейство постановок, где три подхода совпадают, и оно достаточно широкое, чтобы приёмы перетекали между областями.
Практический вывод
Если вы обучаете генеративную модель, восстанавливаете вознаграждение по демонстрациям или строите энергетическую модель — вы решаете вариации одной задачи: оценить необъятную нормировочную константу через противопоставление реальных данных сгенерированным. Инструменты, наработанные в одной из трёх областей, стоит проверять в двух других, прежде чем изобретать своё.
1 Partition function (нормировочная константа, статистическая сумма) — сумма или интеграл экспонент от минус энергии по всем возможным объектам. Нужна, чтобы вероятности складывались в единицу. Её невычислимость в общем случае — центральная техническая трудность энергетических моделей.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Finn et al. A Connection Between GANs, Inverse Reinforcement Learning, and Energy-Based Models (arXiv:1611.03852), Ho & Ermon. Generative Adversarial Imitation Learning (arXiv:1606.03476)
Частые вопросы
Правда ли, что любой GAN — это энергетическая модель?
Что играет роль энергии в инверсном обучении с подкреплением?
Почему нельзя просто посчитать нормировочную константу напрямую?
Как связаны GAIL и разобранная теория?
Помогают ли приёмы стабилизации GAN при обучении EBM?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.