LOLA: как научить ИИ-агента учитывать обучение соперника
Обычные обучающиеся агенты в играх вроде «дилеммы заключённого» скатываются к взаимному предательству. LOLA — метод, где агент моделирует, как его действия меняют обучение оппонента, и это выводит систему к сотрудничеству.

Проблема, из-за которой два ИИ грызут друг друга
Возьмите двух обучающихся агентов и посадите их играть в повторяющуюся дилемму заключённого. Каждый оптимизирует свою награду градиентным спуском, не заглядывая в голову соперника. Итог предсказуем: оба сходятся к взаимному предательству — устойчивому, но невыгодному равновесию. Каждый в отдельности рационален, вместе они проигрывают.
Метод Learning with Opponent-Learning Awareness (LOLA), представленный в 2017 году исследователями из OpenAI, University of Oxford и UC Berkeley, ломает этот сценарий одним допущением: агент считает, что его оппонент — тоже обучающийся, а не неподвижная мишень. И оптимизирует не текущую награду, а награду после того, как оппонент сделает свой шаг обучения.
Что делает наивный агент — и почему это тупик
Стандартный многоагентный подход — это независимое обучение с подкреплением. Агент A обновляет свои параметры так, будто параметры агента B зафиксированы. Агент B делает то же самое. Оба игнорируют, что их шаги обучения влияют друг на друга.
В нестационарной среде — а среда, где второй игрок тоже учится, именно такая — это приводит к нестабильности и к «жадным» равновесиям. В повторяющейся дилемме заключённого наивные градиентные агенты почти всегда приходят к тому, что оба всегда предают (стратегия all-defect).
Ключевая идея LOLA: не «как мне сыграть лучше против того, кто есть», а «как мне сыграть, чтобы соперник в результате своего обучения стал играть выгоднее для меня».
Как работает LOLA
Наивный агент максимизирует ожидаемую награду по своим параметрам θ¹ при фиксированных параметрах оппонента θ². LOLA-агент вместо этого смотрит на один предполагаемый шаг обучения оппонента: он представляет, что θ² изменится на величину градиентного обновления Δθ², и оптимизирует свою награду уже с учётом этого изменения.
Технически это добавляет в градиент дополнительный член — производную второго порядка, которая связывает обучение одного агента с обучением другого. Именно этот член заставляет агента учитывать, что его собственная стратегия формирует стимулы соперника.
Что из этого следует на практике
- В итерированной дилемме заключённого пара LOLA-агентов выходит на стратегию, близкую к «око за око» (tit-for-tat), и достигает взаимного сотрудничества.
- Появляется устойчивость к эксплуатации: агент не даёт себя бесконечно обыгрывать, потому что моделирует реакцию соперника на предательство.
- Метод работает и в играх с более чем двумя игроками, и в задачах, где стратегия задаётся нейросетью, а не таблицей.
Цена метода
Точный LOLA требует вторых производных и, в оригинальной формулировке, доступа к параметрам оппонента или их оценке. Это дороже наивного обучения и не всегда реалистично: в реальной среде вы редко видите веса чужой модели. Отсюда выросли расширения — например, оценка градиентов оппонента без доступа к его параметрам и более корректные формулировки, устраняющие смещение исходного метода.
LOLA и его наследники
LOLA стал отправной точкой для целого семейства методов дифференцируемого учёта обучения оппонента. У исходной версии есть известные слабые места: она не сходится к стабильным неподвижным точкам в некоторых играх и вносит смещение в оценку. Последующие работы это чинили.
| Метод | Идея | Что решает |
|---|---|---|
| Наивное обучение | Оппонент считается фиксированным | Базовый случай, часто расходится к предательству |
| LOLA | Учёт одного шага обучения оппонента | Выводит к сотрудничеству, но со смещением |
| LOLA-DiCE | Корректная оценка градиентов высшего порядка через оператор DiCE | Убирает смещение при оценке производных |
| Стабильные варианты (COLA, SOS и др.) | Учёт сходимости и последовательности | Лучшее поведение около неподвижных точек |
Точные формулировки и доказательства свойств стоит смотреть в оригинальных работах: это активная область, и детали у разных методов различаются.
Зачем это нужно за пределами игр-игрушек
Дилемма заключённого — не самоцель, а испытательный стенд. Реальные задачи, где несколько обучающихся систем взаимодействуют, встречаются в:
- алгоритмической торговле, где боты реагируют друг на друга;
- автономном транспорте, где машины разных производителей делят дорогу;
- рекомендательных и рекламных аукционах, где агенты конкурируют за показы;
- исследованиях по кооперации и безопасности ИИ, где важно, придут ли независимо обученные агенты к взаимовыгодному поведению или к разрушительному.
Вопрос «сойдутся ли независимо обученные агенты к сотрудничеству» перестаёт быть абстрактным ровно тогда, когда таких агентов в системе становится много. LOLA показывает, что ответ зависит не от доброты алгоритма, а от того, моделирует ли он обучение соседа.
Если хотите разобраться в деталях, начинать стоит с оригинальной статьи Foerster и коллег и её продолжения LOLA-DiCE, где вводится корректная оценка градиентов высших порядков.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Foerster et al., Learning with Opponent-Learning Awareness (arXiv:1709.04326), Foerster et al., DiCE: The Infinitely Differentiable Monte Carlo Estimator (arXiv:1802.05098)
Частые вопросы
Чем LOLA отличается от обычного обучения с подкреплением?
Почему наивные агенты в дилемме заключённого предают друг друга?
Нужен ли LOLA доступ к параметрам оппонента?
Всегда ли LOLA приводит к сотрудничеству?
Где LOLA применим на практике?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.