Как ИИ учится читать чужие стратегии в многоагентных средах
Агентные модели всё чаще действуют не в одиночку, а рядом с другими агентами. Чтобы предсказывать их поведение, исследователи учат нейросети сжимать чужую политику в вектор — и работать с ним как с обычным эмбеддингом.

Представьте переговорного бота, который торгуется за рекламные слоты против десятка других ботов, или беспилотник, который встраивается в поток из машин с разными настройками автопилота. Чтобы вести себя разумно, агенту недостаточно знать среду — ему нужно понимать, с кем он имеет дело: агрессивен ли сосед, склонен ли уступать, действует ли случайно. Задача обучения представлений политик (policy representation learning) как раз про это: превратить поведение другого агента в компактный вектор, который можно подать на вход своей модели.
Идея выросла из практической проблемы. В многоагентном обучении с подкреплением (MARL1) среда для каждого агента нестационарна: пока вы учитесь, соседи тоже меняют стратегию, и то, что вчера было оптимальным ответом, сегодня проваливается. Один из способов справиться — явно моделировать других: не пытаться угадать их следующее действие вслепую, а построить устойчивое представление их политики и обусловить на нём собственные решения.
Что именно кодируют
Политика агента — это отображение из наблюдений в действия (детерминированное или вероятностное). Напрямую сравнивать две политики тяжело: это функции, а не точки. Поэтому их проецируют в общее векторное пространство — эмбеддинг политики, где похоже ведущие себя агенты оказываются рядом, а непохожие — далеко.
Сложились несколько подходов к тому, из чего извлекать это представление:
- Из траекторий поведения. Модель наблюдает последовательности «состояние — действие» другого агента и кодирует их энкодером (RNN, трансформер, набор-инвариантный агрегатор). Это работает даже когда параметры чужой политики недоступны — виден только результат её действий.
- Из параметров сети. Если веса политики известны, представление можно строить прямо по ним. Проблема в том, что разные наборы весов задают одинаковое поведение, поэтому наивное сравнение параметров обманчиво.
- Через генеративную реконструкцию. Энкодер сжимает поведение в вектор, декодер пытается по нему восстановить действия агента. Чем лучше реконструкция, тем богаче представление — классическая схема автоэнкодера, перенесённая на политики.
- Контрастно. Модель учат сближать эмбеддинги траекторий одного агента и разводить эмбеддинги разных, без явного восстановления действий.
Ключевой сдвиг простой: перестать угадывать следующее действие соперника и начать оценивать, что он за агент. Первое ломается при смене контекста, второе переносится на новые ситуации.
Почему набор-инвариантность важна
Другого агента часто описывает не одна траектория, а набор эпизодов, порядок которых не несёт смысла. Значит, энкодер должен давать один и тот же результат независимо от перестановки входов — быть инвариантным к перестановкам. Отсюда популярность архитектур вроде агрегации через усреднение или внимание по множеству: они собирают эпизоды в единое представление, не завися от того, в каком порядке те поступили.
Где это уже применяют
Представления политик — не отдельная задача ради задачи, а строительный блок для нескольких направлений.
| Направление | Что даёт представление политики |
|---|---|
| Моделирование оппонента | Быстрее подстраиваться под конкретного соперника, не переобучая всю политику с нуля |
| Ad-hoc кооперация | Координироваться с незнакомыми напарниками, которых не было в обучении |
| Обобщение по популяции | Обучать одну политику, устойчивую к целому распределению соседей, а не к одному фиксированному |
| Диагностика и кластеризация | Группировать агентов по стилю поведения, находить аномалии в мультиагентной системе |
Особенно заметен эффект в ad-hoc teamwork — сценарии, где агент должен сработаться с партнёром, которого видит впервые. Если у него есть энкодер, быстро оценивающий стиль напарника по первым же ходам, он выбирает подходящую линию поведения, вместо того чтобы дорого доучиваться в реальном времени.
Что ломается на практике
Красивая схема упирается в несколько устойчивых трудностей, и о них честнее говорить сразу.
- Наблюдаемость. Часто виден лишь фрагмент поведения соседа — пара его ходов в общей сцене. По короткому фрагменту точно определить политику невозможно, и представление получается размытым.
- Смена политики на ходу. Если оппонент сам обучается, его «истинное» представление плывёт. Энкодер, обученный на снимках стратегий, отстаёт от реальности.
- Неоднозначность параметров. Одинаковое поведение при разных весах и разное поведение при близких весах делают представления по параметрам ненадёжными без дополнительной регуляризации.
- Оценка качества. Нет единой метрики «хорошести» эмбеддинга политики. Обычно смотрят на downstream-задачу — насколько лучше стал итоговый агент, — а это косвенный и шумный сигнал.
Цена вопроса
Явное моделирование других агентов стоит вычислений: дополнительный энкодер, буфер чужих траекторий, иногда отдельная фаза обучения на популяции агентов. Выигрыш оправдывает эти затраты не всегда. В средах с редким взаимодействием или почти статичными соседями более дешёвая политика без моделирования оппонента нередко работает не хуже. Прежде чем встраивать представления политик в свой пайплайн, стоит проверить, что нестационарность действительно мешает — иначе это усложнение ради усложнения.
Куда это движется
Заметный тренд — сближение с языковыми и мультимодальными моделями. Большие модели умеют строить представления последовательностей «из коробки», и их пробуют применять как энкодеры поведения: подавать историю действий агента как последовательность токенов и получать эмбеддинг его стратегии. Второе направление — представления, устойчивые к сдвигу популяции, чтобы обученный агент не рассыпался при встрече с соседями из другого распределения. Общая цель одна: агент, который перед тем как действовать, сначала быстро понимает, кто вокруг.
1 MARL (multi-agent reinforcement learning) — обучение с подкреплением, где несколько агентов учатся одновременно в общей среде, влияя на награды и наблюдения друг друга.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Частые вопросы
Чем представление политики отличается от простого предсказания следующего действия?
Нужен ли доступ к весам чужой политики?
Где это реально применяют, а не только в статьях?
Как понять, что представление получилось хорошим?
Стоит ли всегда встраивать моделирование других агентов?
Можно ли использовать для этого большие языковые модели?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.