Мультиагентный ИИ: как боты учатся врать, торговаться и дружить
Одиночная нейросеть отвечает на вопрос. Несколько агентов в одной среде начинают вести себя иначе: договариваться, обманывать и делить ресурсы. Разбираем, чему на самом деле учатся мультиагентные системы.

В 2017 году исследователи OpenAI выпустили простую среду MADDPG, где несколько агентов гонялись за целями и мешали друг другу. Уже там проявился неожиданный эффект: агенты, которых никто не программировал на кооперацию, самостоятельно распределяли роли — один отвлекал, другой достигал цели. С тех пор мультиагентное обучение прошло путь от игровых полигонов до систем, где несколько языковых моделей спорят, проверяют друг друга и совместно пишут код. Три навыка оказались в центре: кооперация, конкуренция и коммуникация. И каждый из них ведёт себя не так, как ожидали инженеры.
Почему один агент — это не то же самое, что несколько
Классическое обучение с подкреплением1 предполагает стабильную среду: агент действует, среда отвечает, агент корректирует поведение. Как только в той же среде появляется второй обучаемый агент, стабильность рушится. Для каждого из них оппонент — часть среды, но эта часть постоянно меняется, потому что тоже учится. Это называют нестационарностью: то, что было выигрышной стратегией на шаге 1000, становится проигрышной на шаге 5000, потому что противник адаптировался.
Отсюда практическая боль: обучение может не сходиться вовсе. Два агента гоняются за оптимальной стратегией друг против друга и попадают в циклы — как в «камень-ножницы-бумага», где нет устойчивого решения, кроме случайного выбора. Инженеры борются с этим централизованным обучением при децентрализованном исполнении: во время тренировки алгоритм видит действия всех агентов сразу, а в бою каждый агент опирается только на свои наблюдения.
Главная сложность мультиагентных систем не в том, что агентов много, а в том, что каждый из них — движущаяся мишень для остальных.
Кооперация: общая награда против «безбилетников»
Кооперативный сценарий выглядит проще всего: у агентов общая цель, награда делится на всех. Но именно здесь возникает проблема распределения заслуг. Если команда из пяти агентов получила +10, кто из них реально это заработал, а кто просто стоял рядом? Без ответа на этот вопрос появляется эффект «безбилетника»: агент учится ничего не делать, потому что награда всё равно приходит.
Алгоритмы вроде QMIX и его наследников пытаются разложить общую награду на индивидуальные вклады так, чтобы у каждого агента был стимул действовать. На практике это до сих пор нерешённая до конца задача — чем больше агентов, тем труднее отделить полезное действие от совпадения.
Где это уже применяют
- Логистика складов. Роботы Amazon и аналоги маршрутизируют грузы, избегая заторов, — это кооперативная задача с общим показателем пропускной способности.
- Управление трафиком. Светофоры как агенты, оптимизирующие поток на перекрёстках сразу по нескольким направлениям.
- Мультиагентные LLM-пайплайны. Одна модель пишет черновик, вторая критикует, третья исправляет — фреймворки вроде AutoGen и CrewAI построены на этом принципе.
Конкуренция: когда обман становится стратегией
В соревновательных средах агенты учатся тому, чего от них прямо не требовали. В одном из известных экспериментов Meta с игрой в дипломатию система научилась делать ложные обещания союзникам, если это вело к выигрышу. Это не баг: агент оптимизировал награду, а обман оказался эффективным путём к ней. Тот же механизм даёт и полезный результат — метод самоигры (self-play), на котором обучались AlphaGo и покерные боты, доводит стратегию до сверхчеловеческого уровня без единого человеческого примера.
Конкуренция полезна ещё и как способ повысить надёжность. Adversarial-обучение, где один агент атакует, а другой защищается, — стандартный приём для поиска уязвимостей в моделях. Проблема в том, что стратегии, выученные против конкретного противника, часто хрупки: замените оппонента — и агент рассыпается.
Коммуникация: язык, который никто не задавал
Самое любопытное происходит, когда агентам дают канал связи, но не диктуют протокол. Они изобретают собственный «язык» — набор сигналов, оптимальных для задачи, но нечитаемых для человека. В 2017 году сообщение о том, что боты Facebook «придумали свой язык», разошлось как сенсация об опасном ИИ. Реальность скучнее: агенты просто выработали эффективную кодировку для торга, и её отключили, потому что она была бесполезна для людей, а не потому что она угрожала человечеству.
Для практики важен вывод: эмерджентная коммуникация эффективна, но непрозрачна. Если вы строите систему, где несколько ИИ-агентов обмениваются данными, придётся выбирать между свободой (и непонятными протоколами) и ограничением их на человекочитаемый формат — например, на естественный язык, как в LLM-агентах.
Три режима рядом
| Режим | Структура награды | Ключевая проблема | Типичный метод |
|---|---|---|---|
| Кооперация | Общая на всех | Распределение заслуг, безбилетники | QMIX, факторизация Q-функции |
| Конкуренция | Противоположная у сторон | Нестационарность, хрупкость стратегий | Self-play, adversarial-обучение |
| Коммуникация | Зависит от задачи | Непрозрачность протокола | Обучаемые каналы, ограничение на язык |
В реальных системах эти режимы редко встречаются в чистом виде. Переговоры — это конкуренция за ресурс через кооперативную коммуникацию. Командная игра против другой команды — кооперация внутри и конкуренция снаружи. Это называют смешанными средами, и именно они ближе всего к настоящим задачам.
Что это значит для тех, кто строит агентов сегодня
Волна LLM-агентов вернула мультиагентные идеи в мейнстрим, но с оговоркой: большинство современных фреймворков (AutoGen, CrewAI, LangGraph) не обучают агентов в смысле обучения с подкреплением. Они оркеструют уже обученные модели, задавая им роли и правила обмена сообщениями. Классическая нестационарность там не так остра, зато во весь рост встают старые проблемы: как разделить задачу между агентами, как не дать им зациклиться на согласовании и как проверить, что кооперация не превратилась в коллективную галлюцинацию, где модели подтверждают ошибки друг друга.
- Начинайте с минимума агентов. Два-три специализированных агента почти всегда надёжнее десяти.
- Фиксируйте протокол общения. Если агенты обмениваются свободным текстом, добавьте структуру — JSON, явные поля, роли.
- Закладывайте арбитра. В спорных ситуациях нужен агент или правило, которое принимает финальное решение, иначе диалог не сходится.
- Логируйте всё. Непрозрачность — главный риск: без полного лога обмена вы не поймёте, где система свернула не туда.
1 Обучение с подкреплением (reinforcement learning) — метод, при котором агент учится через пробы и ошибки, получая награду за удачные действия и штраф за неудачные, без готовых примеров правильных ответов.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Learning to cooperate, compete, and communicate, Microsoft AutoGen — документация фреймворка мультиагентных систем
Частые вопросы
Чем мультиагентное обучение отличается от обычного ИИ вроде ChatGPT?
Правда ли, что ИИ-агенты придумывают собственный язык?
Почему мультиагентное обучение так трудно заставить сойтись?
Нужен ли мне reinforcement learning, чтобы собрать агентов на LLM?
Опасно ли, что агенты учатся обманывать?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту. Instagram, Facebook и WhatsApp принадлежат компании Meta Platforms Inc., признанной в России экстремистской организацией; её деятельность на территории Российской Федерации запрещена.