Мультиагентные системы ИИ: почему в их безопасность вкладывают деньги
Одиночную модель научились тестировать. Но когда десяток агентов начинают общаться, торговаться и делегировать задачи друг другу, риски меняют природу — и деньги пошли именно сюда.

Одна языковая модель, которую вы просите написать письмо, — это понятный объект: вход, выход, знакомые способы проверки. Но продукты вроде AutoGPT, фреймворков CrewAI, LangGraph и AutoGen устроены иначе: несколько ИИ-агентов вызывают друг друга, распределяют подзадачи, спорят и вместе идут к цели. И когда таких агентов много, ломается сама модель контроля — потому что поведение системы перестаёт быть суммой поведения её частей. Именно на эту проблему в 2024–2025 годах начали направлять исследовательские гранты и внутренние бюджеты лабораторий.
Чем мультиагентная безопасность отличается от обычной
Классическое выравнивание (alignment)* работает с одной моделью: вы оцениваете, насколько её ответы совпадают с намерениями человека, и подкручиваете поведение. В мультиагентной системе появляются свойства, которых у отдельного агента нет в принципе.
- Эмерджентное поведение. Группа агентов может прийти к стратегии, которую ни один из них не был обучен выполнять — она рождается из их взаимодействия.
- Сговор и коллузия. Два агента, каждый из которых по отдельности проходит проверку безопасности, вместе могут обойти ограничение — один формулирует запрос так, что второй не распознаёт его как запретный.
- Каскадные ошибки. Галлюцинация одного агента становится входными данными для следующего, и ошибка усиливается по цепочке, а не гасится.
- Размытая ответственность. Когда система приняла вредное решение, трудно указать, какой именно агент за него отвечает — а значит, трудно и чинить.
Тестировать одного агента и считать, что вы протестировали рой из десяти таких же, — то же самое, что проверить одного водителя и объявить безопасным весь городской трафик.
Почему в это вкладывают деньги именно сейчас
Причина простая: агентные продукты начали выходить в реальные задачи с деньгами и последствиями. Агент, который сам бронирует, заказывает, пишет код в продакшн или управляет закупками, — это уже не демо. Ошибка стоит не «неудачного ответа», а реальных транзакций.
Крупные лаборатории обозначили направление публично. Anthropic развивает исследования по интерпретируемости и оценке рисков продвинутых систем, OpenAI держит команды по подготовке к рискам (Preparedness) и выравниванию, а Google DeepMind публикует работы по безопасности агентов. Появились и отдельные некоммерческие центры и грантовые программы, финансирующие независимые исследования выравнивания. Точные суммы бюджетов и состав программ лучше сверять на официальных страницах самих организаций — цифры здесь меняются от квартала к кварталу.
Куда конкретно идут ресурсы
- Оценочные среды (evals). Стенды, где мультиагентную систему нагружают провокационными сценариями и смотрят, где она ломается или договаривается против пользователя.
- Мониторинг межагентной коммуникации. Инструменты, которые читают «переговоры» агентов между собой и подсвечивают опасные паттерны в реальном времени.
- Механизмы отзыва полномочий. Способ мгновенно ограничить или остановить агента, у которого появился доступ к внешним действиям.
- Интерпретируемость. Попытка понять, почему группа агентов приняла решение, а не только зафиксировать, что приняла.
Кто вкладывается и с какой мотивацией
| Тип инвестора | Что финансирует | Мотивация |
|---|---|---|
| Крупные ИИ-лаборатории | Внутренние команды безопасности, red-team, evals | Регуляторные риски и репутация, без которой продукт не пустят в корпоративный сегмент |
| Венчурные фонды | Стартапы по observability и контролю агентов | Новый рынок инфраструктуры под агентные системы |
| Некоммерческие фонды и гранты | Независимые академические исследования выравнивания | Снижение системных рисков вне коммерческого давления |
| Корпоративные заказчики | Аудит и внедрение под свои сценарии | Не хотят, чтобы автономный агент совершил дорогую ошибку от их имени |
Цена вопроса и где скепсис
Здесь есть напряжение, о котором говорят прямо. Часть индустрии считает, что многоагентные архитектуры переоценены: для большинства задач надёжнее один хорошо настроенный агент с инструментами, чем рой, который сложнее контролировать и дороже эксплуатировать. С этой позиции вложения в «безопасность роя» — решение проблемы, которую можно было не создавать.
Контраргумент сторонников: сложные задачи всё равно требуют разделения ролей, а значит, мультиагентность придёт — вопрос лишь в том, будем ли мы к ней готовы или начнём чинить систему после первого громкого инцидента. Для бизнеса цена вопроса измеряется не абстрактно: неконтролируемый агент с доступом к платежам, почте или инфраструктуре может нанести ущерб быстрее, чем человек успеет вмешаться.
Что это значит, если вы строите продукт на агентах
- Закладывайте ограничение полномочий с самого начала: агент не должен иметь доступа к действиям, которые ему для задачи не нужны.
- Логируйте межагентную коммуникацию, а не только финальный вывод — иначе разбор инцидента будет невозможен.
- Тестируйте систему целиком в состязательных сценариях, а не каждого агента по отдельности.
- Держите «стоп-кран» — способ немедленно отозвать доступ у агента к внешним действиям.
* Выравнивание (alignment) — направление в ИИ-безопасности, задача которого добиться, чтобы поведение системы соответствовало намерениям и ценностям человека, а не только буквальной формулировке задачи.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Anthropic — Research on AI safety and alignment, Google DeepMind — Safety & Responsibility
Частые вопросы
Чем мультиагентная система отличается от одной модели с плагинами?
Насколько это реальная угроза, а не гипотетическая?
Сколько вкладывают в исследования безопасности агентов?
Мне точно нужна мультиагентная архитектура?
Как минимально защитить свой агентный продукт?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.