Рой агентов против оркестратора: чем платить за автономию
Мультиагентные системы обещают распараллелить работу LLM, но за автономию приходится платить токенами и предсказуемостью. Разбираем, когда рой обгоняет централизованный оркестратор, а когда сжигает бюджет впустую.

Anthropic в 2025 году опубликовала разбор своей исследовательской мультиагентной системы и привела цифру, которая отрезвляет: их архитектура из ведущего агента и субагентов расходует примерно в 15 раз больше токенов, чем один диалог с моделью. Cognition в своём инженерном блоге о Devin пришла к обратной установке — не строить рой параллельных агентов там, где можно обойтись одной линией контекста. Два подхода к одной задаче, и оба команды считают своим правильным. Разберём, где проходит граница.
О чём вообще спор
Есть два способа заставить несколько экземпляров LLM решать общую задачу. Первый — централизованная оркестрация: один управляющий агент разбивает работу на шаги, вызывает подчинённых, собирает результаты и держит в голове общую картину. Второй — swarm, рой: множество автономных агентов работают параллельно, обмениваются сообщениями и приходят к решению без единого дирижёра.
На бумаге рой выглядит красиво: горизонтальное масштабирование, отказоустойчивость, никакого узкого горлышка в виде одного координатора. На практике первое, что вы замечаете, — счёт за токены и то, как трудно понять, почему система выдала именно этот ответ.
Что такое агент в этом контексте
Под агентом здесь понимается LLM* в цикле: модель получает задачу, вызывает инструменты (поиск, код, API), читает результат и решает, что делать дальше — до достижения цели или лимита шагов. Один агент — одна линия рассуждения и один контекст. Мультиагентная система запускает несколько таких циклов и как-то их связывает.
* LLM (large language model) — большая языковая модель, например семейства GPT, Claude или Gemini.
Где рой действительно выигрывает
Anthropic описала задачу, под которую рой подходит: широкий исследовательский поиск, когда нужно параллельно опросить десятки источников и свести результаты. Здесь подзадачи почти не зависят друг от друга, и распараллеливание сокращает время ответа в разы. Ведущий агент раздаёт направления субагентам, каждый копает свою ветку, потом всё сходится.
Ключевое условие — подзадачи слабо связаны между собой. Если пять агентов ищут информацию по пяти независимым компаниям, им не нужно синхронизироваться. Если же они вместе пишут один модуль кода, где решение одного меняет интерфейс для другого, рой начинает конфликтовать сам с собой.
Cognition формулирует правило жёстко: не запускайте несколько агентов параллельно, если результат их работы должен сойтись в один связный артефакт. Каждый агент принимает решения, которых не видят остальные, и на сборке эти решения противоречат друг другу.
Где рой ломается
Проблема называется расхождением контекста. Каждый автономный агент делает неявные допущения: выбирает стиль именования, формат данных, архитектурный подход. Пока агент один, эти допущения согласованы. Как только их несколько и они не видят решений друг друга, на выходе получается мозаика из несовместимых кусков, которую потом кто-то (человек или ещё один агент) должен склеивать вручную.
Вторая проблема — стоимость. Умножение числа агентов умножает расход токенов почти линейно, а иногда хуже: каждый субагент часто получает копию значительной части общего контекста. Пятнадцатикратный рост расхода из отчёта Anthropic — не аномалия, а типичный порядок для широкого роя.
Третья — наблюдаемость. Отладить одну цепочку рассуждений тяжело. Отладить рой из десяти агентов, которые обменивались сообщениями в недетерминированном порядке, — задача, под которую нужна отдельная инфраструктура логирования и трассировки.
Сравнение по параметрам
| Параметр | Централизованный оркестратор | Swarm (рой) |
|---|---|---|
| Расход токенов | Ниже, растёт с числом шагов | Высокий, растёт с числом агентов |
| Скорость на параллельных подзадачах | Ограничена последовательностью | Высокая при слабой связности |
| Согласованность результата | Высокая — один взгляд на задачу | Падает при связанных подзадачах |
| Отладка и наблюдаемость | Проще: одна линия решений | Сложнее: недетерминированный обмен |
| Отказоустойчивость | Узкое горлышко в координаторе | Выше — нет единой точки отказа |
| Где уместен | Связная работа, единый артефакт | Широкий независимый поиск |
Как выбрать под свою задачу
Прежде чем строить рой, честно ответьте на несколько вопросов. Они экономят месяцы работы и заметную часть бюджета на API.
- Можно ли разбить задачу на независимые куски? Если результаты подзадач влияют друг на друга — рой вам навредит. Начните с одного агента.
- Сколько стоит один прогон? Прикиньте расход токенов на одного агента и умножьте на число агентов плюс координатора. Для широкого роя закладывайте порядок в 10-15 раз выше одиночного диалога.
- Нужна ли скорость ответа здесь и сейчас? Параллелизм роя оправдан, когда пользователь ждёт ответ и подзадачи реально независимы. Для фоновой обработки последовательный агент часто дешевле при том же итоге.
- Есть ли у вас трассировка? Без логирования каждого шага и сообщения рой превращается в чёрный ящик, который невозможно чинить.
- Кто собирает результат? Если сборкой занимается человек, посчитайте его время — оно может съесть всю экономию от параллелизма.
Гибрид как компромисс
Архитектура из отчёта Anthropic — не чистый рой, а гибрид: централизованный ведущий агент управляет пулом субагентов. Дирижёр остаётся, но исполнители работают параллельно. Это снимает часть проблемы согласованности — общий взгляд на задачу держит ведущий, — но не убирает расход токенов. Для большинства продуктовых задач такой гибрид оказывается практичнее и полного роя, и одиночного агента: вы получаете параллелизм там, где он безопасен, и единую точку сборки там, где важна связность.
Что запомнить
Рой — не апгрейд оркестратора, а инструмент под другой класс задач. Он выигрывает на широком независимом поиске и проигрывает везде, где результат должен сойтись в один согласованный артефакт. Начинайте с одного агента, добавляйте параллелизм только там, где доказали независимость подзадач, и всегда считайте токены заранее. Модный термин swarm в презентации не отменяет счёт от провайдера API.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Anthropic Engineering — How we built our multi-agent research system, Cognition — Don't Build Multi-Agents
Частые вопросы
Правда ли, что мультиагентная система всегда умнее одного агента?
Насколько дороже обходится рой по сравнению с одним диалогом?
Когда стоит выбирать централизованный оркестратор?
Что такое расхождение контекста и почему это опасно?
Можно ли совместить оба подхода?
Нужна ли рою особая инфраструктура?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.