Мультиагентные решения: почему счёт за токены растёт кратно
Один агент отвечает на запрос за один вызов модели. Система из пяти агентов может сделать двадцать вызовов и переслать один и тот же контекст десяток раз. Разбираемся, откуда берётся счёт и как его считать заранее.

Мультиагентные фреймворки — LangGraph, CrewAI, AutoGen, OpenAI Agents SDK — за 2024–2025 годы превратились из демо в рабочий инструмент. Идея простая: вместо одного промпта к модели вы собираете команду специализированных агентов — планировщик, исполнитель, критик, — которые обмениваются сообщениями и решают задачу сообща. Проблема в том, что каждое сообщение между агентами — это отдельный вызов модели, а каждый вызов оплачивается токенами1. И счёт растёт не линейно, а быстрее.
Откуда берётся расход
В биллинге всех крупных провайдеров (OpenAI, Anthropic, Google) разделены входные и выходные токены. Входные — то, что вы отправили модели: системный промпт, история диалога, документы. Выходные — то, что модель сгенерировала. Выходные обычно стоят в 3–5 раз дороже входных, но именно на входных чаще всего теряются деньги в мультиагентных схемах.
Причина — переотправка контекста. В одноагентном чате история растёт постепенно. В системе агентов один и тот же массив данных — например, тело большого документа или лог предыдущих шагов — может пересылаться в каждом раунде обмена и каждому агенту заново. Пять агентов, три раунда согласования, документ на 8000 токенов — и вы уже отправили эти 8000 токенов пятнадцать раз, заплатив за 120 000 входных токенов вместо восьми тысяч.
Стоимость мультиагентной системы определяется не количеством агентов, а количеством вызовов модели и объёмом контекста, который вы протаскиваете через каждый из них.
Три множителя, которые надо перемножить
Чтобы прикинуть расход до запуска, считайте по трём осям:
- Число вызовов модели — не число агентов, а сколько раз кто-либо из них обратился к API за одну задачу. Циклы «критик вернул на доработку» умножают это число.
- Средний размер входного контекста на вызов — системный промпт агента плюс всё, что ему передали: история, документы, результаты соседних агентов.
- Средний размер вывода — сколько токенов агент генерирует за один ход.
Формула грубой оценки: (вызовы × средний вход × цена входа) + (вызовы × средний выход × цена выхода). Она не точна до токена, но покажет порядок величины и место, где утекают деньги.
Сравнение подходов по стоимости
Ниже — качественное сравнение архитектур по расходу токенов при одной и той же задаче. Конкретные суммы зависят от модели и объёма данных, поэтому в таблице — относительная нагрузка и типичные риски.
| Подход | Вызовов модели на задачу | Риск раздувания контекста | Когда оправдан |
|---|---|---|---|
| Один вызов с большим промптом | 1 | Низкий | Простые задачи, короткий вход |
| Цепочка (chain) без ветвления | 3–6 | Средний — история копится линейно | Пошаговые задачи с чёткой последовательностью |
| Планировщик + исполнители | 5–15 | Высокий — план и результаты гоняются между агентами | Задачи с параллельными подзадачами |
| Агенты с циклом критики | 10–30+ | Очень высокий — каждая итерация переотправляет контекст | Задачи, где важна проверка качества и есть бюджет |
Что реально снижает счёт
Экономить на мультиагентных системах можно, не ломая архитектуру. Вот приёмы по убыванию эффекта.
- Кэширование промптов. Anthropic и OpenAI поддерживают кэширование входных токенов: повторяющаяся часть промпта (системная инструкция, неизменный документ) при повторных вызовах тарифицируется дешевле. Точные условия и коэффициенты сверяйте в документации провайдера — они менялись в 2024–2025 годах.
- Разные модели для разных ролей. Планировщику и критику часто нужна сильная модель, а простому исполнителю или парсеру — дешёвая и быстрая. Роутинг по сложности задачи режет расход заметнее всего.
- Сжатие контекста. Не пересылайте весь документ каждому агенту. Передавайте резюме, релевантные фрагменты (через RAG2) или структурированный результат предыдущего шага, а не сырой лог.
- Ограничение итераций. Цикл «критик — исполнитель» без жёсткого лимита раундов способен молотить бюджет, пока не упрётся в потолок. Ставьте максимум итераций и условие раннего выхода.
- Логирование токенов по агенту. Без разбивки расхода по ролям вы не увидите, кто именно жжёт бюджет. Считайте токены на каждом узле, а не только итог.
Кому это пригодится и кому нет
Мультиагентная схема оправдана, если:
- задача действительно распадается на разные роли — например, извлечь данные, проверить их на противоречия и оформить отчёт;
- цена ошибки высока, и цикл критики окупается — юридический черновик, финансовая сверка;
- подзадачи можно вести параллельно, и выигрыш по времени важнее расхода токенов.
Она избыточна, если:
- задачу решает один хорошо составленный промпт — тогда пять агентов только добавят вызовов и задержку;
- у вас высокий поток однотипных запросов и жёсткий бюджет: здесь дешевле один оптимизированный вызов с кэшем;
- вы гоняете один большой документ через всех агентов без сжатия — это самый частый способ получить счёт в разы выше ожидаемого.
Прикидка перед запуском
Перед тем как выкатывать мультиагентный пайплайн в продакшн, прогоните 20–50 реальных запросов на тестовом контуре и снимите фактический расход токенов по каждому. Умножьте на ожидаемый объём в месяц. Часто оказывается, что схема, которая красиво работает на демо, при масштабе стоит дороже, чем один вызов сильной модели с продуманным промптом. Считать надо до внедрения, а не по первому счёту от провайдера.
1 Токен — минимальная единица текста, которой оперирует модель: примерно 3–4 символа для английского и заметно меньше символов для русского. И входной запрос, и ответ модели тарифицируются в токенах.
2 RAG (retrieval-augmented generation) — подход, при котором модель получает не весь массив данных, а только релевантные запросу фрагменты, найденные поиском. Позволяет не грузить в контекст лишнее.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Pricing и документация по токенам, Anthropic — Prompt caching documentation
Частые вопросы
Почему пять агентов стоят дороже, чем в пять раз?
Входные или выходные токены дороже?
Помогает ли кэширование промптов реально сэкономить?
Можно ли точно посчитать стоимость до запуска?
Когда мультиагентная схема не нужна вовсе?
Как понять, какой агент жжёт больше всего бюджета?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.