Агенты на GPT и Claude против open-source: что дешевле
Автономный агент вызывает модель десятки раз за один запуск. На closed-source API это счёт в тысячи долларов в месяц, на self-hosted — расходы на GPU. Разбираем, где проходит граница выгоды.

Агент — это не один запрос к модели, а цикл: планирование, вызов инструмента, чтение результата, повторное рассуждение. Один пользовательский запрос легко превращается в 20–50 обращений к LLM. При таком множителе цена за токен, которая на чат-боте выглядела копеечной, на агенте становится главной статьёй бюджета. И именно здесь встаёт выбор: платить за API GPT или Claude поштучно или поднять open-source модель у себя и платить за железо.
Почему у агентов другая экономика
Обычный чат тратит один запрос и один ответ. Агент внутри одной задачи может: разбить её на шаги, для каждого шага сформировать промпт, вызвать поиск или код, скормить модели результат и снова подумать. Контекст при этом растёт от итерации к итерации — история рассуждений и результаты инструментов накапливаются.
Отсюда две проблемы. Первая — количество вызовов. Вторая — раздувание входного контекста: к десятой итерации вы платите за 30–40 тысяч входных токенов на каждом шаге, потому что тащите за собой весь предыдущий диалог. У поставщиков API входные токены обычно дешевле выходных, но при агентском цикле именно вход становится доминирующей частью счёта.
Стоимость агента определяет не цена одного токена, а произведение: цена × число вызовов × размер контекста на каждом вызове. Оптимизируют обычно первое, а бьёт по бюджету третье.
Closed-source: за что вы платите
У проприетарных моделей — OpenAI, Anthropic, Google — вы получаете лучшие на сегодня способности к рассуждению и следованию инструкциям, стабильный function calling и готовую инфраструктуру. Не нужно думать о GPU, батчинге и отказоустойчивости. Заплатили за токены — работает.
Цены на API меняются каждый квартал, поэтому конкретные ставки за миллион токенов сверяйте на страницах прайсинга OpenAI и Anthropic перед расчётом бюджета — приводить их как фиксированную величину бессмысленно. Важнее понимать структуру: у большинства поставщиков есть дешёвые модели для простых шагов и дорогие флагманы для сложного рассуждения, и разница между ними — кратная, часто в 10–30 раз за тот же миллион токенов.
Практический вывод: не гоняйте весь агентский цикл на флагмане. Планирование и сложные решения — на дорогой модели, рутинную классификацию и извлечение данных — на дешёвой. Это единственный способ удержать счёт в разумных рамках, не переходя на self-hosting.
Скрытые издержки closed-source
- Rate limits. На старте вам дают ограниченные лимиты по запросам в минуту. Агент с параллельными вызовами упирается в них быстро, а повышение лимита — отдельный процесс.
- Отсутствие контроля над версией. Поставщик может депрецировать модель или подкрутить её поведение — ваш отлаженный агент внезапно начинает отвечать иначе.
- Данные уходят наружу. Для многих корпоративных сценариев это стоп-фактор сам по себе, независимо от цены.
Open-source: за что вы платите на самом деле
Open-weight модели — Llama, Qwen, Mistral, DeepSeek и другие — можно скачать и запустить у себя. Токены становятся бесплатными в том смысле, что вы не платите за каждый вызов. Но вы платите за GPU, за инженера, который поднимет инференс-стек, и за простой, когда что-то падает.
Ключевая ошибка в расчётах — сравнивать цену API-токена с нулём. Правильное сравнение: цена API против стоимости часа аренды GPU, делённой на реальную пропускную способность вашего сервера. Мощная модель на арендованной A100/H100 стоит несколько долларов в час, и если ваш агент не загружает её почти постоянно, аренда проигрывает API вчистую.
Self-hosting начинает выигрывать при высоком и стабильном объёме. Когда вы прокачиваете миллионы вызовов в день и GPU загружена батчами близко к 100%, стоимость одного вызова падает ниже любого API. При редких и рваных нагрузках вы платите за простаивающее железо.
Компромисс: open-модели через хостинг
Между двумя крайностями есть третий путь — open-weight модели, которые за вас хостят провайдеры инференса (Together, Fireworks, Groq и другие). Вы платите за токены, как за closed-source, но получаете open-модель: её можно в любой момент увезти на своё железо, а данные обрабатываются по правилам конкретного провайдера. Часто это дешевле флагманских проприетарных моделей при сопоставимом качестве на типовых агентских задачах.
Сравнение подходов
| Критерий | Closed-source API | Open-weight (self-host) | Open-weight (хостинг) |
|---|---|---|---|
| Качество рассуждения | Лучшее на рынке | Близко к топу на многих задачах | То же, что self-host |
| Модель оплаты | За токены | За GPU и инженеров | За токены |
| Выгода при малом объёме | Высокая | Низкая | Высокая |
| Выгода при большом стабильном объёме | Падает | Высокая | Средняя |
| Контроль над данными | Ограничен | Полный | Зависит от провайдера |
| Порог входа | Минимальный | Высокий (DevOps, GPU) | Минимальный |
Как выбрать под свой агент
- Оцените реальный множитель. Прогоните типовую задачу агента с логированием и посчитайте: сколько вызовов, сколько токенов входа и выхода суммарно на одну задачу.
- Умножьте на объём. Задач в день × токены на задачу = месячный расход в токенах. Только теперь имеет смысл смотреть прайсинг.
- Разнесите модели по шагам. Прикиньте, какая доля вызовов требует флагмана, а какая обойдётся дешёвой моделью или маленькой open-weight.
- Проверьте требования к данным. Если данные нельзя отдавать наружу — closed-source отпадает независимо от цены, остаётся self-host или проверенный хостинг с нужным договором.
- Посчитайте точку безубыточности self-host. Стоимость GPU в месяц ÷ ваш месячный объём токенов. Если получается дороже API — не поднимайте своё железо.
Для большинства команд разумный старт — closed-source API с раскладкой моделей по сложности шагов. Переход на open-weight оправдан, когда счёт от API стал заметной статьёй бюджета, объём предсказуем и высок, а требования к приватности или контролю версии перевешивают удобство. Начинать сразу с self-hosting «чтобы сэкономить» — частая ошибка: экономия появляется только на масштабе.
Модели, цены и лимиты в этой области меняются буквально ежемесячно. Перед бюджетным решением сверяйте актуальные ставки на официальных страницах поставщиков и прогоняйте собственный бенчмарк на своих задачах — публичные лидерборды не отражают поведение именно вашего агента.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI API Pricing, Anthropic Pricing
Частые вопросы
Что дешевле для агента — GPT/Claude или своя Llama?
Насколько open-weight модели отстают от проприетарных на агентских задачах?
Почему агент тратит так много токенов по сравнению с чат-ботом?
Можно ли использовать open-модель, не поднимая своё железо?
Как снизить счёт от API, не переходя на self-hosting?
Опасно ли отдавать данные в closed-source API?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.