Локальные агенты на open-weights против API: где считать деньги
Агент на своей видеокарте не шлёт данные наружу и не платит за токены, но упирается в контекст и качество. Разбираем, когда локальные open-weights модели обходят API, а когда только съедают железо.

Агент — это не одна подсказка модели, а цикл: планирование, вызов инструментов, чтение результата, новый шаг. На каждой итерации сжигаются токены. Если запустить такой цикл на API вроде GPT-4o или Claude Sonnet, счёт легко доходит до нескольких долларов за один длинный прогон с сотнями тысяч токенов. Если запустить его на локальной open-weights модели — Qwen2.5, Llama 3.3, DeepSeek-V3 или их дистиллятах — токены бесплатны, но вы платите железом, электричеством и качеством. Выбор между этими двумя мирами перестал быть религиозным: он считается в деньгах и в требованиях к задаче.
Что вообще значит «локальный агент»
Под локальным агентом понимают связку из трёх частей: open-weights модель, которую вы скачали и запускаете сами (через Ollama, vLLM, llama.cpp или LM Studio), рантайм агента (LangGraph, CrewAI, самописный цикл) и набор инструментов — поиск, файловая система, выполнение кода. Ключевое слово — open-weights: веса модели опубликованы, вы держите их у себя и не отправляете ни один токен на чужой сервер.
Это не то же самое, что open-source в классическом смысле. Лицензии разнятся: часть моделей идёт под Apache 2.0 или MIT, часть — под собственными лицензиями с ограничениями по числу пользователей или сфере применения. Перед коммерческим запуском лицензию конкретной модели нужно читать, а не предполагать по аналогии.
Локальная модель не экономит деньги сама по себе. Она переносит стоимость из строки «оплата API» в строку «амортизация видеокарты плюс инженер, который всё это чинит».
Три оси, по которым проходит граница
Деньги
API берёт плату за токены. Локальный запуск требует железа: видеокарта с достаточным объёмом видеопамяти под нужную модель, плюс электричество и время на настройку. Экономика переворачивается на объёме. Пара агентских прогонов в день — API почти наверняка дешевле, потому что железо простаивает. Тысячи прогонов в сутки на стабильной модели — локальный вариант начинает окупаться, потому что предельная стоимость запроса стремится к цене электричества.
Точные цены на подписки и токены меняются ежеквартально — сверяйте их на актуальных страницах тарифов поставщиков, а не по числам из статей полугодовой давности.
Приватность и контроль
Если агент работает с персональными данными, коммерческой тайной или медицинскими записями, отправка их в чужой API — это отдельный юридический вопрос, а иногда прямой запрет по внутренним политикам. Локальная модель этот вопрос закрывает физически: данные не покидают периметр. Для регулируемых отраслей это часто не «приятный бонус», а единственная причина вообще рассматривать локальный запуск.
Качество и надёжность
Здесь API пока чаще выигрывает. Флагманские закрытые модели лучше держат длинный контекст, точнее следуют формату вызова инструментов* и реже срываются в бесконечный цикл на сложной многошаговой задаче. Топовые open-weights модели подтянулись близко, но на агентских сценариях с десятками шагов разрыв в стабильности всё ещё заметен, особенно у моделей поменьше, которые влезают в потребительскую видеокарту.
* Вызов инструментов (tool calling / function calling) — способность модели вернуть структурированный запрос на выполнение внешней функции: поиск, запрос к базе, запуск кода. Для агента это критично: если модель путает формат вызова, цикл ломается.
Сравнение по сценариям
| Критерий | Локальный open-weights агент | API-агент |
|---|---|---|
| Стоимость на старте | Высокая: железо и настройка | Близка к нулю: только ключ |
| Стоимость на объёме | Падает почти до цены электричества | Растёт линейно с числом токенов |
| Приватность данных | Данные не покидают периметр | Уходят к поставщику |
| Качество на длинных цепочках | Ниже, зависит от размера модели | Обычно выше и стабильнее |
| Скорость обновления моделей | Обновляете вручную | Новые версии сразу в API |
| Зависимость от вендора | Минимальная | Высокая: цены и лимиты вне вашего контроля |
| Кто чинит поломки | Вы и ваша команда | Поставщик держит аптайм |
Когда локальный вариант оправдан
- Чувствительные данные. Юридические документы, медкарты, внутренняя переписка — то, что нельзя выпускать за периметр.
- Высокий и стабильный объём. Одна и та же задача, тысячи прогонов в сутки, предсказуемая нагрузка.
- Узкая задача. Классификация, извлечение полей, простые многошаговые пайплайны, где не нужна максимальная сообразительность модели.
- Требование к независимости. Вы не хотите, чтобы изменение цен или закрытие API у поставщика остановило продукт.
Когда проще взять API
- Прототип и эксперимент. Проверить гипотезу на API можно за вечер, локальная инфраструктура на это время — лишние расходы.
- Сложные агенты с длинными цепочками рассуждений. Там, где важна каждая доля процента надёжности вызова инструментов.
- Небольшой или скачущий объём. Если нагрузка непредсказуема, платить за токены выгоднее, чем держать простаивающую видеокарту.
- Маленькая команда. Нет инженера, который возьмёт на себя эксплуатацию инференс-сервера.
Гибрид как рабочий компромисс
Многие команды не выбирают одно из двух, а маршрутизируют запросы. Простые шаги агента — извлечь поле, отнести текст к категории, переформулировать — уходят на локальную модель. Сложное планирование или редкий тяжёлый шаг — на API. Так основной поток токенов не покидает периметр и не стоит денег, а качество на критичных участках остаётся высоким.
Другой распространённый паттерн — локальная модель как первый фильтр, который решает, стоит ли вообще звать дорогой API. Если задачу можно закрыть на месте, до платного вызова дело не доходит.
С чего начать оценку
- Оцените реальный объём: сколько агентских прогонов в сутки и по сколько токенов на прогон.
- Определите класс данных: есть ли персональные данные или тайна, которую нельзя отдавать наружу.
- Прикиньте стоимость обоих вариантов на вашем объёме — токены против амортизации железа и электричества.
- Соберите прототип на API за пару дней и замерьте, какая доля запросов реально требует флагманской модели.
- Только после этого решайте, что переносить на локальную модель и переносить ли вообще.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Ollama — документация по локальному запуску моделей, vLLM — документация по инференсу open-weights моделей
Частые вопросы
Какая видеокарта нужна для локального агента?
Локальная модель точно дешевле API?
Можно ли использовать open-weights модель в коммерческом продукте?
Насколько open-weights модели отстают по качеству?
Что такое гибридный подход и зачем он нужен?
Уходят ли мои данные к поставщику при работе через API?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.