Как выбрать языковую модель под задачу и не переплатить
Разница в счёте между GPT-4o и Gemini Flash на одной и той же задаче — двадцатикратная. Разбираемся, где переплата оправдана, а где вы просто жжёте бюджет.

Разработчик подключает к чат-боту GPT-4o «потому что она умная». Через месяц счёт от OpenAI — $840. Пересобирает пайплайн: классификацию и извлечение полей отдаёт GPT-4o mini, генерацию ответов оставляет старшей модели. Счёт падает до $95. Задача та же, качество не изменилось. Разница в двадцать раз — это не оптимизация, это отсутствие выбора на старте.
С чего начинается выбор
Не с модели. С задачи. У каждой задачи есть три характеристики, которые определяют, сколько вы заплатите и стоит ли переплачивать.
- Сложность рассуждения. Классификация тикета в одну из пяти категорий — тривиально. Написать SQL-запрос по описанию на русском с четырьмя JOIN — уже нет. Доказать теорему или отладить чужой код — задача для reasoning-моделей вроде o1 или Claude 3.5 Sonnet.
- Объём контекста. Ответ по короткому промпту и суммаризация PDF на 200 страниц — разные миры. Модели с большим окном (Gemini 1.5 Pro — 2M токенов, Claude — 200K) закрывают такие сценарии без RAG*, но платите вы за каждый токен ввода.
- Требования к задержке. Голосовой ассистент, где ответ нужен за 300 мс — это не территория GPT-4. Streaming первого токена у Gemini Flash и Groq-хостинга Llama 3.3 укладывается в 150–250 мс, у Claude 3.5 Sonnet — 400–700 мс.
Цены на входе и выходе
Провайдеры берут деньги отдельно за токены на вход (ваш промпт) и за токены на выход (ответ модели). Выход стоит в 3–5 раз дороже. Это критично: если модель отвечает многословно, счёт растёт быстрее, чем кажется.
| Модель | Вход, $/1M токенов | Выход, $/1M токенов | Контекст |
|---|---|---|---|
| GPT-4o | 2.50 | 10.00 | 128K |
| GPT-4o mini | 0.15 | 0.60 | 128K |
| Claude 3.5 Sonnet | 3.00 | 15.00 | 200K |
| Claude 3.5 Haiku | 0.80 | 4.00 | 200K |
| Gemini 1.5 Pro | 1.25 | 5.00 | 2M |
| Gemini 1.5 Flash | 0.075 | 0.30 | 1M |
| DeepSeek V3 | 0.27 | 1.10 | 64K |
Цены официальных API на начало 2025 года. Провайдеры регулярно их пересматривают — сверяйтесь с прайсами перед интеграцией.
Сколько это в реальных деньгах
Возьмём типичный сценарий: 100 000 диалогов в месяц, в среднем 800 токенов ввода и 300 токенов вывода на запрос. Итого — 80M входных и 30M выходных токенов.
- GPT-4o: 80 × $2.50 + 30 × $10 = $500 (≈50 000 ₽)
- Claude 3.5 Sonnet: 80 × $3 + 30 × $15 = $690 (≈69 000 ₽)
- GPT-4o mini: 80 × $0.15 + 30 × $0.60 = $30 (≈3 000 ₽)
- Gemini 1.5 Flash: 80 × $0.075 + 30 × $0.30 = $15 (≈1 500 ₽)
Между старшей и младшей моделью одного вендора — разница в 15–20 раз. Между разными вендорами на бюджетных линейках — ещё вдвое.
Правило, которое экономит больше всего денег: не спрашивайте, какая модель лучше. Спрашивайте, какая самая дешёвая справится с вашей задачей на приемлемом уровне.
Какую модель под какую задачу
Классификация, извлечение сущностей, роутинг
GPT-4o mini, Gemini Flash, Haiku. Если задача укладывается в чёткий JSON-схему — берите младшую модель. Разница в качестве с флагманом на такой задаче обычно 1–3 процентных пункта точности, а цена — в двадцать раз.
Диалог с пользователем, написание текстов, суммаризация
Средний класс: GPT-4o mini или Claude Haiku для B2C-объёмов, Sonnet или GPT-4o — если общаетесь с платящими клиентами и цена ошибки высока.
Код, сложные рассуждения, агенты с планированием
Claude 3.5 Sonnet стабильно лидирует на бенчмарках вроде SWE-bench. Для одноразовых сложных задач — o1 или o1-mini, но они дорогие и медленные (десятки секунд на ответ).
Длинный контекст
Gemini 1.5 Pro и Flash — единственные с окном за миллион токенов. Но не путайте «влезло в контекст» и «модель это поняла»: качество ответов падает после 200–400K токенов даже у Gemini.
Считайте до, а не после
Простой скрипт, который прогонит выборку из 100 реальных запросов через несколько моделей и посчитает счёт:
PRICES = {
"gpt-4o": {"in": 2.50, "out": 10.00},
"gpt-4o-mini": {"in": 0.15, "out": 0.60},
"claude-sonnet": {"in": 3.00, "out": 15.00},
"gemini-flash": {"in": 0.075, "out": 0.30},
}
def monthly_cost(model, in_tokens, out_tokens, requests_per_month):
p = PRICES[model]
cost = (in_tokens * p["in"] + out_tokens * p["out"]) / 1_000_000
return round(cost * requests_per_month, 2)
for m in PRICES:
print(m, "$", monthly_cost(m, 800, 300, 100_000))
Прогоните на реальной выборке — увидите точный счёт до того, как включите биллинг.
Подводные камни
- Reasoning-модели скрывают токены. o1 берёт деньги за «размышления», которых вы не видите. На короткий ответ может уйти 5000 выходных токенов вместо 200. Считайте по факту, а не по длине ответа.
- Кеширование промпта экономит до 90%. Anthropic и OpenAI дают скидку на повторяющиеся системные промпты. Если у вас длинный system prompt и много запросов — включайте prompt caching, это одна строка в API.
- Batch API — минус 50%. Если ответ не нужен мгновенно (ночная разметка, регенерация описаний товаров), OpenAI и Anthropic возвращают результат в течение 24 часов вдвое дешевле.
- Доступ из России. OpenAI и Anthropic напрямую не работают, нужен либо прокси, либо агрегатор вроде OpenRouter. Наценка агрегаторов — 5–20%, зато оплата в рублях.
- Не гоняйте флагман ради «на всякий случай». Соберите два пайплайна: дешёвый обрабатывает 90% запросов, дорогой подключается по флагу сложности. Экономия — в разы, качество — не хуже.
* RAG — подход, при котором в контекст модели подмешиваются найденные по запросу куски документов вместо загрузки всей базы знаний целиком.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI API Pricing, Anthropic Claude Pricing
Частые вопросы
С какой модели начать, если я только запускаю пилот и не знаю нагрузки?
Есть ли смысл поднимать open-source модель на своём сервере вместо API?
Насколько бенчмаркам вроде MMLU или Arena можно верить при выборе?
Что делать с длинным контекстом — грузить всё в Gemini или собирать RAG?
Как понять, что пора переезжать с одной модели на другую?
Стоит ли ради экономии смешивать модели разных вендоров в одном продукте?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.