Латентность против качества: как подобрать модель под агента
Один и тот же промпт на GPT-4o отвечает за секунду, а на o1 может думать минуту. Разбираем, когда агенту нужна быстрая модель, когда — думающая, и как считать цену ошибки в деньгах и секундах.

Если вы собираете агента — цепочку из нескольких вызовов модели, где каждый шаг зависит от предыдущего — выбор модели перестаёт быть вопросом «какая умнее». На пяти последовательных вызовах разница в 3 секунды на шаг превращается в 15 секунд ожидания. А модель, которая ошибается в одном ответе из двадцати, на цепочке из десяти шагов ошибается уже почти в каждом втором прогоне. Латентность и качество тянут в разные стороны, и универсального ответа нет — есть выбор под конкретную задачу.
Почему для агента это не тот же выбор, что для чата
В чате пользователь пишет вопрос, ждёт один ответ и читает его. Секунда задержки погоды не делает, а качество каждого ответа видно сразу. У агента1 всё иначе: он делает несколько шагов подряд — вызывает инструменты, парсит результат, планирует следующее действие. Тут работают два эффекта, которые в чате незаметны.
Первый — накопление задержки. Латентность одного вызова умножается на число шагов. Если агент делает планирование, три вызова инструмента и финальную сборку — это пять обращений к модели. При медленной reasoning-модели каждое из них по 20-40 секунд, и пользователь ждёт минуты.
Второй — накопление ошибок. Вероятность, что вся цепочка отработает верно, — это произведение вероятностей на каждом шаге. Модель с точностью 95% на одном шаге даёт примерно 0.95 в десятой степени на десяти шагах — около 60% успешных прогонов. Модель с точностью 99% на тех же десяти шагах даёт около 90%. Разница в 4 процентных пункта на шаге превращается в 30 пунктов на цепочке.
Быстрая слабая модель в длинном агенте не экономит время — она тратит его на повторные прогоны после сбоев. Медленная точная модель не всегда медленнее по итогу: она реже заставляет всё переделывать.
Три класса моделей и что они умеют
Грубо линейку от крупных провайдеров можно разложить на три группы. Границы условны, а конкретные названия и цены меняются раз в несколько месяцев — актуальные проверяйте на страницах OpenAI, Anthropic и Google.
Лёгкие быстрые модели
Класс вроде GPT-4o mini, Claude Haiku, Gemini Flash. Отвечают быстро, стоят в разы дешевле флагманов. Хорошо справляются с классификацией, извлечением полей, простым роутингом и короткими ответами по готовому контексту. На многошаговом планировании и сложной логике срываются чаще.
Универсальные флагманы
GPT-4o, Claude Sonnet, Gemini Pro. Баланс: заметно умнее лёгких, отвечают быстрее reasoning-моделей. Это рабочая лошадь большинства агентов — планирование, вызов инструментов, генерация кода среднего размера.
Думающие (reasoning) модели
Класс o1 и o3 у OpenAI, режимы расширенного рассуждения у Claude и Gemini. Перед ответом модель тратит дополнительные токены на внутренние рассуждения2, поэтому отвечает дольше и дороже, но берёт задачи, где важна многошаговая логика: сложная математика, разбор запутанного кода, планирование с ограничениями.
| Класс | Латентность | Относительная цена | Где силён | Где слаб |
|---|---|---|---|---|
| Лёгкие (mini/Haiku/Flash) | низкая, доли секунды | минимальная | классификация, извлечение, роутинг | длинное планирование, сложная логика |
| Флагманы (4o/Sonnet/Pro) | средняя, 1-5 сек | средняя | универсальные шаги агента, код | очень сложные многошаговые задачи |
| Reasoning (o1/o3/thinking) | высокая, десятки секунд | высокая | математика, сложный разбор, планирование с ограничениями | всё, где нужна скорость и низкая цена |
Цифры латентности здесь — порядок величины, а не гарантия: реальное время зависит от длины запроса, нагрузки на API и региона.
Главный приём: не одна модель на агента, а разные на разные шаги
Самая частая ошибка — выбрать одну модель для всего агента. Между тем шаги внутри одной цепочки разные по сложности. Роутинг «куда направить запрос» — простая классификация, ей хватит лёгкой модели. А финальная сборка ответа или планирование стратегии — уже задача для флагмана или reasoning-модели.
Практичная схема — каскад:
- Роутер на лёгкой модели. Он решает, простой запрос или сложный, и какой инструмент нужен. Дёшево и быстро.
- Основная работа на флагмане. Большинство шагов — вызовы инструментов, парсинг, промежуточные решения — тянет универсальная модель.
- Reasoning только на узких местах. Подключайте думающую модель точечно: на шаге, где реально нужна сложная логика, а не на всей цепочке подряд.
Так вы платите за дорогие рассуждения только там, где они окупаются, и не заставляете пользователя ждать десятки секунд на тривиальных шагах.
Как считать цену вопроса
Прежде чем спорить о моделях, зафиксируйте три числа для вашего агента.
- Бюджет ожидания. Сколько пользователь готов ждать. Для интерактивного помощника — секунды. Для фоновой обработки документов ночью — хоть минуты, тогда reasoning-модель ничего не ломает.
- Цена ошибки. Что будет, если шаг сработает неверно. Агент, который черновиком предлагает текст, переживёт ошибку легко. Агент, который отправляет платёж или меняет данные в проде, — нет, и тут точность важнее скорости и цены.
- Стоимость прогона. Цена токенов, умноженная на число вызовов. Reasoning-модели съедают токены на внутренние рассуждения, которых вы не видите, но за которые платите.
Когда эти три числа на столе, выбор перестаёт быть вкусовым. Дорогая медленная модель на шаге с высокой ценой ошибки и щедрым бюджетом ожидания — разумно. Она же на роутинге, где ошибка дёшева, а ждать нельзя, — расточительство.
Кому что подойдёт: конкретные сценарии
Быстрая лёгкая модель — ваш выбор, если
- агент отвечает в реальном времени и пользователь смотрит на экран;
- шаги простые: тегирование обращений, извлечение суммы и даты из письма, маршрутизация в нужный отдел;
- объём запросов большой, и цена за токен решает.
Флагман по умолчанию, если
- агент вызывает инструменты и собирает из них связный ответ;
- нужен баланс, и вы не хотите держать в голове зоопарк моделей;
- задачи разнообразные, но редко требуют глубокой цепочки рассуждений.
Reasoning-модель оправдана, если
- шаг требует многоходовой логики: планирование маршрута с ограничениями, разбор сложного бага, доказательство или расчёт;
- ошибка дорого стоит, а ждать полминуты допустимо;
- это фоновая задача без человека, который смотрит на спиннер.
Что проверить перед выбором
Не верьте общим таблицам лидербордов — они меряют не вашу задачу. Соберите 20-50 реальных примеров из вашего сценария и прогоните на кандидатах, замеряя три вещи: долю успешных прогонов всей цепочки, среднюю и хвостовую (95-й перцентиль) латентность и цену за прогон. Хвост латентности важнее среднего: именно единичные долгие ответы бесят пользователей. Только после такого замера сравнение моделей становится осмысленным.
1 Агент — программа поверх LLM, которая не просто отвечает на один запрос, а планирует и выполняет несколько шагов, вызывая внешние инструменты (поиск, API, код) и используя их результаты для следующих действий.
2 Reasoning-модель — модель, обученная перед финальным ответом генерировать цепочку внутренних рассуждений (reasoning tokens). Эти токены обычно не показываются целиком, но тратят время и оплачиваются.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Models and pricing, Anthropic — Models overview
Частые вопросы
Можно ли обойтись одной моделью на весь агент?
Reasoning-модель всегда точнее флагмана?
Как понять, что латентность критична именно для моего агента?
Стоит ли ориентироваться на публичные бенчмарки при выборе?
Почему ошибки в агенте накапливаются сильнее, чем в чате?
Сколько стоят думающие модели по сравнению с обычными?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.