Агенты с инструментами против чистого рассуждения
Модель, которая умеет вызывать калькулятор и поиск, обгоняет ту, что считает в уме, на задачах с точными числами. Разбираем, где инструменты выигрывают, а где становятся лишним звеном и статьёй расходов.

Спросите GPT-4o или Claude, сколько будет 4817 × 6293, без доступа к инструментам — и получите ответ, который выглядит убедительно, но нередко расходится с правильным. Дайте той же модели вызвать интерпретатор Python — и она напишет 4817*6293, выполнит код и вернёт точные 30 315 381. Разница между этими двумя режимами и есть водораздел между двумя архитектурами агентов: одни рассуждают, опираясь только на веса модели, другие делегируют часть работы внешним инструментам.
Два подхода к одной задаче
Pure-reasoning агент решает задачу внутри одного или нескольких проходов генерации. Всё, что у него есть, — параметры модели и контекст. Приёмы вроде chain-of-thought, self-consistency и деревьев рассуждений повышают точность, но не выводят агента за пределы того, что модель знает и умеет вычислять сама.
Tool-using агент в ходе рассуждения останавливается, формирует вызов внешней функции — поиск в интернете, запрос к базе, выполнение кода, обращение к API, — получает результат и продолжает с учётом этого результата. Схема ReAct1 формализовала этот цикл: чередование мысли (reasoning) и действия (action) до получения ответа.
Модель, которая честно говорит «я не знаю курс доллара на сегодня» и идёт его искать, полезнее модели, которая уверенно называет цифру из тренировочных данных двухлетней давности.
Где инструменты дают явный выигрыш
- Точная арифметика и вычисления. Языковые модели предсказывают токены, а не выполняют математику. Интерпретатор кода снимает эту слабость полностью.
- Свежие данные. Курсы, погода, новости, цены — всё, что изменилось после даты обучения, доступно только через поиск или API.
- Проверяемость. Вызов инструмента оставляет след: какой запрос ушёл, какой ответ пришёл. Это проще аудировать, чем «рассуждение внутри головы».
- Работа с приватными данными. Документы компании, база клиентов, внутренние таблицы — модель их не видела при обучении и получить может только через инструмент.
Где инструменты мешают
Каждый вызов инструмента — это дополнительная задержка, лишние токены в контексте и новая точка отказа. Если задача решается рассуждением, обвязка из вызовов только замедляет ответ и повышает риск. Классический провал tool-using агента: модель решает погуглить очевидное, получает мусорную выдачу и уходит в сторону от правильного ответа, который знала с самого начала.
Сравнение по ключевым параметрам
| Параметр | Pure-reasoning | Tool-using |
|---|---|---|
| Точная арифметика | Ненадёжна | Надёжна через код |
| Свежие факты | Ограничен датой обучения | Доступ через поиск/API |
| Задержка ответа | Ниже | Выше на каждый вызов |
| Стоимость запроса | Предсказуемее | Растёт с числом шагов |
| Точки отказа | Модель | Модель + каждый инструмент |
| Аудируемость | Только текст рассуждения | Логи вызовов и ответов |
| Задачи на логику и язык | Сильная сторона | Инструменты часто лишние |
Цена вопроса
Разница ощущается не только в качестве, но и в счетах. Tool-using агент делает несколько проходов модели на один пользовательский запрос: сформировать вызов, обработать результат, сформировать следующий шаг. Три-четыре итерации ReAct легко превращают один запрос в 5–10 обращений к модели. Каждое обращение оплачивается по числу токенов на вход и выход.
Конкретные цены на токены у OpenAI, Anthropic и Google меняются регулярно, поэтому сверяйтесь с актуальными прайс-листами провайдера перед расчётом бюджета. Общая логика такая: если задача решается одним проходом рассуждения, агент с инструментами обойдётся кратно дороже за тот же результат.
Когда что выбирать
- Задача замкнута в языке и логике — перефразирование, классификация, извлечение смысла, рассуждение по данным из промпта. Берите pure-reasoning.
- Нужны точные числа или свежие факты — расчёты, актуальные данные, работа с внешними источниками. Берите tool-using.
- Смешанный случай — дайте модели инструменты, но так, чтобы она сама решала, вызывать их или нет. Современные API поддерживают режим, когда вызов функции опционален.
Гибрид как стандарт
Противопоставление «рассуждение против инструментов» на практике распадается. Флагманские модели 2024–2025 годов по умолчанию умеют и рассуждать, и вызывать функции, а решение о вызове принимают сами по ходу генерации. Разработчику остаётся не выбрать один лагерь, а настроить границу: какие инструменты дать, при каких условиях их разрешить и как ограничить число шагов, чтобы агент не зациклился.
Практичный ориентир: начинайте с чистого рассуждения, замеряйте, где оно ошибается, и подключайте инструмент точечно под конкретный класс ошибок. Обратный путь — навесить десяток инструментов и надеяться, что модель разберётся — даёт медленного, дорогого и непредсказуемого агента.
1 ReAct (Reasoning + Acting) — схема работы агента, в которой генерация рассуждения чередуется с действиями (вызовами инструментов), а результат действия возвращается в контекст для следующего шага. Предложена в исследовательской статье 2022 года.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: ReAct: Synergizing Reasoning and Acting in Language Models (arXiv), OpenAI Platform — Function calling documentation
Частые вопросы
Что быстрее — агент с инструментами или без?
Можно ли доверять математике модели без интерпретатора кода?
Почему агент с инструментами иногда отвечает хуже, чем без них?
Сколько итераций делает ReAct-агент на один запрос?
Нужно ли выбирать между двумя подходами раз и навсегда?
Как оценить, окупаются ли инструменты в моём случае?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.