Автономные агенты: почему они всё ещё требуют няньки
Демо показывают агентов, которые сами бронируют отели и пишут код. На практике задачи длиннее пары шагов рассыпаются: контекст теряется, ошибки копятся, счёт за токены растёт.

В 2024–2025 годах слово «агент» стало главным словом в маркетинге ИИ-компаний. OpenAI выпустила Operator и режим агента в ChatGPT, Anthropic — Claude с управлением компьютером (computer use), Google продвигает связку Gemini с инструментами. Обещание одно: вы ставите цель, агент сам разбивает её на шаги, кликает, пишет, проверяет и приносит результат. На демо это работает. На реальных многошаговых задачах чаще не работает — и понимание, почему именно, экономит вам деньги и время.
Что называют агентом и где проходит граница
Агент — это не просто модель, которая отвечает на вопрос. Это цикл: модель получает цель, выбирает действие (вызвать инструмент, кликнуть, запросить данные), получает результат, оценивает его и решает, что делать дальше. Пока шагов два-три и каждый проверяется человеком, всё выглядит убедительно. Проблемы начинаются, когда цепочка растягивается на десятки действий без остановок.
Простой мысленный эксперимент. Допустим, на каждом шаге агент действует правильно с вероятностью 95% — это оптимистично для сложных задач. Тогда цепочка из 20 независимых шагов доходит до конца без единой ошибки с вероятностью примерно 0.95 в двадцатой степени, то есть около 36%. Даже при 99% надёжности на шаге двадцать шагов дают около 82%. Ошибки не гасятся сами — они накапливаются и уводят агента всё дальше от цели.
Автономность продают как выключатель: включил и ушёл. На деле это регулятор, и он почти всегда стоит не на максимуме, а где-то посередине — там, где человек ещё держит руку на пульте.
Три стены, о которые бьётся автономность
1. Контекст течёт
У любой модели ограниченное окно контекста. Даже большие окна не спасают: чем длиннее история действий, тем сильнее модель «размывает» ранние инструкции и путает, что уже сделано. Агент повторяет выполненный шаг, забывает исходное ограничение («бюджет не больше 50 тысяч») или теряет промежуточный результат. Разработчики борются с этим суммаризацией истории и внешней памятью, но каждое сжатие — это ещё один шанс потерять важную деталь.
2. Ошибки не откатываются
Человек, кликнув не туда, замечает это и жмёт «назад». Агент часто не понимает, что действие провалилось: форма не отправилась, но интерфейс не дал явного сигнала, и модель уверенно идёт дальше по несуществующему сценарию. В задачах, где действия необратимы — отправка платежа, удаление файла, публикация — цена такой ошибки не гипотетическая.
3. Счёт за токены растёт нелинейно
Каждый шаг агент отправляет в модель растущую историю: цель, предыдущие действия, результаты вызовов инструментов, скриншоты интерфейса. Длинная автономная сессия может стоить в десятки раз дороже одиночного запроса. Для разовой задачи это терпимо. Для процесса, который вы хотите гонять сотни раз в день, экономика быстро перестаёт сходиться.
Где агенты уже реально работают
Скепсис не означает «ничего не выйдет». Есть класс задач, где автономность окупается прямо сейчас — их объединяет короткая цепочка, обратимость и наличие проверки.
- Разработка с человеком в цикле. Инструменты вроде агентных режимов в редакторах кода пишут и правят код, но программист читает диффы и запускает тесты. Автономности ровно столько, сколько человек готов проверить.
- Рутинный поиск и сбор данных. Собрать таблицу цен, найти контакты, свести информацию из нескольких страниц — здесь ошибка дешёвая и заметная.
- Черновики и первый проход. Агент готовит заготовку письма, отчёта, брифа, а решение и отправку оставляет вам.
Общий знаменатель — человек остаётся точкой приёмки. Как только его убирают полностью, надёжность падает не плавно, а обрывом.
Полная автономность против ассистента с поводком
| Параметр | Полностью автономный агент | Агент под контролем |
|---|---|---|
| Длина задачи | Десятки шагов без остановок | Короткие блоки с проверкой |
| Цена ошибки | Высокая, ошибки копятся | Низкая, ловится на шаге |
| Стоимость запуска | Растёт с длиной сессии | Предсказуема |
| Готовность сегодня | Демо и узкие ниши | Рабочий инструмент |
Как подойти к агентам без разочарования
Если вы внедряете агента в свой процесс, а не смотрите на ролик из блога вендора, порядок примерно такой:
- Возьмите одну повторяющуюся задачу, а не «автоматизируем всё».
- Разбейте её на шаги и отметьте необратимые — на них ставьте обязательное подтверждение человеком.
- Прогоните агента на 20–30 реальных примерах и посчитайте долю успешных прохождений без вмешательства.
- Оцените стоимость одной успешной сессии в деньгах, а не в токенах абстрактно.
- Сравните с тем, сколько тот же результат стоит сейчас. Если разница не в вашу пользу — автономность пока не про эту задачу.
Полная автономность — не обман, а вопрос зрелости. Надёжность на шаге растёт, окна контекста расширяются, появляются механизмы проверки действий. Но пока обещание «поставьте цель и уйдите» упирается в математику накопления ошибок, честнее говорить не об автономных агентах, а об ассистентах на длинном поводке.
Сноска. Окно контекста — максимальный объём текста (в токенах), который модель удерживает одновременно: и ваш запрос, и историю диалога, и результаты инструментов. Как только объём превышает окно, самое старое содержимое вытесняется или сжимается, и модель начинает «забывать» ранние детали задачи.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Anthropic — Computer use (developer docs), OpenAI — Introducing Operator
Частые вопросы
Значит, вкладываться в агентов сейчас бессмысленно?
Разве большие окна контекста не решают проблему памяти?
Насколько дороже автономная сессия обычного запроса?
Какие задачи безопаснее всего отдавать агенту?
Когда появится действительно автономный агент на любую задачу?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.