Насколько автономны AI-агенты на самом деле
Стартапы продают «автономных агентов», которые сами закрывают задачи. На практике до цели без вмешательства человека доходит меньшинство запусков. Разбираем, где заканчивается маркетинг.

В 2024–2025 годах «агент» стал главным словом в продуктовых анонсах: OpenAI выпустила Operator и режим агента в ChatGPT, Anthropic — Claude с управлением компьютером (Computer Use), Google — Gemini с агентными сценариями, а десятки стартапов обещают систему, которая «сама сделает работу за вас». Слово «автономный» в этих релизах встречается постоянно. Проблема в том, что метрики, которые компании публикуют сами, рисуют куда более скромную картину: на многошаговых реальных задачах агенты доходят до конца без человека далеко не всегда, а на некоторых бенчмарках — реже, чем в половине случаев.
Что вообще называют «агентом»
Строго говоря, AI-агент — это не одна модель, а связка: языковая модель принимает решения, а вокруг неё крутится цикл, который даёт ей инструменты (браузер, терминал, API, файловую систему), скармливает результат обратно и повторяет, пока задача не решена или не упрётся в лимит шагов.
Ключевое отличие от обычного чата — не «умнее ответ», а наличие действий во внешнем мире и петли обратной связи. Агент может кликнуть кнопку, отправить письмо, запустить код. Именно поэтому цена ошибки у него выше, чем у чат-бота: неправильный ответ можно проигнорировать, а вот отправленное не туда письмо или удалённый файл — уже нет.
«Автономность» обычно измеряют по одной шкале: сколько шагов подряд система проходит без того, чтобы человек её поправил, подтвердил действие или переформулировал задачу.
Уровни автономии
- Ассистент. Предлагает, но ничего не делает сам. Каждый шаг подтверждает человек. Сюда попадает большинство «копилотов».
- Полуавтономный. Выполняет цепочку действий, но останавливается на «опасных» шагах — покупка, отправка, удаление — и ждёт подтверждения.
- Автономный в песочнице. Работает сам от начала до конца, но в ограниченной среде, где ошибка не выходит наружу (тестовый репозиторий, изолированный браузер).
- Автономный в проде. Действует в реальных системах без человека в цикле. На практике почти никто не даёт агенту такие права без жёстких ограничений.
Что показывают цифры
Разработчики агентов любят сравнивать себя на публичных бенчмарках, и именно эти цифры полезнее пресс-релизов, потому что их считает не маркетинг. Самые известные наборы задач:
| Бенчмарк | Что проверяет | Формат задач |
|---|---|---|
| SWE-bench (и Verified) | Умение чинить реальные баги в открытом коде | Issue из GitHub-репозиториев |
| WebArena / WebVoyager | Действия в браузере на живых сайтах | Заказать, найти, заполнить форму |
| GAIA | Многошаговые задачи с инструментами | Вопросы, требующие поиска и рассуждения |
Точные проценты по этим наборам меняются с каждым релизом моделей — сверяйтесь с актуальными таблицами лидеров, а не запоминайте конкретное число. Но устойчивая закономерность такая: чем ближе задача к «реальной работе в несколько десятков шагов», тем сильнее падает доля успешных прохождений. На аккуратно отобранных задачах по коду лучшие системы уже перешагнули половину, а на длинных браузерных сценариях с живыми сайтами результаты заметно скромнее — сайты меняются, всплывают капчи, ломается вёрстка.
Автономность агента — это не свойство модели, а компромисс между тем, сколько прав вы ему дали, и тем, сколько ошибок готовы за ним разгребать.
Где ломается «сам всё сделает»
Причины, по которым агент не доходит до цели, повторяются от продукта к продукту.
- Накопление ошибок. Если на каждом шаге агент прав, скажем, на 95%, то на цепочке из 20 шагов вероятность пройти всё без единой ошибки падает примерно до трети. Длинные задачи наказывают за любую нестабильность.
- Отсутствие понимания, что он застрял. Модель часто уверенно продолжает неверный путь вместо того, чтобы остановиться и попросить помощи. Признать «я не знаю» ей сложнее, чем сгенерировать правдоподобное действие.
- Хрупкость внешней среды. Изменился селектор кнопки, сайт показал баннер о cookie, API вернул нестандартную ошибку — и цепочка рассыпается.
- Промпт-инъекции. Агент, читающий веб-страницы или письма, может наткнуться на текст, который перехватывает его инструкции. Для системы с доступом к вашей почте или платежам это не гипотетический риск.
Почему демо выглядят лучше реальности
В показательных роликах задачи подобраны, среда стабильна, а число шагов невелико. В реальном использовании задача формулируется неточно, среда живёт своей жизнью, а пользователь ждёт результата с первого раза. Разрыв между «сработало на сцене» и «сработало у меня» — не обман, а следствие того, что автономность нелинейно проседает с ростом сложности.
Как это выглядит в деньгах и времени
Автономность стоит денег напрямую. Агент, который делает 30 шагов вместо одного ответа, тратит в десятки раз больше токенов, а значит и оплаты по API. Если он к тому же ошибается и переделывает, счёт растёт ещё быстрее.
Вторая часть цены — человек, который всё равно проверяет результат. Автономный агент, за которым нужно перепроверять каждый шаг, экономит меньше, чем кажется: вы платите и за токены, и за ревью. Экономика сходится там, где ошибку дёшево заметить и откатить (черновик текста, набросок кода в отдельной ветке) и не сходится там, где ошибка дорогая и необратимая.
- Хорошие кандидаты на автономию: генерация черновиков, сортировка и разметка данных, рутинные операции в песочнице.
- Плохие кандидаты: платежи, отправка сообщений клиентам, изменения в продакшене без ревью, юридически значимые действия.
Что делать, если вы внедряете агента
- Определите, какое действие агента вам будет дорого откатывать, и поставьте перед ним обязательное подтверждение человека.
- Ограничьте число шагов и введите тайм-аут — иначе агент может уйти в бесконечный цикл и в счёт за токены.
- Дайте ему минимальные права: доступ только к тем инструментам и данным, что нужны задаче.
- Логируйте каждое действие, чтобы можно было понять, где всё пошло не так.
- Начинайте с песочницы и сравнивайте реальный процент успеха на ваших задачах, а не на чужих бенчмарках.
Вывод простой: современные агенты уже полезны, но «автономность» в их описаниях чаще означает «может выполнить цепочку действий», а не «сделает работу вместо вас и не подведёт». Реальная ценность сегодня — в полуавтономных сценариях, где машина делает черновую часть, а человек остаётся на кнопке подтверждения дорогих решений.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Anthropic — Computer use (developer documentation), OpenAI — Introducing Operator
Частые вопросы
AI-агент действительно может работать без человека сутками?
Чем агент отличается от обычного чат-бота вроде ChatGPT?
Можно ли доверить агенту платежи или отправку писем клиентам?
Насколько агенты успешны на тестах?
Сколько стоит запускать автономного агента?
Что такое промпт-инъекция и почему это опасно для агента?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.