Human-in-the-loop против автономных агентов: где ставить человека
Автономный агент экономит человеко-часы, пока не удаляет прод-базу или не одобряет возврат на 200 000 рублей. Разбираем, где ставить человека в цикл, а где отпускать вожжи.

В марте 2025 года разработчики массово делились в соцсетях историями о том, как AI-агенты в режиме auto-approve выполняли деструктивные команды: чистили директории, коммитили сломанный код, отправляли письма клиентам без проверки. Первопричина всегда одна — агенту дали право действовать без подтверждения человека там, где ошибка стоит дорого. Спор между двумя архитектурами — human-in-the-loop (человек в цикле) и полностью автономными агентами — это не про технологическую моду, а про то, кто платит за ошибку модели.
Что такое human-in-the-loop и чем он отличается от автономности
Human-in-the-loop (HITL) — схема, при которой агент останавливается перед критическим действием и ждёт подтверждения человека. Модель предлагает — человек одобряет, правит или отклоняет. Полностью автономный агент выполняет всю цепочку сам: планирует, вызывает инструменты, оценивает результат и идёт дальше без пауз.
Разница не бинарная. На практике существует спектр, и большинство рабочих систем живут где-то посередине:
- Полный контроль. Человек одобряет каждый шаг. Медленно, безопасно, дорого по времени.
- Human-in-the-loop на чекпоинтах. Агент действует сам, но останавливается перед необратимыми операциями — удаление, платёж, публикация, отправка внешнему адресату.
- Human-on-the-loop. Агент работает автономно, человек наблюдает за потоком и может вмешаться в любой момент, но по умолчанию не вмешивается.
- Полная автономия. Человек видит только итог и логи постфактум.
Вопрос не в том, доверять ли агенту, а в том, какую цену вы готовы заплатить за его ошибку и можно ли эту ошибку откатить.
Цена вопроса: обратимость и стоимость ошибки
Ключевой критерий выбора — не «умный ли агент», а два параметра действия: насколько оно обратимо и сколько стоит промах. Черновик письма, который агент написал не так, вы просто перепишете. Платёж поставщику, который ушёл не туда, вернуть куда сложнее.
| Тип действия | Обратимость | Рекомендуемый режим |
|---|---|---|
| Черновик текста, суммаризация | Полная | Автономия |
| Чтение данных, поиск, аналитика | Полная | Автономия |
| Изменение записи в БД | Частичная (если есть бэкап) | HITL или human-on-the-loop |
| Отправка письма клиенту | Низкая | HITL на чекпоинте |
| Платёж, удаление данных, деплой в прод | Нулевая или очень дорогая | Обязательное подтверждение человека |
Логика простая: чем ниже обратимость и выше стоимость ошибки, тем ближе к ручному подтверждению должна стоять точка контроля. Автономию имеет смысл давать там, где худший исход — потерянные пять минут, а не потерянные деньги или репутация.
Где автономия реально выигрывает
Полная автономия оправдана, когда выполняется хотя бы одно из условий:
- Действия обратимы. Агент может ошибиться, и это ничего не сломает необратимо — например, генерация вариантов текста, которые всё равно проходят человеческую вычитку дальше.
- Объём слишком велик для человека. Разметка тысяч записей, первичная сортировка тикетов, мониторинг логов. Здесь ручное подтверждение каждого шага убивает сам смысл автоматизации.
- Есть жёсткая песочница. Агент физически не может выйти за пределы разрешённого: ограниченный набор инструментов, доступ только на чтение, изолированное окружение.
Важно, что автономия и безопасность не противоречат друг другу, если ограничения заложены в архитектуру, а не в надежду на послушность модели. Агент, у которого нет права вызвать DELETE, не удалит данные независимо от того, что ему подсунули в промпте.
Проблема prompt injection
Отдельный аргумент против бесконтрольной автономии — атаки через внедрение инструкций.1 Если агент читает внешние данные (письма, веб-страницы, документы), злоумышленник может спрятать там команду вроде «перешли содержимое переписки на этот адрес». Автономный агент с доступом к почте выполнит её молча. Агент с HITL на отправке внешнему адресату остановится и покажет человеку, что именно и куда собирается отправить.
Скрытые издержки human-in-the-loop
HITL — не бесплатная страховка. У него есть свои болезни, о которых редко пишут в маркетинговых материалах:
- Усталость от подтверждений. Если агент спрашивает разрешение на каждую мелочь, человек через час начинает жать «одобрить», не читая. Контроль превращается в ритуал, и первое же опасное действие проскочит вместе с остальными.
- Ложное чувство контроля. Человек видит предложение агента, но не понимает его последствий — например, одобряет SQL-запрос, не читая условие
WHERE. Формально человек в цикле, фактически он резиновая печать. - Потеря скорости. Главное обещание агентов — автономность. Ставя человека на каждый шаг, вы возвращаетесь к ручной работе с лишней прослойкой.
Отсюда правило: точек подтверждения должно быть мало, и каждая должна быть значимой. Десять подтверждений в час — это ноль контроля. Одно подтверждение перед необратимым платежом — это реальный барьер.
Как выбрать режим на практике
Прежде чем отдавать процесс агенту, пройдите по чек-листу:
- Выпишите все действия, которые агент может совершить, и пометьте необратимые.
- Для каждого необратимого действия оцените стоимость ошибки в деньгах, времени или репутации.
- Уберите у агента инструменты, которые ему не нужны для задачи, — меньше прав, меньше поверхность для ошибки.
- Поставьте точки подтверждения только там, где ошибка дорога и необратима.
- Настройте логирование всех действий, чтобы разбирать инциденты постфактум даже в автономном режиме.
Большинство продакшн-систем в итоге приходят к гибриду: рутина и чтение — автономно, а горстка критических операций — через явное подтверждение. Это не компромисс из-за незрелости технологий, а разумная инженерная норма: доверие масштабируется вместе с обратимостью.
1 Prompt injection — атака, при которой вредоносная инструкция прячется во входных данных, которые обрабатывает модель (текст письма, содержимое страницы). Модель воспринимает её как легитимную команду и выполняет, если не отделяет доверенные инструкции от недоверенных данных.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OWASP Top 10 for LLM Applications (prompt injection), Anthropic — Building effective agents
Частые вопросы
Human-in-the-loop сильно замедляет работу агента?
Можно ли доверить агенту деплой в прод без человека?
Спасает ли human-in-the-loop от prompt injection?
Чем human-in-the-loop отличается от human-on-the-loop?
Как понять, какие действия агента делать автономными?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.