AI-агенты научились действовать, но не объяснять почему
Автономные агенты бронируют, покупают и пишут код без участия человека. Но когда агент ошибается, объяснить его логику почти невозможно — и это уже становится юридической проблемой.

Летом и осенью 2024 года крупные вендоры один за другим выпустили инструменты для автономных агентов: OpenAI и Anthropic представили режимы использования компьютера (computer use у Anthropic, инструментальные вызовы и функции у OpenAI), Google развивает агентные сценарии в Gemini. Общий смысл одинаков: модель не просто отвечает текстом, а совершает цепочку действий — открывает сайты, заполняет формы, вызывает API, отправляет запросы. И тут выясняется неприятное: агент делает, а вот внятно ответить на вопрос «почему ты выбрал именно это» он часто не может.
Это не косметическая проблема. Когда агент от вашего имени отменил заказ, отправил письмо не тому адресату или потратил бюджет на рекламу, вам нужно понимать логику решения — чтобы оспорить, исправить или хотя бы не повторить. Способность системы объяснить свой вывод называется интерпретируемостью, и у современных агентов с ней сложно.
Что вообще значит «объяснение» у агента
Проблема в том, что под объяснением понимают минимум три разные вещи, и их постоянно путают.
- Трассировка действий — что именно агент сделал: какие инструменты вызвал, с какими параметрами, в каком порядке. Это лог, и его можно вести технически надёжно.
- Обоснование выбора — почему агент решил, что именно это действие приближает к цели. Здесь начинаются трудности: модель может сгенерировать правдоподобный текст-обоснование, который не совпадает с реальной причиной вывода.
- Причинное объяснение — какие внутренние представления модели привели к решению. Это предмет исследований по механистической интерпретируемости, и на уровне пользовательского продукта сегодня недоступно.
Когда вендор пишет, что агент «объясняет свои шаги», почти всегда имеется в виду первое или второе. Первое честно, второе коварно.
Почему текст-обоснование может врать
Языковая модель, которую попросили объяснить решение, генерирует объяснение так же, как любой другой текст — предсказывая правдоподобное продолжение. Это не отчёт о внутреннем процессе, а ещё один сгенерированный ответ. Исследователи не раз показывали, что цепочки рассуждений (chain-of-thought) не всегда отражают фактические причины вывода: модель может прийти к ответу одним путём, а «объяснить» его другим, более убедительным.
Объяснение, сгенерированное самой моделью, — это не окно в её логику, а ещё один её ответ, который тоже может быть неверным. Доверять ему как отчёту так же наивно, как верить любому единичному выводу без проверки.
Право на объяснение: что говорит регулятор
Идея, что человек имеет право понимать автоматизированное решение, которое его касается, не нова. В европейском GDPR есть положения об автоматизированных решениях, включая профилирование: субъект данных при определённых условиях вправе не подвергаться решению, основанному исключительно на автоматической обработке, и получить возможность вмешательства человека. Формулировка «право на объяснение» юристами трактуется по-разному — прямого термина в тексте регламента нет, споры о его объёме идут до сих пор.
Отдельно принят Регламент ЕС об искусственном интеллекте (AI Act), который вводит требования прозрачности для высокорисковых систем и поэтапно вступает в силу начиная с 2025 года. Точные сроки и объём обязанностей зависят от категории системы — сверяйтесь с официальным текстом регламента, а не с пересказами.
В России отдельного закона о праве на объяснение решений ИИ на сегодня нет. Отношения регулируются общими нормами о персональных данных и о защите прав потребителей; конкретика по автономным агентам пока не устоялась. Если решение агента затрагивает ваши деньги или договор, опирайтесь на общие механизмы — претензию к компании, предоставившей сервис.
Как устроена прозрачность у основных инструментов
Подходы вендоров различаются. Ниже — сравнение по состоянию на конец 2024 года; проверяйте актуальные возможности в документации, они меняются быстро.
| Возможность | Anthropic (Claude, computer use) | OpenAI (function/tool calling) | Открытые агентные фреймворки |
|---|---|---|---|
| Лог вызванных инструментов | Есть, доступен разработчику | Есть, структурированные tool calls | Есть, зависит от реализации |
| Текстовое обоснование шагов | Модель может проговаривать план | Модель может проговаривать план | Настраивается промптом |
| Гарантия соответствия обоснования реальной логике | Нет | Нет | Нет |
| Контроль пользователя над действиями | Подтверждение шагов настраивается | Настраивается на стороне приложения | Полностью на разработчике |
Общий вывод: технически вы почти всегда можете получить что сделал агент. Гарантированного, проверяемого почему не даёт никто.
Кому это пригодится и кому нет
Прозрачность агента критична не всем одинаково. Разберём по сценариям.
Кому это действительно важно
- Финтех и платежи. Агент, который совершает транзакции, обязан оставлять аудиторский след — не ради красоты, а потому что спор о деньгах без лога вы не выиграете.
- HR и скоринг. Если система отсеивает кандидатов или клиентов, отсутствие объяснимости — это регуляторный и репутационный риск, вплоть до обвинений в дискриминации.
- Медицина и право. Здесь обоснование решения — часть самой услуги. Агент-помощник допустим, автономный решатель без объяснения — нет.
- Разработка с автономным исполнением. Агент, который сам коммитит код или меняет инфраструктуру, должен вести подробную трассировку, иначе разбор инцидента превращается в гадание.
Кому можно не переживать
- Личные черновые задачи. Агент собрал вам подборку статей или набросал план поездки — цена ошибки низкая, глубокая объяснимость избыточна.
- Обратимые действия в песочнице. Если любой шаг легко откатить и он не касается денег и данных других людей, достаточно простого лога.
- Творческие задачи. От генератора идей никто не требует причинного объяснения — там ценен результат, а не протокол.
Что делать на практике
Пока индустрия не выработала стандарта объяснимости, ответственность лежит на том, кто внедряет агента.
- Логируйте каждый вызов инструмента с параметрами и результатом — это ваш единственный надёжный источник правды.
- Для необратимых и денежных действий включайте подтверждение человеком: агент предлагает, человек утверждает.
- Не путайте сгенерированное обоснование с реальной причиной. Используйте его как подсказку, а не как доказательство.
- Ограничивайте полномочия агента технически: лимиты по суммам, белые списки доменов, права доступа — а не только инструкцией в промпте.
- Заранее решите, кто отвечает за ошибку агента внутри вашей компании и как выглядит процедура разбора инцидента.
Автономность агентов растёт быстрее, чем инструменты для их аудита. Пока «почему» остаётся слабым местом, безопаснее строить системы так, будто объяснение вы не получите вовсе — и полагаться на логи, лимиты и человека в контуре принятия решений.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Anthropic — Computer use (документация), EUR-Lex — Regulation on Artificial Intelligence (AI Act)
Частые вопросы
Можно ли доверять объяснению, которое агент сам написал о своём решении?
Есть ли в России право требовать объяснения решения ИИ?
Чем трассировка действий отличается от объяснения логики?
Как защититься от ошибок автономного агента?
Требует ли европейский AI Act объяснимости от всех систем ИИ?
Для каких задач подробная объяснимость агента избыточна?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.