Фреймворки безопасности для ИИ-агентов: что выбрать
OpenAI, Anthropic, Microsoft и open source выпустили инструменты, которые пытаются удержать автономных агентов от опасных действий. Разбираем, что каждый из них умеет и где границы.

Автономный агент, которому дали доступ к терминалу, почте и банковскому API, может не просто ошибиться — он может выполнить ошибку до конца, без человека в цикле. За 2024–2025 годы вокруг этой проблемы выросла отдельная категория инструментов: фреймворки, которые ограничивают, что агент вправе сделать, и требуют подтверждения на рискованных шагах. У большинства крупных лабораторий и облаков теперь есть свой ответ, и они устроены по-разному.
Речь не о том, чтобы модель «хорошо себя вела» на уровне обучения — это отдельный слой. Речь о рантайме: перехват вызовов инструментов, песочница, проверка вывода перед отправкой, лимиты на действия. Ниже — что предлагают основные игроки на сегодня и чем их подходы отличаются.
Что вообще ограничивают эти фреймворки
Агент* в проде — это не одна модель, а цикл: модель предлагает действие, система его выполняет, результат возвращается в контекст, и так по кругу, пока задача не решена. Опасность живёт на шаге выполнения. Фреймворки безопасности встраиваются именно туда и закрывают несколько типовых рисков:
- Prompt injection — внешний текст (веб-страница, письмо, содержимое файла) содержит инструкцию, которую агент принимает за команду пользователя.
- Избыточные права — агенту выдали доступ к API целиком, хотя задача требует одного метода из ста.
- Необратимые действия — удаление данных, отправка денег, публикация — без подтверждения человека.
- Утечка данных — секреты и персональные данные попадают в вывод или уходят во внешний вызов.
- Циклы и перерасход — агент бесконечно повторяет шаг, сжигая токены и деньги.
Хорошая новость: почти все инструменты сходятся на одной идее — человек должен оставаться в цикле на необратимых действиях. Плохая: единого стандарта, как это описывать, пока нет.
Основные фреймворки и чем они отличаются
OpenAI Agents SDK и guardrails
OpenAI в 2025 году переупаковала свои наработки в Agents SDK — открытую библиотеку на Python и JS для оркестрации агентов. В ней есть механизм guardrails: отдельные проверки, которые запускаются параллельно с основной моделью и могут прервать выполнение, если ввод или вывод нарушает правило. Плюс встроенная передача управления между агентами (handoffs) и трассировка вызовов для отладки. Это скорее каркас для сборки, чем готовая политика безопасности «из коробки».
Anthropic и Constitutional-подход
Anthropic делает ставку на слой самой модели: Claude обучается по принципам Constitutional AI**, а для агентных сценариев компания развивает Model Context Protocol (MCP) — открытый протокол подключения инструментов и источников данных. MCP сам по себе не система безопасности, но задаёт границу: сервер инструментов описывает, что он предоставляет, и клиент решает, что разрешить. Права контролируются на стороне MCP-сервера, а не внутри модели.
Microsoft: Azure AI Content Safety и agent-контуры
Microsoft интегрировала защиту агентов в Azure AI Foundry: сюда входят фильтры контента, детекторы prompt injection (Prompt Shields) и инструменты оценки для агентных приложений. Сильная сторона — привязка к корпоративной инфраструктуре: управление доступом, аудит, логирование в привычной для бизнеса среде. Слабая — вы завязаны на облако Azure.
Open source: NeMo Guardrails, Llama Guard и другие
NVIDIA NeMo Guardrails позволяет описывать разрешённые сценарии диалога и блокировать выход за их пределы через отдельный язык политик. Meta*** выпустила семейство Llama Guard — модели-классификаторы, которые проверяют ввод и вывод на небезопасный контент. Эти инструменты бесплатны и работают локально, но требуют, чтобы вы сами собрали из них рабочий контур и поддерживали его.
Сравнение
| Инструмент | Тип | Что закрывает | Доступность |
|---|---|---|---|
| OpenAI Agents SDK | Оркестрация + guardrails | Проверки ввода/вывода, handoffs, трассировка | Open source, но заточен под API OpenAI |
| Anthropic MCP | Протокол подключения инструментов | Границы доступа к инструментам и данным | Открытый протокол, множество реализаций |
| Azure AI Foundry | Облачный контур | Prompt injection, фильтры, аудит, оценка | Платно, привязка к Azure |
| NeMo Guardrails | Политики диалога | Ограничение сценариев, темы, вызовов | Open source, self-hosted |
| Llama Guard | Модель-классификатор | Небезопасный контент во вводе/выводе | Open source, локальный запуск |
Таблица описывает акценты, а не полноту: почти все эти инструменты можно комбинировать. MCP-сервер под Claude вполне уживается с Llama Guard как фильтром, а guardrails из Agents SDK — с внешней песочницей для терминала.
Кому что пригодится, а кому нет
- Стартап на API OpenAI, собирающий продукт на скорость. Agents SDK экономит время: оркестрация и базовые проверки уже есть. Не подойдёт, если вам нужна независимость от одного поставщика моделей.
- Команда с требованиями по данным (медицина, финансы). Azure AI Foundry или self-hosted-контур на NeMo Guardrails и Llama Guard — там, где важны аудит и контроль, где физически лежат данные. Чистый SaaS без логов аудита здесь не пройдёт комплаенс.
- Проект, который хочет подключать много внешних инструментов. MCP задаёт единый способ описывать доступ — удобно, когда инструментов десятки. Избыточно, если у вас один-два внутренних API.
- Исследователь или инди-разработчик без бюджета. Open source-связка Llama Guard плюс NeMo Guardrails работает локально и ничего не стоит. Цена — вы сами отвечаете за сборку и обновление контура.
Общий принцип не зависит от вендора: агенту нужно давать минимально необходимые права, песочницу для команд с побочными эффектами и обязательное подтверждение человека на всём, что нельзя отменить. Фреймворк ускоряет реализацию, но не отменяет саму архитектуру доступа.
* Агент — программа на основе языковой модели, которая не просто отвечает, а действует: вызывает инструменты, читает результат и продолжает работу в цикле до выполнения задачи.
** Constitutional AI — метод Anthropic, при котором модель обучают следовать набору письменных принципов, а не только размеченным примерам «хорошо/плохо».
*** Meta — компания Meta Platforms, признана в России экстремистской организацией, её деятельность запрещена.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI Agents SDK — документация, Model Context Protocol — спецификация
Частые вопросы
Достаточно ли одного фреймворка, чтобы агент был безопасен?
Чем guardrails отличаются от обучения модели быть безопасной?
Что такое prompt injection и почему это главная угроза для агентов?
Можно ли комбинировать инструменты от разных вендоров?
Сколько стоят эти решения?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.