AI-агенты внутри компании: как не отдать код и данные наружу
Автономные AI-агенты получают доступ к репозиториям, CRM и внутренним документам. Разбираем, где именно утекает интеллектуальная собственность и что настраивать до запуска, а не после инцидента.

За 2024–2025 годы автономные агенты перестали быть демо: Anthropic выпустила Claude с инструментом Computer Use, OpenAI показала Operator и продукты вокруг Assistants API, GitHub раскатил Copilot Workspace, а десятки стартапов продают агентов, которые сами читают тикеты, лезут в репозиторий и правят код. Проблема в том, что агент по определению работает с максимальным доступом: чтобы закрыть задачу, он читает и отправляет наружу то, что раньше не покидало периметр компании — исходники, клиентские базы, черновики патентов. И делает это без человека в цикле.
Ниже — где именно утекает интеллектуальная собственность при работе с агентами, чем провайдеры отличаются по условиям обучения на ваших данных, и что настроить до пилота.
Где утекает ИС при работе с агентом
Утечка через агента редко выглядит как драматичный слив базы. Чаще это медленная эрозия контроля: данные расходятся по логам, векторным хранилищам и промптам сторонних сервисов.
- Обучение на ваших данных. Если провайдер использует ваши промпты и файлы для дообучения1 модели, фрагменты вашего кода или формулировки из внутренних документов теоретически могут всплыть в ответах другим пользователям.
- Логи и хранение. Даже без обучения провайдер хранит запросы для модерации и отладки — обычно 30 дней. За это время содержимое может попасть под запрос правоохранителей или в скомпрометированный аккаунт.
- RAG и векторные базы. Агент часто строит эмбеддинги ваших документов2 во внешнем хранилище. Сами эмбеддинги — производная от текста, и при определённых условиях исходный текст из них частично восстанавливается.
- Действия агента наружу. Агент с доступом к почте, мессенджеру или API может отправить конфиденциальный фрагмент не туда — это уже не утечка через модель, а ошибка автоматизации.
- Инъекция в промпт. Вредоносный текст на странице, которую агент читает, способен заставить его выгрузить содержимое контекста злоумышленнику.
Агент — это не чат-бот с расширенными правами. Это сотрудник без трудового договора, NDA и понимания, что именно нельзя выносить за дверь. Ограничения за него должны прописать вы.
Чем отличаются условия провайдеров
Ключевой вопрос при выборе — обучаются ли на ваших данных по умолчанию, есть ли корпоративный режим без обучения и можно ли развернуть модель в своём контуре. Условия меняются, поэтому финальную формулировку всегда сверяйте в актуальном DPA и Terms провайдера на дату подписания.
| Вариант | Обучение на ваших данных | Развёртывание | Кому подходит |
|---|---|---|---|
| API бизнес-тарифов OpenAI / Anthropic | По заявленным условиям API-данные не идут в обучение по умолчанию | Облако провайдера | Большинство команд без строгих требований к резидентности |
| Enterprise-подписки (ChatGPT Enterprise, Claude for Work) | Не используются для обучения, расширенный контроль хранения | Облако провайдера | Компании с юротделом и требованиями к SLA |
| Облако через гиперскейлера (Azure OpenAI, Bedrock) | Не используются для обучения, данные в вашем облачном аккаунте | Ваш облачный тенант | Те, у кого уже есть договор с облаком и требования к региону |
| Открытые модели (Llama, Qwen, Mistral) на своём железе | Никаких данных наружу | Ваш сервер или частное облако | Максимальная секретность, есть команда MLOps |
Открытые модели на своём железе снимают вопрос обучения на ваших данных полностью, но перекладывают на вас инфраструктуру, обновления и безопасность. Экономии по деньгам это часто не даёт: GPU-хостинг и инженеры стоят дороже подписки, пока нагрузка невелика.
Кому это пригодится, а кому нет
Где агент оправдан
- Рутина без секретов. Разбор входящих тикетов поддержки, черновики ответов, сортировка обращений — данные и так покидают периметр в переписке с клиентом.
- Публичный или открытый код. Агент-помощник в open-source репозитории не создаёт риска утечки ИС: код уже публичен.
- Внутренний контур на открытой модели. Если критично не выпускать данные наружу, а задачи типовые — Llama или Qwen в своём контуре решают их без передачи вовне.
Где стоит притормозить
- Незапатентованные разработки. Пока изобретение не подано в заявку, публичное раскрытие может лишить новизны. Прогонять описание через внешний облачный агент без гарантий неразглашения — риск для будущего патента.
- Клиентские персональные данные. Здесь добавляется закон о персональных данных: передача оператору за пределами согласованного круга — отдельное нарушение, а не только вопрос ИС.
- Ядро продукта. Уникальные алгоритмы и обученные модели — то, что составляет коммерческую тайну. Давать агенту полный доступ к репозиторию с ними без изоляции контекста опасно.
Что настроить до пилота
- Выберите режим без обучения. Бизнес-API или enterprise-тариф с письменной гарантией, что ваши данные не идут в обучение. Проверьте формулировку в договоре, а не в маркетинге.
- Ограничьте права агента. Read-only там, где не нужна запись. Отдельная сервисная учётка с минимальными правами, а не токен админа.
- Держите человека в цикле на необратимых действиях. Отправка писем, коммиты в main, изменения в CRM — только с подтверждением.
- Маскируйте секреты. Ключи, токены и персональные данные не должны попадать в контекст. Используйте фильтры и заглушки на входе.
- Ведите свои логи. Что агент читал и куда обращался — фиксируйте у себя, чтобы после инцидента понять масштаб.
- Обновите NDA и внутренние регламенты. Пропишите, какие категории данных запрещено передавать любым внешним сервисам, включая AI.
Разработчики и юристы здесь не заменяют друг друга: инженер закрывает права доступа и логи, юрист — договор с провайдером и режим коммерческой тайны. Пропуск любой из двух половин оставляет дыру.
1 Дообучение (fine-tuning) — дополнительное обучение готовой модели на новых данных, чтобы она лучше решала конкретную задачу. Если провайдер дообучает общую модель на ваших данных, следы этих данных могут проявиться в ответах другим пользователям.
2 Эмбеддинг — числовое представление текста в виде вектора, по которому система ищет похожие по смыслу фрагменты. Основа RAG (генерации с опорой на поиск): агент подтягивает нужные куски документов в контекст по запросу.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Enterprise privacy and data usage, Anthropic — Commercial Terms of Service
Частые вопросы
Если я использую платный API OpenAI или Anthropic, мои данные точно не идут в обучение?
Можно ли считать данные, переданные агенту, разглашением коммерческой тайны?
Прогон описания изобретения через облачный AI лишает меня возможности запатентовать его?
Открытая модель на своём сервере полностью снимает риск утечки?
Что делать, если агент уже отправил конфиденциальные данные не туда?
Нужен ли отдельный NDA под использование AI-агентов?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.