AI-агенты и дезинформация: почему автономия меняет масштаб проблемы
Автономные агенты умеют не просто писать тексты, а сами планировать действия, заводить аккаунты и рассылать сообщения. Разбираем, чем это отличается от обычных чат-ботов и что уже делают против этого разработчики моделей.

За 2024–2025 годы разработчики моделей перешли от чат-ботов, которые отвечают на один запрос, к агентам — системам, которые получают цель и сами дробят её на шаги: ищут в интернете, запускают код, заполняют формы, отправляют сообщения. OpenAI выпустила режим Operator и позже Agents SDK, Anthropic — Claude с использованием компьютера (computer use) и Claude Code, Google развивает агентные сценарии в Gemini. Для дезинформации это смена не инструмента, а масштаба: раньше человек писал текст руками, теперь цель «раскрутить нарратив» можно передать системе, которая работает без пауз.
Разберём, что именно поменялось, какие сценарии злоупотреблений реалистичны уже сейчас, что делают против этого сами компании и где проходит граница между реальной угрозой и хайпом.
Что изменил переход к агентам
Обычная языковая модель генерирует ответ на запрос и останавливается. Агент¹ получает цель и сам решает, какие действия предпринять, чтобы её достичь: вызвать поиск, открыть страницу, кликнуть, повторить. Разница для производства дезинформации в трёх вещах.
- Автономность. Не нужно вручную вести каждую итерацию. Оператор задаёт цель и сценарий, дальше система работает сама.
- Масштаб на человека. Один человек может вести не пять фейковых аккаунтов, а сотни — если у агента есть доступ к их управлению.
- Адаптивность. Агент способен подстраивать тон под площадку и аудиторию, реагировать на комментарии, а не публиковать одинаковый шаблон.
Ключевое слово здесь — «может». Технические ограничения и защитные меры площадок и разработчиков заметно сужают то, что реально работает на практике. Но направление угрозы понятно: узкое место кампаний влияния — не написание текста, а его правдоподобная доставка от множества источников. Именно это агенты автоматизируют.
Реалистичные сценарии злоупотреблений
Отделим то, что технически достижимо сегодня, от кинематографических страхов.
Что достижимо
- Генерация большого объёма текстов под разные площадки с вариациями стиля, чтобы обойти простые фильтры на дубликаты.
- Персонализированные сообщения под конкретного получателя — на основе его публичных постов.
- Имитация диалога: агент отвечает на возражения в комментариях, поддерживая видимость живой дискуссии.
- Перевод и локализация нарратива под разные языки почти без потери связности.
Что пока упирается в барьеры
- Массовая регистрация аккаунтов — площадки используют проверки телефона, поведенческий анализ и капчу; полностью автономный обход нестабилен.
- Долгое незаметное ведение сети ботов — платформы выявляют скоординированное неаутентичное поведение по метаданным, а не по тексту.
- Обход встроенных отказов моделей на прямые запросы вроде «напиши дезинформацию про выборы» — коммерческие модели такие запросы отклоняют.
Проблема не в том, что агент напишет убедительный фейк. Проблема в том, что он может делать это тысячу раз в час, подстраиваясь под каждую площадку, — и стоимость масштабной кампании падает на порядки.
Стоит оговориться: публичных, подтверждённых источниками данных о конкретных кампаниях, целиком построенных на автономных агентах, на момент подготовки материала мало. OpenAI и другие компании периодически публикуют отчёты о выявленных операциях влияния с использованием их моделей — но там речь чаще о генерации контента, чем о полностью автономных агентных сетях. Не выдавайте потенциал за уже случившийся факт.
Что делают разработчики моделей
Крупные лаборатории строят защиту на нескольких уровнях, и подходы у них различаются.
| Мера | Что это | Ограничение |
|---|---|---|
| Отказы на запросы | Модель отклоняет прямые просьбы создать дезинформацию, спам, фишинг | Обходится переформулировкой и разбивкой задачи на «безобидные» шаги |
| Мониторинг использования | Анализ паттернов API-запросов, блокировка аккаунтов за нарушения | Не покрывает открытые модели, запущенные локально |
| Отчёты об операциях влияния | Публичные разборы выявленных кампаний с использованием моделей | Постфактум, показывают только замеченное |
| Ограничения агентных режимов | Подтверждение действий человеком, запрет на ряд операций | Снижает автономность, которую и хотят пользователи |
Отдельная развилка — открытые модели. Веса Llama, Qwen, Mistral и других можно запустить на своём сервере без внешнего мониторинга и без встроенных отказов, если убрать выравнивание дообучением². Здесь защита разработчика по API не работает вообще: контроль смещается на площадки, где контент публикуется, и на детекторы.
Кому это пригодится знать и кому нет
Тема звучит абстрактно, пока не привязать к конкретным ролям.
- Модераторам и Trust & Safety-командам — да. Готовиться стоит к росту объёма и качества контента, а не к новым темам. Сдвиг детекции с «что написано» на «как это опубликовано» (частота, координация, метаданные) — практический вывод.
- Журналистам и фактчекерам — да. Убедительность текста перестаёт быть маркером подлинности. Проверка первоисточника и цепочки распространения важнее стилистического чутья.
- Разработчикам агентных продуктов — да. Логирование действий, подтверждение операций человеком и ограничение доступа к рассылкам снижают риск, что ваш продукт станут использовать во зло.
- Обычному читателю в режиме паники — нет. Апокалиптический вывод «всё в сети теперь фейк» бесполезен. Полезнее конкретная привычка: проверять, кто источник и есть ли он вне соцсети.
- Тем, кто ищет готовый детектор «текст написан ИИ» — нет. Надёжных детекторов сгенерированного текста с приемлемым уровнем ложных срабатываний на сегодня нет; ставить на них модерацию рискованно.
Куда это движется
Гонка идёт по двум направлениям одновременно. С одной стороны, агенты становятся автономнее и дешевле в эксплуатации. С другой — площадки и лаборатории учатся распознавать скоординированное поведение по сигналам, которые не зависят от качества текста. Технология генерации почти всегда опережает технологию детекции, поэтому нагрузка смещается на процедуры: верификацию источников, прозрачность происхождения контента, метки об искусственном происхождении.
Практический итог для тех, кто работает с информацией: ориентироваться на текст как на доказательство подлинности больше нельзя. Работает связка «кто это опубликовал, откуда взялось, подтверждается ли вне одной площадки» — и это применимо независимо от того, писал человек или агент.
¹ Агент — программа на основе языковой модели, которая получает цель и самостоятельно выбирает последовательность действий (поиск, вызов инструментов, запуск кода) для её достижения, а не отвечает одним сообщением на один запрос.
² Дообучение (fine-tuning) — дополнительное обучение готовой модели на своих данных. Может как усиливать защитные ограничения, так и снимать их, если этого добивается тот, кто дообучает.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — отчёты о выявленных операциях влияния и злоупотреблениях, Anthropic — документация по использованию компьютера (computer use)
Частые вопросы
Чем агент опаснее обычного чат-бота для распространения фейков?
Уже были реальные кампании дезинформации на автономных агентах?
Можно ли определить, что текст написан ИИ, и защититься детектором?
Почему открытые модели считают отдельной проблемой?
Что делать обычному читателю, чтобы не попасться?
Какие меры реально снижают риск на стороне разработчика продукта?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.