Как готовятся к злонамеренному использованию ИИ
Дипфейки, автоматизированный фишинг и генерация вредоносного кода перестали быть теорией. Разбираем, какие угрозы реальны сейчас и что делают против них разработчики моделей и регуляторы.

С чего началась тревога
В феврале 2018 года 26 исследователей из OpenAI, Кембриджа, Оксфорда и ряда других организаций выпустили доклад The Malicious Use of Artificial Intelligence. Он на сотне страниц описывал, как одни и те же технологии одновременно повышают производительность и снижают порог входа для атакующего: то, что раньше требовало команды экспертов, теперь делает один человек с ноутбуком и доступом к модели.
С тех пор прогнозы стали практикой. В 2024 году сотрудник финансовой компании в Гонконге перевёл злоумышленникам около 25 миллионов долларов после видеозвонка, где все участники, включая «финансового директора», были дипфейками. Это не гипотеза из доклада — это готовый сценарий, который повторяется.
Три вектора, о которых говорят чаще всего
Угрозы обычно раскладывают по областям, в которых ИИ снижает стоимость атаки. Удобно держать в голове три:
- Цифровая безопасность. Генерация фишинговых писем без грамматических ошибок и на любом языке, поиск уязвимостей в коде, автоматизация социальной инженерии. Модель не изобретает новый тип атаки — она масштабирует старый и делает его дешевле.
- Информационная среда. Дипфейки голоса и видео, генерация текстов для дезинформационных кампаний, поддельные аккаунты, которые ведут переписку неотличимо от человека.
- Физическая безопасность. Здесь речь про автономные системы и про то, что открытые модели теоретически снижают порог для проектирования опасных веществ. Это направление самое спекулятивное, и серьёзные оценки тут расходятся сильнее всего.
Дело не в том, что ИИ создаёт принципиально новые преступления. Он берёт существующие и убирает из них дорогой ручной труд — а вместе с ним и естественный барьер, который отсекал случайных людей.
Что уже происходит в реальности
Фишинг и мошенничество
Языковые модели убрали главный признак, по которому пользователи вычисляли мошеннические письма — корявый язык. Клонирование голоса по нескольким секундам записи давно доступно в потребительских сервисах, и схема «звонок от родственника, попавшего в беду» получила убедительное звуковое сопровождение.
Синтетические медиа
Дипфейки прошли путь от заметных артефактов до видео, которое сложно отличить на глаз. Проблема не только в самих подделках, но и в обратном эффекте: настоящие записи теперь можно объявить фейком. Юристы называют это liar's dividend — выгода лжеца, когда сама возможность подделки подрывает доверие к любым доказательствам.
Помощь в написании вредоносного кода
Публичные модели обучены отказываться от прямых просьб написать вредонос, но обходные формулировки и разбиение задачи на безобидные куски частично снимают этот барьер. Разработчики отвечают фильтрами, а атакующие — новыми обходами. Это гонка, а не разовое решение.
Как отвечают разработчики моделей
Компании, выпускающие большие модели, применяют несколько слоёв защиты. Ни один из них не полный, работают они вместе.
| Мера | Против чего | Ограничение |
|---|---|---|
| Обучение отказам (RLHF, safety-тюнинг) | Прямые запросы на опасный контент | Обходится переформулировкой и джейлбрейками |
| Модерация ввода и вывода | Массовые злоупотребления через API | Не видит контекст локальных запусков |
| Red-teaming перед релизом | Неочевидные способы обойти защиту | Находит не всё, атакующие изобретательнее |
| Постепенный доступ, KYC для API | Анонимные массовые атаки | Не применим к открытым весам |
| Watermarking сгенерированного контента | Отслеживание происхождения медиа | Часть меток снимается редактированием |
Ключевая развилка — открытые и закрытые модели. Закрытую можно отозвать, ограничить доступ, вести логи. Опубликованные веса вернуть нельзя: как только модель скачали, любые фильтры на стороне провайдера перестают работать. Это и есть главный неразрешённый спор в области — между прозрачностью и контролируемостью.
Что делают регуляторы
Регуляторные подходы пока разнятся по странам. Общее направление — обязательная маркировка ИИ-контента и требования к оценке рисков для наиболее мощных моделей. Европейский AI Act, принятый в 2024 году, вводит категории риска и отдельные требования к системам генерации, но конкретные сроки вступления норм в силу растянуты и уточняются, поэтому детали лучше сверять по актуальной редакции регламента.
Что может сделать организация уже сейчас
Пока идут споры о регулировании, защита от самых частых сценариев — это в основном не технология, а процесс:
- Введите правило верификации для денежных переводов и смены реквизитов — второй канал связи, а не только видеозвонок или письмо. Именно это остановило бы гонконгский случай.
- Обучите сотрудников тому, что голос и видео руководителя больше не доказательство личности.
- Настройте фильтрацию почты с учётом того, что грамотный текст письма перестал быть признаком легитимности.
- Для контента, который вы публикуете сами, ведите внутренний реестр оригиналов — чтобы иметь возможность подтвердить подлинность, когда её оспорят.
- Ограничьте, какие внутренние данные сотрудники загружают в публичные модели: утечка через промпт — тоже вектор.
Ни один пункт не требует своей ИИ-системы защиты. Большинство успешных атак с использованием ИИ бьют не по технике, а по человеческим процессам, которые не были рассчитаны на дешёвую и убедительную подделку.
Универсального решения нет ни у разработчиков, ни у государств. Есть набор частичных мер, каждая из которых закрывает часть поверхности атаки. Реалистичная цель — не устранить угрозу, а поднять её стоимость обратно до уровня, на котором она отсекает большинство.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: The Malicious Use of Artificial Intelligence: Forecasting, Prevention, and Mitigation (2018), EU Artificial Intelligence Act — официальный текст регламента
Частые вопросы
Правда ли, что ИИ создаёт новые виды преступлений?
Можно ли отличить дипфейк от настоящей записи?
Watermarking действительно защищает от подделок?
Почему открытые модели считают более рискованными?
Что делать бизнесу, если бюджета на защиту нет?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.