Голосовые дипфейки атакуют: как ИИ-агенты звонят от чужого имени
Мошенники соединяют клонирование голоса с автономными ИИ-агентами, которые сами ведут телефонный разговор. Разбираем, как устроены такие схемы, чем они опасны и как отличить синтетический голос от живого.

В 2024 году сотрудника гонконгского филиала инженерной компании Arup обманули на 25 миллионов долларов: он присоединился к видеозвонку, где все участники — включая финансового директора — оказались дипфейками. Об этом сообщила полиция Гонконга и подтвердили в самой Arup. Тогда синтетические лица и голоса управлялись людьми. Следующий шаг индустрии мошенничества — передать сам разговор автономному ИИ-агенту, который клонирует голос, слушает ответы жертвы и реагирует в реальном времени. Технически всё для этого уже собрано из открытых компонентов.
Что именно изменилось
Раньше голосовое мошенничество упиралось в человеческий ресурс. Живой оператор мог вести один звонок за раз, ошибался, уставал, выдавал себя акцентом или паузами. Клонирование голоса требовало минут чистой записи и часа обработки. Сегодня три технологии сошлись в одной точке.
- Синтез голоса по короткому образцу. Современные модели text-to-speech воспроизводят тембр по 3–30 секундам записи — а такую запись легко взять из голосового сообщения, сторис или рабочего созвона.
- Потоковое распознавание и генерация. Задержка ответа синтетического собеседника упала до сотен миллисекунд, что делает диалог правдоподобным по телефону.
- Агенты1, ведущие сценарий. Языковая модель держит цель разговора («получить код из СМС», «убедить перевести деньги») и подстраивает реплики под ответы жертвы без участия человека.
Именно связка этих трёх частей превращает разовую атаку в конвейер: один сервер может параллельно вести сотни звонков, каждый — своим голосом и по своему сценарию.
Раньше защитой служил дефицит внимания мошенника: он не мог обзвонить всех. Автономный агент снимает этот дефицит — цена одного персонализированного звонка стремится к стоимости API-запроса.
Как выглядит атака на практике
Типовой сценарий против бизнеса выглядит так. Агент звонит бухгалтеру голосом руководителя, ссылается на реальную сделку (данные взяты из утечки или соцсетей), просит срочно оплатить счёт по новым реквизитам и давит на время. Против частных лиц чаще идёт схема «родственник в беде»: голос близкого человека, паника, просьба перевести деньги или продиктовать код.
Ключевой признак — сочетание срочности, необычного канала и запроса на действие с деньгами или кодами. Технология подделывает голос, но не подделывает контекст, который вы можете проверить по другому каналу.
Чем агент отличается от простого робозвонка
Обычный автодозвон проигрывает заранее записанную дорожку и не реагирует на ваши слова. Агент слушает, распознаёт возражение и отвечает на него — если вы говорите «я перезвоню на рабочий номер», он попытается вас удержать. Отсюда и опаснее: сбить его заученной фразой сложнее.
Сравнение: чем защищаются платформы
Разные подходы к обнаружению синтетической речи и дипфейков решают разные задачи. Ни один не даёт стопроцентной гарантии — точность зависит от качества атаки и постоянно меняется.
| Подход | Что делает | Ограничение |
|---|---|---|
| Детекторы синтетической речи (антиспуфинг) | Анализируют артефакты генерации в аудиопотоке | Отстают от новых моделей синтеза; ложные срабатывания на плохой связи |
| Голосовая биометрия банков | Сверяют голос звонящего с эталоном клиента | Уязвима к качественному клонированию; работает только внутри банка |
| Кодовые слова и обратный звонок | Проверка личности вне уязвимого канала | Требует дисциплины людей, а не технологии |
| Маркировка контента (C2PA и аналоги) | Криптоподпись происхождения записи | Не работает для живого телефонного звонка, только для файлов |
Кому это пригодится знать и кому особенно
Тема касается не только специалистов по безопасности.
- Бухгалтерам и финансистам компаний. Вы — приоритетная цель схем с подменой реквизитов. Правило «оплата по устному распоряжению руководителя запрещена» стоит закрепить письменно.
- Пожилым людям и их родственникам. Схема «внук в беде» с настоящим голосом бьёт по эмоциям. Договоритесь о семейном кодовом слове заранее.
- Публичным людям и всем, чей голос есть в открытом доступе. Подкасты, сторис, голосовые в чатах — материал для клонирования.
Кому паниковать не стоит: если вы не совершаете финансовых операций по звонку в принципе и всегда перезваниваете сами на официальный номер, большинство схем разбивается об это простое правило.
Что делать прямо сейчас
- Положите трубку при любой срочной просьбе о деньгах или кодах и перезвоните сами на номер, который знаете, а не на тот, с которого звонили.
- Заведите кодовое слово с близкими и с финансовым отделом на работе.
- Никогда не диктуйте коды из СМС — ни банк, ни оператор их не спрашивают.
- Проверяйте необычные запросы по второму каналу: мессенджер, почта, личная встреча.
- Ограничьте публичные голосовые записи, если вы потенциальная цель.
1 ИИ-агент — программа на основе языковой модели, которая не просто отвечает на один запрос, а удерживает цель и выполняет цепочку действий: слушает, анализирует ответ собеседника и выбирает следующий шаг без участия человека.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Hong Kong police: deepfake video call fraud (сообщения о деле Arup), C2PA — Coalition for Content Provenance and Authenticity
Частые вопросы
Можно ли на слух отличить клонированный голос от настоящего?
Сколько записи моего голоса нужно мошенникам для клонирования?
Защищает ли голосовая биометрия банка от таких атак?
Что делать, если я уже перевёл деньги по такому звонку?
Помогает ли определитель номера, если звонок с известного контакта?
Может ли ИИ-агент вести полноценный разговор без человека?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.