Мультимодальные агенты против текстовых: что меняет голос и видео
Агент, который видит экран и слышит голос, решает задачи иначе, чем чат-бот, читающий только текст. Разбираем, где мультимодальность даёт выигрыш, а где добавляет задержку и счёт за токены.

Осенью 2024 года OpenAI, Google и Anthropic почти одновременно выкатили модели, которые принимают на вход не только текст, но и картинки, аудио и — в случае Gemini — видео. GPT-4o умеет отвечать голосом с задержкой около секунды, Gemini обрабатывает часовые ролики, Claude читает скриншоты интерфейсов. Вопрос для того, кто строит агента, теперь не «какая модель умнее», а «нужны ли моему сценарию глаза и уши, или хватит текста». Разница выливается в деньги: обработка изображения и аудио стоит заметно дороже, чем тот же смысл, переданный текстом.
Что такое мультимодальный агент на практике
Текстовый агент получает строку, вызывает инструменты, возвращает строку. Мультимодальный агент к этому добавляет каналы: он может увидеть скриншот приложения и нажать нужную кнопку, услышать реплику пользователя вместе с интонацией, посмотреть запись экрана и понять, где пользователь застрял.
Ключевое слово — нативная мультимодальность*. Раньше голос обрабатывали конвейером: сначала распознавание речи в текст, потом языковая модель, потом синтез речи обратно. На каждом стыке терялись интонация, паузы, эмоция, и накапливалась задержка. Нативная модель принимает аудио напрямую и слышит, что вопрос задан с раздражением или неуверенностью.
* Нативная мультимодальность
Модель обучена сразу на нескольких типах данных и обрабатывает их в одном представлении, без промежуточной конвертации в текст. Противоположность — pipeline из отдельных моделей распознавания и синтеза, склеенных API-вызовами.
Где мультимодальность реально выигрывает
Не в каждом сценарии дополнительные каналы окупаются. Вот случаи, где они меняют качество, а не просто раздувают счёт.
- Управление интерфейсом (computer use). Агент, который видит экран, кликает и печатает, справляется там, где нет API. Anthropic и OpenAI показали такие возможности в 2024–2025 годах, но точность на сложных сайтах пока далека от человеческой.
- Голосовые ассистенты поддержки. Разговор в реальном времени с распознаванием тона снимает нагрузку с колл-центра. Задержка ниже секунды — тот порог, за которым диалог перестаёт раздражать.
- Разбор видео и записей. Пересказать часовое совещание, найти момент поломки на записи экрана, проверить видео на соответствие требованиям — текстом это не решить.
- Документы со сложной вёрсткой. Таблицы, схемы, рукописные пометки на скане модель-«визуал» читает целиком, а не как выдранный OCR-текст без структуры.
Мультимодальность оправдана там, где информация теряется при переводе в текст. Если данные и так текстовые — вы платите за глаза и уши, которыми не пользуетесь.
Чем платите за дополнительные каналы
Три статьи расходов, которые текстовый агент не несёт вовсе.
Токены. Изображение при подаче в модель разбивается на сотни, а то и тысячи токенов в зависимости от разрешения. Одна картинка в высоком качестве может стоить как несколько абзацев текста. Аудио тарифицируется по секундам или по своим токенам — точные цифры смотрите в актуальном прайсе провайдера, они регулярно меняются.
Задержка. Реальный голосовой диалог требует ответа за 300–800 мс, иначе собеседник чувствует «зависание». Не каждая модель и не каждый регион дата-центра это выдерживают.
Сложность отладки. Когда агент неправильно кликнул по кнопке, воспроизвести баг сложнее, чем когда он выдал неверную строку. Нужны логи скриншотов, записи сессий, разметка того, что модель «видела».
Сравнение подходов
| Параметр | Текстовый агент | Мультимодальный агент |
|---|---|---|
| Каналы ввода | Текст, вызовы инструментов | Текст, изображение, аудио, видео |
| Стоимость запроса | Ниже, предсказуема | Выше, зависит от объёма медиа |
| Типичная задержка | Секунды приемлемы | Для голоса критична, до ~1 сек |
| Работа без API у сервиса | Нет | Да, через «зрение» и клики |
| Отладка | Проще, всё в тексте | Сложнее, нужны записи сессий |
| Когда брать | Данные уже текстовые | Смысл теряется без медиа |
Как выбрать под свою задачу
Простой фильтр в четыре шага, прежде чем тащить в проект дорогую мультимодальную модель.
- Спросите, где живут данные. Если всё уже в тексте — логи, тикеты, база знаний — мультимодальность не нужна.
- Оцените, теряется ли смысл при OCR или транскрипции. Если распознавание в текст съедает структуру таблиц или интонацию — это аргумент за нативную модель.
- Проверьте требования к задержке. Асинхронная обработка видео терпит секунды и минуты. Живой голос — нет.
- Посчитайте счёт на пилоте. Прогоните сотню реальных запросов и посмотрите на реальный расход токенов, а не на обещанную цену за штуку.
Гибрид часто выигрывает
На практике побеждает не «либо-либо», а маршрутизация: дешёвая текстовая модель обрабатывает большинство запросов, а мультимодальная подключается только там, где во входе появилось изображение, аудио или видео. Так вы платите за глаза и уши агента ровно тогда, когда они действительно работают, а не в каждом запросе подряд.
Итог простой: мультимодальный агент — не апгрейд текстового «по умолчанию», а другой инструмент под другие задачи. Он открывает то, что текстом недостижимо — управление интерфейсами, живой голос, разбор видео, — но берёт за это токенами, задержкой и сложностью поддержки. Начинайте с вопроса, что теряется без картинки и звука. Если ничего — не переплачивайте.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Hello GPT-4o, Google DeepMind — Gemini
Частые вопросы
Мультимодальная модель всегда умнее текстовой?
Сколько стоит подать изображение в модель?
Можно ли собрать голосового агента из отдельных моделей вместо нативной?
Что такое computer use у агентов?
С чего начать, если не уверен, нужна ли мультимодальность?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.