Текстовые и мультимодальные агенты: где проходит граница
Один агент читает только текст и стоит копейки за вызов, другой видит скриншоты и графики, но обходится в разы дороже. Разбираем, когда переплата за мультимодальность окупается, а когда это пустая трата токенов.

Осенью 2024 года OpenAI, Anthropic и Google почти одновременно выкатили модели, умеющие не только читать текст, но и разбирать картинки, PDF со сложной вёрсткой и скриншоты интерфейсов. Для тех, кто строит на этом агентов, вопрос перестал быть теоретическим: платить ли за обработку изображений, если задачу можно решить чистым текстом. Разница в цене вызова доходит до нескольких раз, а прирост качества зависит от того, что именно агент делает.
Ниже — про то, где мультимодальность реально меняет результат, а где вы просто жжёте деньги на разбор картинки, из которой всё равно вытаскиваете текст.
Что такое агент и почему модальность важна
Агент — это не просто чат с моделью. Это система, которая получает цель, сама решает, какие шаги предпринять, вызывает инструменты (поиск, код, API), смотрит на результат и корректирует план. Модель здесь — мозг, а модальность определяет, какими глазами этот мозг смотрит на мир.
Текстовый агент принимает и выдаёт только текст. Всё, что он «видит», должно быть предварительно превращено в строки: HTML страницы, содержимое документа, лог ошибки, JSON от API. Мультимодальный агент дополнительно принимает изображения — скриншоты, фотографии, диаграммы, кадры видео, а иногда и звук.
Разница не косметическая. Текстовый агент, которому нужно понять веб-страницу, работает с её кодом. Мультимодальный смотрит на скриншот так же, как человек, — и видит, что кнопка «Оплатить» физически перекрыта баннером, хотя в разметке она есть.
Где текстового агента достаточно
В большинстве бизнес-задач данные изначально текстовые или легко в текст превращаются. Тратить бюджет на мультимодальную модель тут смысла нет.
- Работа с документами, где есть текстовый слой. Договоры, письма, статьи, база знаний. Извлечь текст из PDF или DOCX дешевле, чем скармливать модели картинку каждой страницы.
- Код и данные. Ревью, рефакторинг, генерация SQL, разбор логов — всё это текст по своей природе.
- API-оркестрация. Агент дёргает сервисы, получает JSON, принимает решения. Картинки тут вообще не появляются.
- Классификация и маршрутизация обращений. Тикеты, отзывы, заявки — текст в текст.
Плюс текстовых агентов не только в цене. Они предсказуемее: текст проще логировать, диффать, воспроизводить в тестах. Скриншот в юнит-тест не положишь так же удобно.
Где без мультимодальности не обойтись
Есть класс задач, где потеря визуального контекста ломает всё.
Автоматизация интерфейсов
Агент, который кликает по экрану вместо человека (browser use, computer use), почти всегда работает по скриншотам. Разметка врёт: элемент может быть в DOM, но скрыт, перекрыт, вынесен за пределы вьюпорта. Модель, которая видит пиксели, понимает, где реально можно нажать.
Документы без текстового слоя
Сканы, фотографии чеков, рукописные пометки, таблицы со сложной вёрсткой, где колонки съезжают при извлечении текста. Здесь картинка несёт информацию, которую OCR теряет: подпись от руки, печать, зачёркнутая строка.
Диаграммы и графики
График продаж как изображение и тот же график как таблица чисел — не одно и то же для пользователя, который прислал именно картинку. Мультимодальная модель прочитает тренд прямо с оси.
Правило простое: если из данных перед подачей модели вы всё равно вытаскиваете текст скриптом — берите текстового агента. Мультимодальность нужна там, где важно расположение, а не только содержание.
Цена вопроса
Изображения тарифицируются иначе, чем текст. Провайдеры пересчитывают картинку в токены по её разрешению — чем больше и детальнее, тем дороже. Один скриншот экрана в высоком разрешении легко стоит как тысячи токенов текста. Для агента, который делает десятки шагов и на каждом отправляет свежий скриншот, счёт растёт быстро.
Точные цены и формулы пересчёта изображений в токены меняются от релиза к релизу — сверяйте их в актуальном прайсе конкретного провайдера, а не по цифрам из статей полугодовой давности.
| Критерий | Текстовый агент | Мультимодальный агент |
|---|---|---|
| Вход | Только текст | Текст + изображения (иногда аудио, видео) |
| Стоимость вызова | Ниже | Выше, зависит от разрешения картинки |
| Скорость | Быстрее | Медленнее на разбор изображений |
| Тестируемость | Высокая | Ниже: скриншоты сложнее фиксировать в тестах |
| Сильная сторона | Логика, данные, код, API | UI-автоматизация, сканы, диаграммы |
| Слабое место | Слеп к визуальному контексту | Дорого и избыточно для текстовых задач |
Гибридный подход как норма
На практике зрелые системы редко бывают чисто текстовыми или чисто мультимодальными. Чаще это маршрутизация: дешёвый текстовый агент обрабатывает поток, а на шаги, где нужен визуальный разбор, поднимает мультимодальную модель.
Типичный сценарий агента поддержки: клиент прислал текстовое описание проблемы и скриншот ошибки. Текстовая часть уходит на разбор в дешёвую модель, скриншот — в мультимодальную только если из текста непонятно, что случилось. Так вы платите за «зрение» ровно там, где оно даёт результат.
Как выбрать под свою задачу
- Посмотрите на входные данные. Если они уже текст или превращаются в него без потери смысла — начинайте с текстового агента.
- Найдите шаги, где теряется визуальный контекст: положение элементов, рукописный ввод, вёрстка. Только их отдавайте мультимодальной модели.
- Замерьте стоимость одного полного прохода агента в обоих вариантах на реальных примерах, а не на одном идеальном.
- Заложите деградацию: что делает агент, если картинка нечитаемая или модель зрения недоступна.
Ошибка, которую совершают чаще всего, — брать мультимодальную модель «на всякий случай», потому что она новее и умеет больше. Умеет — не значит нужна. Каждый лишний скриншот в контексте это и деньги, и латентность, и лишний шум, на котором модель может ошибиться.
Итог без пафоса: модальность — это инженерное решение, а не выбор в пользу более модной технологии. Текстовый агент дешевле, быстрее и проще в отладке. Мультимодальный незаменим, когда информация живёт в пикселях. Хорошая архитектура совмещает оба и включает зрение точечно.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI Platform Documentation — Vision and pricing, Anthropic Documentation — Vision and computer use
Частые вопросы
Может ли мультимодальная модель работать в режиме чистого текста?
Всегда ли скриншот лучше HTML для веб-автоматизации?
Насколько дороже обходятся изображения по сравнению с текстом?
Что делать, если картинка нечитаемая или модель зрения недоступна?
С какого типа агента стоит начинать проект?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.