Новые аудиомодели Gemini: как Google перестраивает голос
Google обновила линейку аудиомоделей Gemini для распознавания и генерации речи. Разбираем, что меняется для разработчиков голосовых продуктов и где проверить реальные цены и лимиты.

Голосовой интерфейс перестаёт быть надстройкой над текстом и становится отдельным продуктовым слоем. Google развивает аудионаправление Gemini в двух плоскостях сразу: модели принимают звук на вход (распознавание, расшифровка, анализ интонации) и отдают звук на выход (синтез речи, диалоговые агенты, которые говорят в реальном времени). Для тех, кто строит голосовых ассистентов, колл-центры или приложения с диктовкой, это значит конкретное: меньше склеек из отдельных сервисов ASR и TTS, ниже задержка, но и новые вопросы по цене за минуту и по тому, какую модель брать под какую задачу.
Что именно поменялось в аудионаправлении
Gemini исторически умел работать с несколькими типами данных — текст, изображения, видео, звук. Аудиочасть дорабатывается по нескольким направлениям сразу, и важно разделять их, потому что цена, задержка и способ вызова у них разные.
Звук на вход
Модель принимает аудиофайл или поток и работает с ним как с полноценным контекстом: расшифровывает речь, отвечает на вопросы по содержанию записи, выделяет ключевые моменты разговора. Это отличается от классического ASR1 тем, что вы получаете не просто текст, а сразу рассуждение над ним — например, краткое содержание часового созвона без промежуточного шага «сначала расшифруй, потом перескажи».
Звук на выход
Здесь два режима. Первый — синтез речи (TTS): на вход текст, на выходе аудио с управляемым голосом, темпом и, в части моделей, несколькими говорящими в одном фрагменте. Второй — диалоговый режим с низкой задержкой, когда модель слушает и говорит в рамках живой сессии, а не по схеме «запрос — долгий ответ». Именно второй режим интересен для голосовых ассистентов, где пауза в две секунды убивает ощущение разговора.
Главная развилка при проектировании голосового продукта не «какая модель точнее», а «что дороже для моего сценария — задержка или минута аудио». Ответ разный для диктовки заметок и для горячей линии поддержки.
Кому это реально нужно
Не каждому продукту стоит переходить на диалоговую аудиомодель — для части задач дешевле и предсказуемее связка «отдельный ASR плюс текстовая модель плюс отдельный TTS». Сценарии, где нативный звук Gemini даёт ощутимый выигрыш:
- Голосовые агенты реального времени — поддержка, бронирование, навигация по меню голосом, где важна задержка ниже секунды.
- Анализ записей разговоров — расшифровка плюс саммари и извлечение задач из одного вызова, без склейки сервисов.
- Озвучка контента — подкасты, аудиоверсии статей, обучающие материалы с несколькими голосами.
- Доступность — чтение интерфейса и контента вслух для пользователей с нарушениями зрения.
Если ваш сценарий — разовая ночная расшифровка архива звонков без требований к задержке, гнаться за диалоговым режимом незачем: пакетная обработка дешевле.
Как выбрать режим под задачу
Сравнение ниже — по логике сценариев, а не по конкретным названиям версий: линейка Gemini обновляется часто, и точные идентификаторы моделей, цены за минуту и лимиты сверяйте в актуальной документации Google AI for Developers перед запуском в продакшен.
| Сценарий | Режим | Что критично | На что смотреть в прайсе |
|---|---|---|---|
| Живой голосовой ассистент | Диалоговый, потоковый | Задержка, прерывания | Цена за минуту сессии, лимит одновременных сессий |
| Расшифровка и саммари звонков | Звук на вход, пакетно | Точность, длина контекста | Цена за минуту входного аудио |
| Озвучка текста | TTS | Качество голоса, число говорящих | Цена за символ или за секунду аудио |
| Диктовка в приложении | Звук на вход, потоковый | Скорость первой реакции | Стоимость streaming-запроса |
С чего начать разработчику
Порядок, который экономит деньги на экспериментах:
- Сформулируйте метрику успеха. Для диалога это задержка и доля корректно завершённых сценариев, для расшифровки — WER2 и качество саммари. Без метрики вы не сравните модели.
- Проверьте доступность в вашем регионе. Не все аудиовозможности и не все голоса открыты везде; часть функций выходит сначала в превью. Это уточняется в документации, а не угадывается.
- Прогоните свой реальный звук. Тесты на чистой студийной речи вводят в заблуждение. Берите записи с шумом, акцентами и перебиваниями — именно на них модели расходятся.
- Посчитайте стоимость на боевом объёме. Цена за минуту кажется копеечной, пока не умножите на тысячи звонков в день.
- Заложите запасной путь. Если аудиомодель недоступна или превышен лимит, продукт должен деградировать до текста, а не падать.
Где подводные камни
Нативный звук упрощает архитектуру, но не отменяет три проблемы. Первая — задержка на длинном контексте: если вы скормили модели часовую запись и ждёте анализ, это не потоковый режим и отвечает он не мгновенно. Вторая — приватность: голос — биометрия, и отправка записей разговоров во внешний API требует согласия пользователей и проверки, куда именно уходят данные. Третья — языки и акценты: качество распознавания и естественность синтеза сильно зависят от языка, и для русского стоит тестировать отдельно, а не полагаться на англоязычные демо.
Отдельно про голоса в TTS: синтетическая речь, имитирующая конкретного человека, — зона юридического и этического риска. Клонировать чей-то голос без разрешения нельзя, и правила использования голосов у модели нужно читать до запуска, а не после жалобы.
1 ASR (Automatic Speech Recognition) — автоматическое распознавание речи, перевод звука в текст.
2 WER (Word Error Rate) — доля ошибочно распознанных слов; чем ниже, тем точнее расшифровка.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Gemini API — Audio, документация Google AI for Developers, Google AI for Developers — модели Gemini
Частые вопросы
Сколько стоит обработка аудио в Gemini?
Можно ли сделать голосового ассистента без отдельного TTS и ASR?
Насколько хорошо модель работает с русским языком?
Можно ли клонировать чей-то голос для озвучки?
Безопасно ли отправлять записи разговоров во внешний API?
С чего начать, чтобы не потратить бюджет впустую?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.