Транскрибация через Gemini: что реально умеет и где врёт
Модели Google Gemini научились не просто расшифровывать речь, а размечать говорящих, отделять шум и переводить на лету. Разбираем, где это работает, а где стоит перепроверять вручную.

Расшифровка часового совещания вручную занимает у среднего человека три-четыре часа. Модель обрабатывает ту же запись за несколько минут и выдаёт готовый текст с разбивкой по спикерам. На этом обещания заканчиваются и начинаются нюансы: диаризация путает голоса, термины из вашей отрасли превращаются в бессмыслицу, а таймкоды съезжают на длинных файлах. Ниже — что мультимодальные модели Gemini умеют в задаче транскрибации на практике и где их нельзя оставлять без присмотра.
Сразу оговорка про версии. Google называет свои модели Gemini с номерами поколений (2.0, 2.5 и так далее) и отдельно предлагает распознавание речи через Speech-to-Text API. Единого продукта с точным маркетинговым названием «Gemini 3.5 Transcribe» на момент подготовки материала в публичной документации Google я подтвердить не могу — актуальный список моделей и их возможности сверяйте на ai.google.dev. Поэтому дальше речь идёт о транскрибации через мультимодальные модели Gemini в целом, а не о конкретном релизе с этим именем.
Чем транскрибация через LLM отличается от классического ASR
Классические движки распознавания речи (ASR1) заточены под одну задачу: перевести звук в текст. Мультимодальная модель вроде Gemini принимает аудио как один из типов входных данных наравне с текстом и картинками, а значит, транскрибацию можно совмещать с инструкцией в том же запросе.
Практическая разница выглядит так:
- Классический ASR — на входе файл, на выходе текст и таймкоды. Резюме, перевод, поиск решений по встрече — отдельными инструментами.
- LLM с аудиовходом — в одном промпте можно попросить: «расшифруй, раздели по спикерам, выдели принятые решения и переведи их на английский». Модель делает всё за один проход.
Плата за гибкость — предсказуемость. Специализированный ASR либо распознал слово, либо нет. Языковая модель может «додумать» пропущенный фрагмент так, что он выглядит правдоподобно, но говорящий этого не произносил. Для юридической записи или интервью, где важна дословность, это критично.
Мультимодальная модель не расшифровывает звук — она предсказывает, какой текст вероятнее всего ему соответствует. В 95% случаев это одно и то же. Проблема в оставшихся 5%, которые вы не отличите на глаз.
Что работает хорошо
Разметка говорящих
Диаризация — определение, кто и когда говорит — у мультимодальных моделей заметно чище, чем у старых открытых движков, если голоса различаются по тембру и не перебивают друг друга. На записи созвона двух-трёх человек с нормальным микрофоном разметка «Спикер 1 / Спикер 2» обычно совпадает с реальностью.
Контекст и термины через промпт
Сильная сторона LLM — вы можете заранее подсунуть словарь. Если в промпте перечислить имена участников, название проекта и профессиональные термины, модель распознаёт их точнее. Классический ASR такого «подсказывания» на лету обычно не позволяет.
Перевод и резюме в один проход
Расшифровать англоязычный подкаст и сразу получить краткое содержание на русском — рабочий сценарий. Качество перевода у крупных моделей высокое, а объединение шагов экономит время и деньги на API-вызовах.
Где ломается
- Перекрёстная речь. Когда двое говорят одновременно, диаризация рассыпается: реплики склеиваются или приписываются не тому.
- Редкие имена и аббревиатуры. Без подсказки в промпте фамилии, названия препаратов, тикеры и коды модель заменяет на похожие по звучанию слова.
- Длинные файлы. На записях в несколько часов таймкоды дрейфуют, а модель может «терять» середину. Разбивайте на фрагменты по 20–30 минут.
- Галлюцинации на тишине. В паузах и на фоновом шуме модель иногда генерирует несуществующие фразы. Это известная проблема нейросетевого распознавания в целом.
- Акценты и диалекты. Сильный акцент или диалектная лексика роняют точность так же, как у любого ASR.
Сколько это стоит
Тарификация аудиовхода в API считается обычно за секунды звука или за токены, и цифры у провайдеров меняются несколько раз в год. Приводить конкретную цену за минуту здесь было бы враньём — актуальные ставки смотрите в разделе pricing на сайте платформы. Общая логика такая:
| Сценарий | Что выбрать | Почему |
|---|---|---|
| Разовая расшифровка встречи | Веб-интерфейс модели | Не нужен код, оплата по подписке |
| Поток записей, автоматизация | API с аудиовходом | Тарификация по объёму, интеграция в пайплайн |
| Дословность важнее удобства | Специализированный ASR + ручная вычитка | Меньше риска додуманных фрагментов |
| Расшифровка + перевод + резюме | Мультимодальная LLM | Всё за один проход |
Как получить приемлемый результат
- Подготовьте звук: моно, чистый микрофон, минимум фонового шума. Качество входа влияет на точность сильнее любого промпта.
- Разбейте длинную запись на фрагменты по 20–30 минут, чтобы не плыли таймкоды.
- В промпте перечислите имена спикеров, ключевые термины и попросите отмечать неразборчивые места меткой вроде [неразборчиво], а не додумывать.
- Запросите таймкоды — по ним проще сверять спорные фрагменты с оригиналом.
- Вычитайте результат в местах, где цена ошибки высока: цифры, имена, суммы, юридические формулировки.
Отдельно про конфиденциальность. Если вы отправляете в облачный API запись переговоров, медицинскую консультацию или персональные данные, проверьте условия обработки данных провайдером и то, используются ли ваши файлы для обучения. Для чувствительных записей это не формальность, а вопрос, который стоит закрыть до первого запроса.
1 ASR (Automatic Speech Recognition) — автоматическое распознавание речи, технология перевода звучащей речи в текст.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google AI for Developers — документация Gemini API, Google Cloud Speech-to-Text — документация
Частые вопросы
Существует ли модель под названием Gemini 3.5 Transcribe?
Можно ли доверять расшифровке без ручной проверки?
Почему модель придумывает текст в паузах?
Как улучшить распознавание имён и терминов?
Сколько стоит транскрибация через API?
Безопасно ли отправлять конфиденциальные записи в облако?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.