Расшифровывает речь из видео и собирает субтитры с таймкодами. Строки разбиты по правилам читаемости, а не как получилось.
Задача подходит, когда у вас есть готовое видео или аудио и нужны субтитры в файлах .srt и .vtt с таймкодами. Типичные ситуации: запись вебинара, интервью, обучающего ролика, подкаста или короткого выступления, к которым нужно добавить текст поверх картинки или сделать субтитры для площадки, где видео смотрят без звука.
Порядок работы простой. Вы загружаете видео или аудио, дожидаетесь расшифровки речи, затем скачиваете два файла — .srt и .vtt. После этого стоит открыть видео в плеере вместе с полученным файлом и проверить, что субтитры появляются вовремя и совпадают с тем, что говорят на записи.
Сервис расшифровывает речь и собирает из неё субтитры, разбитые по правилам читаемости. Строки формируются так, чтобы их успевали прочитать за время реплики, а не так, как текст лёг после распознавания. Это отличает задачу от простой стенограммы, где важен только текст без привязки к времени и без ограничений на длину строки.
Ограничение в 42 знака на строку — это принятый предел читаемости. Более длинную строку зритель просто не успевает прочитать за короткое время, пока реплика держится на экране. Поэтому на один кадр приходится не больше двух строк, а на каждую реплику отводится минимум секунда, чтобы субтитры можно было прочесть без спешки.
Разбивку по строкам и кадрам выполняет код сервиса, а не модель. Это значит, что деление текста подчиняется одним и тем же правилам от файла к файлу, а не зависит от того, как распознанный фрагмент был сформулирован. Такой подход даёт предсказуемый результат: длинные фразы разбиваются на несколько кадров, а короткие остаются целиком.
Если вы работаете с площадкой или монтажной программой, где заданы свои требования к длине строки и числу строк, сверьте их с этими правилами заранее. Файлы .srt и .vtt читаются большинством плееров и редакторов, но при необходимости строки можно поправить вручную в любом текстовом редакторе.
Лучше всего расшифровка работает на чистой речи одного или двух говорящих, когда запись без сильных помех, а собеседники говорят по очереди. В таких условиях текст получается более точным, а таймкоды точнее ложатся на реплики.
Хуже результат на шумной записи, при частых перебиваниях и сильном акценте. В этих случаях отдельные слова могут распознаться неверно или строка окажется сдвинута по времени. Поэтому проверка в плеере — обязательный шаг: пройдитесь по ключевым моментам и по фрагментам, где несколько человек говорят одновременно, и поправьте текст, если заметили расхождения.
Музыка и пение для этой задачи не подходят: расшифровка рассчитана на речь и не разбирает вокальные партии. Если в ролике есть песни или длинные музыкальные вставки, субтитры к ним придётся оформлять отдельно вручную. Когда точность текста критична — например, для юридической или медицинской записи — итог лучше вычитать человеку, который понимает содержание.
После скачивания откройте видео в плеере и подключите файл субтитров. Обратите внимание на три вещи: совпадает ли текст с речью, появляются ли строки вовремя и успеваете ли вы их прочитать до смены кадра. Если реплика меняется слишком быстро, это заметно сразу.
Отдельно просмотрите места, где говорят несколько человек, звучат имена собственные, термины и цифры — именно здесь чаще встречаются неточности распознавания. Файл .srt удобно открыть в текстовом редакторе, чтобы вручную поправить слова или сдвинуть таймкод, а .vtt пригодится для веб-плееров. Оба файла содержат одинаковый разбор по строкам.
Если синхронность в целом верная, но текст местами требует правки, редактировать субтитры проще прямо в файле, а не запускать расшифровку заново. Так вы сохраните уже готовое деление строк и таймкоды и внесёте только точечные изменения.
Здесь сервис работает с исходным языком записи: он расшифровывает речь и собирает субтитры с таймкодами на том же языке, на котором говорят в видео. Перевод текста на другой язык в эту задачу не входит.
Если вам нужны субтитры на другом языке, этим занимается отдельный агент-локализатор видео. Логичный порядок такой: сначала получите здесь субтитры на языке оригинала, проверьте их синхронность и точность, а затем передайте выверенный текст в задачу локализации. Это удобнее, чем переводить сырой распознанный текст с возможными ошибками.
Разделение задач помогает контролировать результат на каждом шаге. Сначала вы убеждаетесь, что расшифровка верна и строки читаются, и только потом работаете с переводом, где важно уже другое — соответствие смысла и укладка текста в те же временные рамки.