Забирает из документа текстовый слой — тот, который уже есть в файле. Работает мгновенно и не требует распознавания.
Инструмент забирает из PDF готовый текстовый слой — тот, который уже записан внутри файла. Такое бывает у документов, созданных в Word и других редакторах, у выгрузок из учётных и складских систем, у электронных счетов и договоров, которые сформированы программно. В этих случаях текст уже присутствует в файле, и его достаточно просто извлечь.
Порядок действий короткий: вы загружаете PDF, нажимаете «Извлечь текст» и скачиваете результат в формате .txt. Распознавание при этом не запускается, поэтому обработка проходит мгновенно. Порядок страниц сохраняется, и текст в файле идёт в той же последовательности, что и в исходном документе.
Типичные запросы, для которых это подходит: нужно перенести содержимое договора в редактор, скопировать реквизиты из счёта, собрать текст из многостраничной выгрузки для дальнейшей правки. Если вам важен именно текст, а не оформление, извлечение текстового слоя — самый прямой путь.
Пустой результат — это честный ответ, а не ошибка. Он означает, что в PDF нет текстового слоя, и извлекать попросту нечего. Чаще всего так происходит со сканами: страница внутри файла хранится как изображение, а буквы на ней — это картинка, а не текст.
Чтобы заранее понять, есть ли в вашем документе текстовый слой, попробуйте выделить фрагмент в любой обычной программе для просмотра PDF. Если текст выделяется и копируется, извлечение сработает. Если выделяется вся страница целиком как картинка, текстового слоя нет.
В таком случае для сканов и фотографий документов подойдёт отдельный инструмент «Скан в текст»: он распознаёт изображение и превращает его в текст. Этот раздел, наоборот, ничего не распознаёт — он только забирает то, что уже записано в файле.
Извлечение хорошо справляется с простыми документами, где текст идёт сплошным потоком. Со сложной вёрсткой ситуация иная: если в документе несколько колонок, врезки, боковые блоки или нестандартное расположение элементов, порядок строк в итоговом .txt может отличаться от того, как текст выглядит на странице.
Поэтому после извлечения результат стоит перечитать и сверить с оригиналом, особенно в местах, где на странице были колонки или сложное оформление. Иногда фрагменты из соседних колонок могут перемешаться, и это нормальное поведение для потокового извлечения текста.
Если вёрстка критична и текст обязательно должен сохранить исходную структуру, автоматическое извлечение здесь имеет пределы. В таких случаях бывает разумнее восстановить порядок вручную в редакторе или обратиться к специалисту, который аккуратно перенесёт содержимое.
Таблицы сохранятся как текст, но не как таблица. Это значит, что содержимое ячеек попадёт в .txt, однако структура строк и столбцов, границы и выравнивание не переносятся. Данные из таблицы окажутся в виде обычных строк текста, и связь между ячейками придётся восстанавливать самостоятельно.
Если ваша задача — получить именно табличные данные с сохранением строк и столбцов, для этого предназначен отдельный инструмент «Таблица с фото в Excel». Он ориентирован на перенос данных в табличный формат, тогда как этот раздел выдаёт результат в виде плоского текста.
Ориентируйтесь на то, что вам нужно на выходе. Для чтения и правки содержимого достаточно извлечения текста. Для расчётов, фильтров и работы со столбцами понадобится инструмент, который сохраняет табличную структуру.
Извлечение текстового слоя решает узкую задачу: быстро достать из PDF текст, который в нём уже есть. Оно не распознаёт изображения, не восстанавливает оформление и не разбирает таблицы по ячейкам. Понимание этих границ помогает выбрать правильный инструмент с первого раза и не тратить время на попытки, которые не дадут результата.
Если документ оказался сканом, переходите к распознаванию. Если важна структура таблицы, используйте перенос в Excel. Если вёрстка сложная и порядок строк принципиален, будьте готовы проверить и поправить результат вручную.
Наконец, помните, что автоматический перенос текста стоит вычитывать перед тем, как использовать его в важных документах. Для юридически значимых бумаг, договоров и отчётности итоговый текст лучше сверить с оригиналом, а при необходимости привлечь профильного специалиста.