Извлечение текста из PDF (PDF в TXT)

Перетащите файл PDF сюда

либо нажмите сюда и выберите файл .pdf

Обработка текста
Извлечение…
Результат
Как пользоваться:
1. Загрузите PDF и нажмите «Извлечь текст». Результат появится в поле ниже — его можно выделить и скопировать или скачать как .txt.
2. Пустое поле «Диапазон страниц» означает все страницы; можно также написать сочетание вида 1-3,5,8 , чтобы извлечь только нужные страницы.
3. Объединять в абзацы: каждая строка в PDF самостоятельна, поэтому «сырое» извлечение даёт кучу коротких фрагментов, разорванных жёсткими переносами. С включённым переключателем строка, не заканчивающаяся знаком конца предложения, присоединяется к предыдущей, и текст читается как связный. Выключите его, если нужно сверять оригинал строка за строкой.
4. Вставлять отметки страниц: добавляет в начало каждой страницы строку —— Страница N ——, чтобы потом было проще сопоставить результат с номерами страниц оригинала.
5. Убирать пустые строки: убирает множество пустых строк, оставшихся от вёрстки PDF; если выключить, исходная структура межстрочных интервалов сохраняется по возможности.
6. Скачиваемый .txt — это UTF-8 с BOM, поэтому в «Блокноте» Windows и в Excel текст открывается без крякозябр.
7. У скана (страница целиком является изображением) нет текстового слоя, извлечь содержимое невозможно; страница прямо сообщит об этом — инструмент не выполняет OCR.
8. Вся обработка идёт локально в браузере — ваш PDF никуда не загружается.
Вытаскивает текстовый слой из PDF в виде обычного текста: можно указать диапазон страниц, выбрать между объединением строк в абзацы и сохранением исходных переносов, а результат скопировать одним нажатием или скачать как .txt. Для китайского сделана отдельная обработка — между иероглифами никогда не вставляются лишние пробелы, а это самый частый дефект у аналогичных инструментов. Скачиваемый TXT идёт с BOM, поэтому «Блокнот» открывает его без крякозябр. Без ограничений на размер файла и количество страниц, без регистрации. Вся обработка выполняется локально в браузере, никакие данные не загружаются.

Об извлечении текста из PDF

В PDF текст хранится не абзацами, а кусками, нарисованными на странице

Это ключ к тому, почему у инструмента именно такие переключатели. PDF описывает результат печати: он записывает «в координате (72, 640) нарисовать вот эти несколько знаков шрифтом 11pt», на одной странице таких команд могут быть сотни, и между ними нет сведений о том, «где абзац» и «где закончилась строка». Поэтому извлечение текста на деле состоит в том, чтобы собрать эти куски обратно в читаемый текст по координатам: сначала по вертикальной координате отнести куски к одной строке, затем внутри строки упорядочить их по горизонтальной, и только потом решать, какие строки принадлежат одному абзацу. Разные инструменты дают разный результат на одном и том же PDF, и вся разница именно в этом шаге.

Почему китайский текст особенно легко испортить

Нужно ли ставить пробел между двумя соседними блоками текста, обычно решают по горизонтальному промежутку: больше примерно четверти ширины знака — значит разрыв. Для английского правило работает, а на китайском ломается: в китайской вёрстке межзнаковый интервал есть изначально, и многие генераторы PDF ещё и разбивают одно предложение на десяток отдельно позиционированных кусков, из-за чего результат выглядит как «这 是 一 句 话». Здесь сделано иначе: перед вставкой пробела проверяется, являются ли обе стороны иероглифами, и если да, пробел не ставится никогда, а на границе китайского и латиницы пробел сохраняется. Та же логика применяется и при склейке абзацев: китайские строки соединяются встык, между английскими ставится один пробел, а дефис в конце строки убирается перед соединением.

Из скана текст не извлекается, и это не проблема инструмента

Если PDF получен сканером или снят на телефон, каждая страница на самом деле является изображением, и текстового слоя в нём просто нет — какой инструмент ни возьми, результат будет пустым. Эта страница прямо скажет вам, что файл, скорее всего, является сканом, когда извлечённых знаков оказывается заметно мало, вместо того чтобы отдать вам пустой файл. Чтобы превратить знаки на картинке в текст, нужен OCR (оптическое распознавание символов) — это технология другого рода, требующая моделей распознавания в десятки мегабайт, и сайт её не предоставляет. Проверить просто: откройте PDF в программе просмотра и попробуйте выделить мышью основной текст — если не выделяется, это скан.

Чем это отличается от перевода в изображения и в Word

Если вам нужен обычный текст, который можно искать, копировать и передавать другим программам, используйте эту страницу. Если нужна картинка, на которой сразу видна вёрстка — отправить в чат, вставить в презентацию, сделать обложку, — используйте PDF в изображения, он отрисовывает каждую страницу в PNG или JPG. Обычный текст неизбежно теряет кегль, цвет, линейки таблиц и изображения; это его определение, а не недостаток. Если вёрстку нужно сохранить, чтобы продолжить редактирование, настольный Word с его «Открыть PDF» подойдёт лучше любого онлайн-инструмента. В обратную сторону: если у вас на руках Markdown, а нужен PDF или Word, на сайте есть Markdown в Word / PDF .

Частые вопросы

Загружает ли этот инструмент мой PDF на сервер?

Нет. Чтение файла и извлечение текста полностью выполняются локально в браузере, страница не загружает содержимое ваших файлов — это подходит для договоров, статей, внутренних документов и других материалов, которые не должны покидать ваш компьютер. После загрузки страницы ей можно пользоваться и без интернета.

Почему извлечённый текст пустой?

Чаще всего причина в том, что PDF является сканом или собран из изображений, и текстового слоя внутри нет. В таком случае страница выдаст предупреждение. Откройте исходный файл в программе просмотра и попробуйте выделить мышью фрагмент основного текста: если не выделяется, текстового слоя действительно нет и нужен OCR, а его этот инструмент не предоставляет.

Почему в извлечённом китайском тексте появляются пробелы?

Инструмент специально старается этого избежать: пробел ставится только тогда, когда промежуток между соседними блоками текста заметно велик и обе стороны не являются иероглифами. Если пробелы всё же попадаются в отдельных местах, обычно это значит, что в исходном PDF эти знаки действительно свёрстаны с очень широким межзнаковым интервалом (частое дело в заголовках и на титульных страницах), и пробел отражает исходную вёрстку. Результат можно вставить в Форматирование Markdown и привести в порядок интервалы между китайским и латиницей.

Не склеит ли «Объединять в абзацы» строки, которые склеивать не надо?

Может. Этот шаг делает вывод по знакам препинания и по началу строки: строки соединяются только тогда, когда предыдущая не заканчивается точкой, вопросительным знаком, двоеточием и подобными знаками, а текущая не начинается с маркера списка или номера. Стихи, код и таблицы — то, где каждая строка самостоятельна, — будут склеены ошибочно; для таких документов выключите переключатель, и вы получите результат строка в строку с оригиналом.

Извлекаются ли таблицы?

Текст внутри таблицы извлекается, но структура теряется — у обычного текста нет понятия ячейки, поэтому несколько ячеек одной строки превращаются в единую строку, разделённую пробелами. Чтобы сохранить структуру таблицы, нужен конвертер, понимающий вёрстку страницы, либо просто откройте PDF в настольном Word.

Скачанный txt открывается в «Блокноте» крякозябрами — что делать?

Файл .txt, который скачивает этот инструмент, — это UTF-8 с BOM, и «Блокнот» Windows, Excel и подавляющее большинство редакторов распознают его правильно. Если же вы скопировали текст со страницы вручную и сохранили сами, не забудьте выбрать кодировку UTF-8 при сохранении.

Справится ли инструмент с PDF в несколько сотен страниц?

Да, извлечение идёт страница за страницей, по ходу показывается прогресс, и его можно в любой момент отменить. Если нужна только часть, укажите диапазон страниц — так намного быстрее. У очень больших документов результат может занимать сотни килобайт, и показ такого объёма в текстовом поле слегка подтормаживает; в этом случае лучше скачать .txt и открыть его в редакторе.

Можно ли извлечь текст из зашифрованного PDF?

PDF с паролем на открытие прочитать нельзя; страница сообщит «нужен пароль», поэтому сначала снимите защиту паролем. Файлы, которые WPS и подобные программы помечают как «зашифрованные», но которые открываются без пароля, обрабатываются как обычно.