Об извлечении текста из PDF
В PDF текст хранится не абзацами, а кусками, нарисованными на странице
Это ключ к тому, почему у инструмента именно такие переключатели. PDF описывает результат печати: он записывает «в координате (72, 640) нарисовать вот эти несколько знаков шрифтом 11pt», на одной странице таких команд могут быть сотни, и между ними нет сведений о том, «где абзац» и «где закончилась строка». Поэтому извлечение текста на деле состоит в том, чтобы собрать эти куски обратно в читаемый текст по координатам: сначала по вертикальной координате отнести куски к одной строке, затем внутри строки упорядочить их по горизонтальной, и только потом решать, какие строки принадлежат одному абзацу. Разные инструменты дают разный результат на одном и том же PDF, и вся разница именно в этом шаге.
Почему китайский текст особенно легко испортить
Нужно ли ставить пробел между двумя соседними блоками текста, обычно решают по горизонтальному промежутку: больше примерно четверти ширины знака — значит разрыв. Для английского правило работает, а на китайском ломается: в китайской вёрстке межзнаковый интервал есть изначально, и многие генераторы PDF ещё и разбивают одно предложение на десяток отдельно позиционированных кусков, из-за чего результат выглядит как «这 是 一 句 话». Здесь сделано иначе: перед вставкой пробела проверяется, являются ли обе стороны иероглифами, и если да, пробел не ставится никогда, а на границе китайского и латиницы пробел сохраняется. Та же логика применяется и при склейке абзацев: китайские строки соединяются встык, между английскими ставится один пробел, а дефис в конце строки убирается перед соединением.
Из скана текст не извлекается, и это не проблема инструмента
Если PDF получен сканером или снят на телефон, каждая страница на самом деле является изображением, и текстового слоя в нём просто нет — какой инструмент ни возьми, результат будет пустым. Эта страница прямо скажет вам, что файл, скорее всего, является сканом, когда извлечённых знаков оказывается заметно мало, вместо того чтобы отдать вам пустой файл. Чтобы превратить знаки на картинке в текст, нужен OCR (оптическое распознавание символов) — это технология другого рода, требующая моделей распознавания в десятки мегабайт, и сайт её не предоставляет. Проверить просто: откройте PDF в программе просмотра и попробуйте выделить мышью основной текст — если не выделяется, это скан.
Чем это отличается от перевода в изображения и в Word
Если вам нужен обычный текст, который можно искать, копировать и передавать другим программам, используйте эту страницу. Если нужна картинка, на которой сразу видна вёрстка — отправить в чат, вставить в презентацию, сделать обложку, — используйте PDF в изображения, он отрисовывает каждую страницу в PNG или JPG. Обычный текст неизбежно теряет кегль, цвет, линейки таблиц и изображения; это его определение, а не недостаток. Если вёрстку нужно сохранить, чтобы продолжить редактирование, настольный Word с его «Открыть PDF» подойдёт лучше любого онлайн-инструмента. В обратную сторону: если у вас на руках Markdown, а нужен PDF или Word, на сайте есть Markdown в Word / PDF .