このツールは PDF をサーバーにアップロードしますか?
されません。ファイルの読み込みとテキスト抽出はすべてブラウザ内のローカルで行われ、ファイルの内容がアップロードされることはありません。契約書、論文、社内文書など外に出せない資料の処理に向いています。ページを開いた後はオフラインでも使い続けられます。
この領域をクリックして .pdf ファイルを選ぶこともできます
1-3,5,8 のような組み合わせを書いて、必要なページだけを抽出することもできます。—— N ページ ——の 1 行を加え、後から元のページ番号と照合しやすくします。これがこのツールにこれらのスイッチがある理由の鍵です。PDF が記述しているのは印刷結果で、「座標 (72, 640) に 11pt の明朝でこの数文字を描く」という記録が並びます。1 ページに数百のそうした命令が入ることもあり、その間に「ここが段落」「この行は終わり」といった情報はありません。つまりテキスト抽出が実際にやっているのは、これらの断片を座標から読める文章へ組み直すことです。まず縦座標で断片を同じ行にまとめ、次に横座標で行内を並べ替え、最後にどの行が同じ段落に属するかを判断します。同じ PDF でもツールによって結果が違うのは、すべてこの工程の差です。
隣り合う文字ブロックの間に空白を入れるかどうかは、通常その横方向の間隔で判断します——おおよそ 1 文字幅の 4 分の 1 を超えたら区切りとみなす、という具合です。この規則は英語では成り立ちますが、中国語や日本語では破綻します。もともと字間が空いている組版な上、多くの PDF 生成ソフトが 1 文の中を十数個の断片に分けて個別に配置するため、抽出結果が「こ れ は 一 文 で す」のようになってしまうのです。本ツールのやり方は空白を入れる前に両側が漢字かどうかを確認し、両側とも漢字なら決して入れないというもので、欧文との境界では空白を残します。同じ考え方は段落の結合にも使っています。中国語・日本語の行はそのまま直接つなぎ、欧文の行の間には空白を 1 つ入れ、行末のハイフンは取り除いてからつなぎます。
PDF がスキャナーやスマートフォンで撮影されたものなら、各ページは実際には 1 枚の画像で、取り出せるテキストレイヤーがそもそもありません——どのツールを使っても結果は空です。本ページは抽出できた文字数が明らかに少ないときに、これはスキャンの可能性が高いとはっきり伝えます。空のファイルを黙って渡すことはしません。画像の中の文字をテキストにするには OCR(光学文字認識)が必要ですが、これは別種の技術で数十 MB の認識モデルを要するため、本サイトでは提供していません。見分け方は簡単です。ビューアで PDF を開き、本文をマウスで選択してみてください——選択できなければスキャンです。
検索でき、コピーでき、別のプログラムに渡せるプレーンテキストが欲しいなら、このページを使ってください。レイアウトがひと目で分かる画像が欲しいなら——チャットに送る、スライドに貼る、表紙にする—— PDF を画像に変換を使えば、ページごとに PNG または JPG として描画します。プレーンテキストでは文字サイズ・色・罫線・画像が必ず失われますが、それは欠陥ではなく定義です。レイアウトを保ったまま編集を続けたいなら、デスクトップ版 Word の「PDF を開く」がどのオンラインツールより適しています。逆に手元が Markdown で PDF や Word にしたい場合は、サイト内に Markdown → Word / PDF 変換 。
されません。ファイルの読み込みとテキスト抽出はすべてブラウザ内のローカルで行われ、ファイルの内容がアップロードされることはありません。契約書、論文、社内文書など外に出せない資料の処理に向いています。ページを開いた後はオフラインでも使い続けられます。
最も多い原因は、その PDF がスキャンや画像を並べたもので、中にテキストレイヤーがないことです。その場合はページが注意を表示します。元ファイルをビューアで開き、本文をマウスで選択してみてください。選択できなければ本当にテキストレイヤーがなく、認識には OCR が必要ですが、本ツールは OCR を提供していません。
本ツールはこれを避けるよう専用に作られています。隣り合う文字ブロックの間隔が明らかに広く、かつ両側が漢字でない場合にだけ空白を入れます。それでも一部で発生する場合、たいていは元の PDF でその数文字が本当に広い字間で組まれている(見出しや扉ページによくあります)ためで、空白は元の組版を反映しています。結果を Markdown 整形 に貼り付けて、和欧文間隔を整えることもできます。
その可能性はあります。この処理は句読点と行頭の特徴から推測しています。前の行が句点・疑問符・コロンなどで終わっておらず、かつ現在の行が箇条書きや番号で始まっていない場合にだけ、つなぎます。詩・コード・表のように 1 行ずつ独立した内容は誤って結合されます——そうした文書ではスイッチをオフにすれば、原文と 1 行ずつ対応する結果が得られます。
表の中の文字は取り出せますが、構造は失われます——プレーンテキストにはセルという概念がないため、1 行の中の複数のセルは空白で区切られた 1 続きの文字列になります。表の構造を保つには、レイアウトを認識できる変換ツールが必要か、あるいはデスクトップ版 Word で PDF を直接開いてください。
本ツールがダウンロードする .txt は UTF-8 で BOM 付きなので、Windows のメモ帳、Excel、ほとんどのエディタが正しく認識します。ページ内のテキストを手作業でコピーして自分で保存した場合は、保存時に UTF-8 を選んでください。
できます。抽出は 1 ページずつ進み、途中で進捗が表示され、いつでも中止できます。一部だけ必要ならページ範囲を入力するほうがずっと速く済みます。非常に大きな文書では結果のテキストが数百 KB になることがあり、テキストボックスへの表示が少し重くなります。その場合は .txt としてダウンロードし、エディタで開くことをおすすめします。
開くパスワードが設定された PDF は読み取れません。ページに「パスワードが必要」と表示されるので、先にパスワード保護を解除してください。WPS などのソフトで「暗号化済み」と表示されるがパスワードなしで開けるファイルは影響を受けず、通常どおり処理されます。