PDF テキスト抽出(PDF を TXT に変換)

PDF ファイルをここにドラッグ&ドロップ

この領域をクリックして .pdf ファイルを選ぶこともできます

レイアウト処理
抽出中…
抽出結果
使い方:
1. PDF をアップロードして「テキストを抽出」を押すと、結果が下のテキストボックスに表示されます。そのまま選択してコピーするか、.txt としてダウンロードできます。
2.「ページ範囲」を空欄にすると全ページが対象です。 1-3,5,8 のような組み合わせを書いて、必要なページだけを抽出することもできます。
3. 段落単位で結合:PDF の各行は独立しているため、そのまま抽出すると強制改行で切られた短い文の羅列になります。このスイッチを入れると、文末記号で終わっていない行が前の行に接続され、文章として読めるようになります。原文と 1 行ずつ突き合わせたいときはオフにしてください。
4. ページ区切りを挿入:各ページの先頭に —— N ページ ——の 1 行を加え、後から元のページ番号と照合しやすくします。
5. 空行を削除:PDF のレイアウトが残す大量の空行を取り除きます。オフにすると元の行間構造をできるだけ保ちます。
6. ダウンロードする .txt は UTF-8 で BOM 付きなので、Windows のメモ帳や Excel で開いても日本語・中国語が文字化けしません。
7. スキャン(ページ全体が画像)にはテキストレイヤーがないため中身を抽出できません。ページがその旨をはっきり表示します——本ツールは OCR を行いません。
8. 処理はすべてブラウザ内で完結し、PDF がアップロードされることはありません。
PDF 内のテキストレイヤーを取り出してプレーンテキストにします。ページ範囲を指定でき、段落単位の結合と元の改行の保持を選べて、結果はワンクリックでコピーまたは .txt としてダウンロードできます。中国語・日本語向けに専用の処理を入れてあり、漢字と漢字の間に余計な空白が入ることはありません。これは同種のツールで最もよくある不具合です。ダウンロードする TXT は BOM 付きなのでメモ帳で開いても文字化けしません。ファイルサイズとページ数に制限はなく、登録も不要です。処理はすべてブラウザ内のローカルで行われ、データは一切アップロードされません。

PDF テキスト抽出について

PDF のテキストは段落として保存されておらず、断片として描かれている

これがこのツールにこれらのスイッチがある理由の鍵です。PDF が記述しているのは印刷結果で、「座標 (72, 640) に 11pt の明朝でこの数文字を描く」という記録が並びます。1 ページに数百のそうした命令が入ることもあり、その間に「ここが段落」「この行は終わり」といった情報はありません。つまりテキスト抽出が実際にやっているのは、これらの断片を座標から読める文章へ組み直すことです。まず縦座標で断片を同じ行にまとめ、次に横座標で行内を並べ替え、最後にどの行が同じ段落に属するかを判断します。同じ PDF でもツールによって結果が違うのは、すべてこの工程の差です。

中国語・日本語がとくに壊れやすい理由

隣り合う文字ブロックの間に空白を入れるかどうかは、通常その横方向の間隔で判断します——おおよそ 1 文字幅の 4 分の 1 を超えたら区切りとみなす、という具合です。この規則は英語では成り立ちますが、中国語や日本語では破綻します。もともと字間が空いている組版な上、多くの PDF 生成ソフトが 1 文の中を十数個の断片に分けて個別に配置するため、抽出結果が「こ れ は 一 文 で す」のようになってしまうのです。本ツールのやり方は空白を入れる前に両側が漢字かどうかを確認し、両側とも漢字なら決して入れないというもので、欧文との境界では空白を残します。同じ考え方は段落の結合にも使っています。中国語・日本語の行はそのまま直接つなぎ、欧文の行の間には空白を 1 つ入れ、行末のハイフンは取り除いてからつなぎます。

スキャンから文字が取れないのはツールの問題ではない

PDF がスキャナーやスマートフォンで撮影されたものなら、各ページは実際には 1 枚の画像で、取り出せるテキストレイヤーがそもそもありません——どのツールを使っても結果は空です。本ページは抽出できた文字数が明らかに少ないときに、これはスキャンの可能性が高いとはっきり伝えます。空のファイルを黙って渡すことはしません。画像の中の文字をテキストにするには OCR(光学文字認識)が必要ですが、これは別種の技術で数十 MB の認識モデルを要するため、本サイトでは提供していません。見分け方は簡単です。ビューアで PDF を開き、本文をマウスで選択してみてください——選択できなければスキャンです。

画像変換・Word 変換との役割分担

検索でき、コピーでき、別のプログラムに渡せるプレーンテキストが欲しいなら、このページを使ってください。レイアウトがひと目で分かる画像が欲しいなら——チャットに送る、スライドに貼る、表紙にする—— PDF を画像に変換を使えば、ページごとに PNG または JPG として描画します。プレーンテキストでは文字サイズ・色・罫線・画像が必ず失われますが、それは欠陥ではなく定義です。レイアウトを保ったまま編集を続けたいなら、デスクトップ版 Word の「PDF を開く」がどのオンラインツールより適しています。逆に手元が Markdown で PDF や Word にしたい場合は、サイト内に Markdown → Word / PDF 変換

よくある質問

このツールは PDF をサーバーにアップロードしますか?

されません。ファイルの読み込みとテキスト抽出はすべてブラウザ内のローカルで行われ、ファイルの内容がアップロードされることはありません。契約書、論文、社内文書など外に出せない資料の処理に向いています。ページを開いた後はオフラインでも使い続けられます。

抽出結果が空になるのはなぜですか?

最も多い原因は、その PDF がスキャンや画像を並べたもので、中にテキストレイヤーがないことです。その場合はページが注意を表示します。元ファイルをビューアで開き、本文をマウスで選択してみてください。選択できなければ本当にテキストレイヤーがなく、認識には OCR が必要ですが、本ツールは OCR を提供していません。

抽出した日本語・中国語の文字の間に空白が入るのはなぜですか?

本ツールはこれを避けるよう専用に作られています。隣り合う文字ブロックの間隔が明らかに広く、かつ両側が漢字でない場合にだけ空白を入れます。それでも一部で発生する場合、たいていは元の PDF でその数文字が本当に広い字間で組まれている(見出しや扉ページによくあります)ためで、空白は元の組版を反映しています。結果を Markdown 整形 に貼り付けて、和欧文間隔を整えることもできます。

「段落単位で結合」で、結合すべきでない行までつながりませんか?

その可能性はあります。この処理は句読点と行頭の特徴から推測しています。前の行が句点・疑問符・コロンなどで終わっておらず、かつ現在の行が箇条書きや番号で始まっていない場合にだけ、つなぎます。詩・コード・表のように 1 行ずつ独立した内容は誤って結合されます——そうした文書ではスイッチをオフにすれば、原文と 1 行ずつ対応する結果が得られます。

表は抽出できますか?

表の中の文字は取り出せますが、構造は失われます——プレーンテキストにはセルという概念がないため、1 行の中の複数のセルは空白で区切られた 1 続きの文字列になります。表の構造を保つには、レイアウトを認識できる変換ツールが必要か、あるいはデスクトップ版 Word で PDF を直接開いてください。

ダウンロードした txt をメモ帳で開くと文字化けします

本ツールがダウンロードする .txt は UTF-8 で BOM 付きなので、Windows のメモ帳、Excel、ほとんどのエディタが正しく認識します。ページ内のテキストを手作業でコピーして自分で保存した場合は、保存時に UTF-8 を選んでください。

数百ページの PDF も処理できますか?

できます。抽出は 1 ページずつ進み、途中で進捗が表示され、いつでも中止できます。一部だけ必要ならページ範囲を入力するほうがずっと速く済みます。非常に大きな文書では結果のテキストが数百 KB になることがあり、テキストボックスへの表示が少し重くなります。その場合は .txt としてダウンロードし、エディタで開くことをおすすめします。

暗号化された PDF からも抽出できますか?

開くパスワードが設定された PDF は読み取れません。ページに「パスワードが必要」と表示されるので、先にパスワード保護を解除してください。WPS などのソフトで「暗号化済み」と表示されるがパスワードなしで開けるファイルは影響を受けず、通常どおり処理されます。