這個工具會把我的 PDF 上傳到伺服器嗎?
不會。檔案讀取和文字擷取全部在瀏覽器本機完成,頁面不會上傳你的檔案內容,適合處理合約、論文、內部文件這類不該外傳的材料。頁面開啟之後即使斷網也能繼續使用。
也可以點擊此區域選擇一個 .pdf 檔案
1-3,5,8 這樣的組合,只擷取需要的那幾頁。—— 第 N 頁 ——,方便回頭對照原文的頁碼。這是理解這個工具為什麼有這些開關的關鍵。PDF 描述的是列印結果,它記錄的是「在座標 (72, 640) 處用 11pt 宋體畫上這幾個字」,一頁裡可能有幾百條這樣的指令,中間沒有「這是一個段落」「這一行結束了」這種資訊。所以擷取文字真正要做的是把這些碎片按座標拼回可讀的文字:先按縱座標把碎片歸到同一行,再按橫座標在行內排序,最後才判斷哪些行屬於同一個段落。不同工具擷取同一份 PDF 結果不一樣,差別全在這一步。
判斷兩個相鄰文字塊之間要不要補一個空格,通常看它們的橫向間距——超過大約四分之一個字寬就算斷開。這條規則對英文成立,對中文卻會出事:中文排版本來就帶字間距,很多 PDF 產生器還會把一句話拆成十幾個碎片分別定位,於是提出來的結果變成「這 是 一 句 話」。本工具的做法是在補空格前先看兩側是不是漢字,兩側都是漢字就絕不補,中英混排的邊界則保留空格。同樣的道理也用在段落合併上:中文行直接首尾相接,英文行之間補一個空格,行末的連字號會被去掉再拼。
如果 PDF 是用掃描器或手機拍出來的,每一頁其實是一張圖片,裡面根本沒有文字層可提——無論用哪個工具,結果都是空的。本頁會在擷取到的字元明顯偏少時直接告訴你這很可能是掃描件,而不是交給你一個空檔案。要把圖片裡的字變成文字需要 OCR(光學字元辨識),那是另一類技術,需要幾十 MB 的辨識模型,本站沒有提供。判斷方法也很簡單:用閱讀器開啟 PDF,試著用滑鼠去選取內文——選不中就是掃描件。
如果你要的是能搜尋、能複製、能餵給別的程式的純文字,就用這一頁。如果要的是能一眼看到版面的圖片——發進聊天視窗、貼進簡報、做封面——用 PDF 轉圖片,它按頁算繪成 PNG 或 JPG。純文字必然會丟掉字級、顏色、表格線和圖片,這是它的定義,不是缺陷;需要保留排版去繼續編輯的話,桌面版 Word 的「開啟 PDF」比任何線上工具都更合適。反過來,如果你手上是 Markdown 想變成 PDF 或 Word,站內有 Markdown 轉 Word / PDF 。
不會。檔案讀取和文字擷取全部在瀏覽器本機完成,頁面不會上傳你的檔案內容,適合處理合約、論文、內部文件這類不該外傳的材料。頁面開啟之後即使斷網也能繼續使用。
最常見的原因是這份 PDF 是掃描件或圖片拼成的,裡面沒有文字層。頁面會在這種情況下給出提示。你可以先用閱讀器開啟原檔案,用滑鼠試著選取一段內文:選不中就說明確實沒有文字層,需要 OCR 才能辨識,本工具不提供 OCR。
本工具已經專門避免了這種情況:只有在相鄰文字塊間距明顯拉開、且兩側不都是漢字時才會補空格。如果個別地方仍然出現,通常是原 PDF 裡那幾個字之間真的排了很寬的字距(標題、書名頁常見),這時空格反映的是原始排版。可以把結果貼進 Markdown 格式化 做一次中英文間距的整理。
有可能。這一步是靠標點和行首特徵推斷的:上一行沒有以句號、問號、冒號這類標點結尾,且目前這一行不是清單項或編號開頭時,才會接到一起。詩歌、程式碼、表格這類每行獨立的內容會被誤合——遇到這種文件把開關關掉,就能得到與原文一行對一行的結果。
表格裡的文字能提出來,但結構會遺失——純文字沒有儲存格的概念,一行裡的幾個格子會變成用空格隔開的一串。要保留表格結構,需要的是能辨識版面的轉換工具,或者直接用桌面版 Word 開啟 PDF。
本工具下載的 .txt 是 UTF-8 編碼並帶 BOM 的,Windows 記事本、Excel 和絕大多數編輯器都能正確辨識中文。如果你是把網頁裡的文字手工複製出來另存的,記得在儲存時選擇 UTF-8 編碼。
可以,擷取是一頁一頁進行的,過程中顯示進度並且隨時可以取消。如果只需要其中一部分,填上頁碼範圍會快得多。超大文件的結果文字可能有幾百 KB,顯示在文字框裡會稍有卡頓,這時建議直接下載成 .txt 再用編輯器開啟。
設定了開啟密碼的 PDF 無法讀取,頁面會提示「需要密碼」,請先移除密碼保護。在 WPS 等軟體中顯示「已加密」但無須密碼即可開啟的檔案不受影響,會被正常處理。