这个工具会把我的 PDF 上传到服务器吗?
不会。文件读取和文字提取全部在浏览器本地完成,页面不会上传你的文件内容,适合处理合同、论文、内部文档这类不该外传的材料。页面打开之后即使断网也能继续使用。
也可以点击此区域选择一个 .pdf 文件
1-3,5,8 这样的组合,只提取需要的那几页。—— 第 N 页 ——,方便回头对照原文的页码。这是理解这个工具为什么有这些开关的关键。PDF 描述的是打印结果,它记录的是「在坐标 (72, 640) 处用 11pt 宋体画上这几个字」,一页里可能有几百条这样的指令,中间没有「这是一个段落」「这一行结束了」这种信息。所以提取文字真正要做的是把这些碎片按坐标拼回可读的文本:先按纵坐标把碎片归到同一行,再按横坐标在行内排序,最后才判断哪些行属于同一个段落。不同工具提取同一份 PDF 结果不一样,差别全在这一步。
判断两个相邻文字块之间要不要补一个空格,通常看它们的横向间距——超过大约四分之一个字宽就算断开。这条规则对英文成立,对中文却会出事:中文排版本来就带字间距,很多 PDF 生成器还会把一句话拆成十几个碎片分别定位,于是提出来的结果变成「这 是 一 句 话」。本工具的做法是在补空格前先看两侧是不是汉字,两侧都是汉字就绝不补,中英混排的边界则保留空格。同样的道理也用在段落合并上:中文行直接首尾相接,英文行之间补一个空格,行末的连字符会被去掉再拼。
如果 PDF 是用扫描仪或手机拍出来的,每一页其实是一张图片,里面根本没有文字层可提——无论用哪个工具,结果都是空的。本页会在提取到的字符明显偏少时直接告诉你这很可能是扫描件,而不是交给你一个空文件。要把图片里的字变成文本需要 OCR(光学字符识别),那是另一类技术,需要几十 MB 的识别模型,本站没有提供。判断方法也很简单:用阅读器打开 PDF,试着用鼠标去选中正文——选不中就是扫描件。
如果你要的是能搜索、能复制、能喂给别的程序的纯文本,就用这一页。如果要的是能一眼看到版式的图片——发进聊天窗口、贴进 PPT、做封面——用 PDF 转图片,它按页渲染成 PNG 或 JPG。纯文本必然会丢掉字号、颜色、表格线和图片,这是它的定义,不是缺陷;需要保留排版去继续编辑的话,桌面版 Word 的「打开 PDF」比任何在线工具都更合适。反过来,如果你手上是 Markdown 想变成 PDF 或 Word,站内有 Markdown 转 Word / PDF 。
不会。文件读取和文字提取全部在浏览器本地完成,页面不会上传你的文件内容,适合处理合同、论文、内部文档这类不该外传的材料。页面打开之后即使断网也能继续使用。
最常见的原因是这份 PDF 是扫描件或图片拼成的,里面没有文字层。页面会在这种情况下给出提示。你可以先用阅读器打开原文件,用鼠标试着选中一段正文:选不中就说明确实没有文字层,需要 OCR 才能识别,本工具不提供 OCR。
本工具已经专门避免了这种情况:只有在相邻文字块间距明显拉开、且两侧不都是汉字时才会补空格。如果个别地方仍然出现,通常是原 PDF 里那几个字之间真的排了很宽的字距(标题、书名页常见),这时空格反映的是原始排版。可以把结果粘进 Markdown 格式化 做一次中英文间距的整理。
有可能。这一步是靠标点和行首特征推断的:上一行没有以句号、问号、冒号这类标点结尾,且当前行不是列表项或编号开头时,才会接到一起。诗歌、代码、表格这类每行独立的内容会被误合——遇到这种文档把开关关掉,就能得到与原文一行对一行的结果。
表格里的文字能提出来,但结构会丢失——纯文本没有单元格的概念,一行里的几个格子会变成用空格隔开的一串。要保留表格结构,需要的是能识别版面的转换工具,或者直接用桌面版 Word 打开 PDF。
本工具下载的 .txt 是 UTF-8 编码并带 BOM 的,Windows 记事本、Excel 和绝大多数编辑器都能正确识别中文。如果你是把网页里的文字手工复制出来另存的,记得在保存时选择 UTF-8 编码。
可以,提取是一页一页进行的,过程中显示进度并且随时可以取消。如果只需要其中一部分,填上页码范围会快得多。超大文档的结果文本可能有几百 KB,显示在文本框里会稍有卡顿,这时建议直接下载成 .txt 再用编辑器打开。
设置了打开密码的 PDF 无法读取,页面会提示“需要密码”,请先去除密码保护。在 WPS 等软件中显示“已加密”但无需密码即可打开的文件不受影响,会被正常处理。