PDF 提取文字(PDF 转 TXT)

拖放 PDF 文件到这里

也可以点击此区域选择一个 .pdf 文件

排版处理
正在提取…
提取结果
使用说明:
1. 上传一个 PDF,点“提取文字”,结果会显示在下方的文本框里,可以直接选中复制,也可以下载成 .txt。
2. “页码范围”留空表示全部页面;也可以写 1-3,5,8 这样的组合,只提取需要的那几页。
3. 按段落合并:PDF 的每一行都是独立的,直接提取会得到一堆被硬换行截断的短句。打开这个开关后,没有以句末标点结尾的行会被接到上一行,读起来才像文章;要逐行核对原文时把它关掉。
4. 插入分页标记:在每页开头加一行 —— 第 N 页 ——,方便回头对照原文的页码。
5. 去掉空行:清掉 PDF 排版留下的大量空行;关掉则尽量保留原始的行距结构。
6. 下载的 .txt 使用 UTF-8 并带 BOM,用 Windows 记事本或 Excel 打开中文不会变成乱码。
7. 扫描件(整页都是图片)里没有文字层,提取不出内容,页面会明确提示——本工具不做 OCR。
8. 全部处理在浏览器本地完成,不会上传你的 PDF。
把 PDF 里的文字层提取出来变成纯文本:可以指定页码范围,可以选择按段落合并还是保留原始换行,结果一键复制或下载成 .txt。针对中文做了专门处理——汉字与汉字之间不会被塞进多余的空格,这是同类工具最常见的毛病;下载的 TXT 带 BOM,记事本打开不乱码。不限文件大小与页数,不需要注册。所有处理均在浏览器本地完成,不上传任何数据。

关于 PDF 提取文字

PDF 里的文字不是一段一段存的,是一块一块画上去的

这是理解这个工具为什么有这些开关的关键。PDF 描述的是打印结果,它记录的是「在坐标 (72, 640) 处用 11pt 宋体画上这几个字」,一页里可能有几百条这样的指令,中间没有「这是一个段落」「这一行结束了」这种信息。所以提取文字真正要做的是把这些碎片按坐标拼回可读的文本:先按纵坐标把碎片归到同一行,再按横坐标在行内排序,最后才判断哪些行属于同一个段落。不同工具提取同一份 PDF 结果不一样,差别全在这一步。

为什么中文尤其容易被提坏

判断两个相邻文字块之间要不要补一个空格,通常看它们的横向间距——超过大约四分之一个字宽就算断开。这条规则对英文成立,对中文却会出事:中文排版本来就带字间距,很多 PDF 生成器还会把一句话拆成十几个碎片分别定位,于是提出来的结果变成「这 是 一 句 话」。本工具的做法是在补空格前先看两侧是不是汉字,两侧都是汉字就绝不补,中英混排的边界则保留空格。同样的道理也用在段落合并上:中文行直接首尾相接,英文行之间补一个空格,行末的连字符会被去掉再拼。

扫描件提不出字,这不是工具的问题

如果 PDF 是用扫描仪或手机拍出来的,每一页其实是一张图片,里面根本没有文字层可提——无论用哪个工具,结果都是空的。本页会在提取到的字符明显偏少时直接告诉你这很可能是扫描件,而不是交给你一个空文件。要把图片里的字变成文本需要 OCR(光学字符识别),那是另一类技术,需要几十 MB 的识别模型,本站没有提供。判断方法也很简单:用阅读器打开 PDF,试着用鼠标去选中正文——选不中就是扫描件。

和转图片、转 Word 的分工

如果你要的是能搜索、能复制、能喂给别的程序的纯文本,就用这一页。如果要的是能一眼看到版式的图片——发进聊天窗口、贴进 PPT、做封面——用 PDF 转图片,它按页渲染成 PNG 或 JPG。纯文本必然会丢掉字号、颜色、表格线和图片,这是它的定义,不是缺陷;需要保留排版去继续编辑的话,桌面版 Word 的「打开 PDF」比任何在线工具都更合适。反过来,如果你手上是 Markdown 想变成 PDF 或 Word,站内有 Markdown 转 Word / PDF

常见问题

这个工具会把我的 PDF 上传到服务器吗?

不会。文件读取和文字提取全部在浏览器本地完成,页面不会上传你的文件内容,适合处理合同、论文、内部文档这类不该外传的材料。页面打开之后即使断网也能继续使用。

为什么提取出来是空的?

最常见的原因是这份 PDF 是扫描件或图片拼成的,里面没有文字层。页面会在这种情况下给出提示。你可以先用阅读器打开原文件,用鼠标试着选中一段正文:选不中就说明确实没有文字层,需要 OCR 才能识别,本工具不提供 OCR。

提取出来的中文中间为什么会有空格?

本工具已经专门避免了这种情况:只有在相邻文字块间距明显拉开、且两侧不都是汉字时才会补空格。如果个别地方仍然出现,通常是原 PDF 里那几个字之间真的排了很宽的字距(标题、书名页常见),这时空格反映的是原始排版。可以把结果粘进 Markdown 格式化 做一次中英文间距的整理。

“按段落合并”会不会把不该合的行合到一起?

有可能。这一步是靠标点和行首特征推断的:上一行没有以句号、问号、冒号这类标点结尾,且当前行不是列表项或编号开头时,才会接到一起。诗歌、代码、表格这类每行独立的内容会被误合——遇到这种文档把开关关掉,就能得到与原文一行对一行的结果。

表格能提取出来吗?

表格里的文字能提出来,但结构会丢失——纯文本没有单元格的概念,一行里的几个格子会变成用空格隔开的一串。要保留表格结构,需要的是能识别版面的转换工具,或者直接用桌面版 Word 打开 PDF。

下载的 txt 用记事本打开是乱码怎么办?

本工具下载的 .txt 是 UTF-8 编码并带 BOM 的,Windows 记事本、Excel 和绝大多数编辑器都能正确识别中文。如果你是把网页里的文字手工复制出来另存的,记得在保存时选择 UTF-8 编码。

几百页的 PDF 能处理吗?

可以,提取是一页一页进行的,过程中显示进度并且随时可以取消。如果只需要其中一部分,填上页码范围会快得多。超大文档的结果文本可能有几百 KB,显示在文本框里会稍有卡顿,这时建议直接下载成 .txt 再用编辑器打开。

加密的 PDF 可以提取吗?

设置了打开密码的 PDF 无法读取,页面会提示“需要密码”,请先去除密码保护。在 WPS 等软件中显示“已加密”但无需密码即可打开的文件不受影响,会被正常处理。