如何把 PDF 转成文本(提取原始文字,编辑分析两相宜)
把任意 PDF 的原始文字提取成纯 .txt 文件,用于编辑、脚本或分析——免费、免注册。还告诉你 PDF 是扫描件时该怎么办。

有时候 PDF 恰恰是错误的容器。你不想要字体、页边距和双栏版式——你 要的是文字本身,作为原材料:贴进编辑器、灌进脚本、拿来统计、翻 译、全文检索、丢给分析工具。PDF 转纯文本把内容之外的一切剥掉,而这 正是意义所在。
人们这么做的典型原因:
- 编辑 —— 改合同套话或报告文字,不用跟 PDF 编辑器搏斗。
- 脚本和分析 —— grep、词频、数据管线,喂给只吃纯文本的工具。
- 翻译 —— 大多数翻译流程要的是干净文本,不是带样式的文档。
- 无障碍和可移植性 —— .txt 在任何东西上都能打开,哪怕是 30 年 前的机器。
开始前说明一点:pdfty 上的 提取文本 用的是同一个引擎——两者 都是把 PDF 里内嵌的文字抽出来。先找到哪个就用哪个,拿到的文字一 样;PDF 转 TXT 以可下载的 .txt 文件交还给你。
PDF 转文本分步教程
打开工具
打开 pdfty.com/tools/pdf-to-txt。20 MB、50 页以内免费,无需账号。
上传你的 PDF
拖进来。有密码保护的话,先用 解密 解开。
转换
每一页内嵌的文字层按顺序被读出来。只要几秒。
下载 .txt
一个装着文档全文的纯文本文件。上传内容 1 小时后自动删除。
快速检查输出
扫一眼。如果是空的或乱码,你的 PDF 是扫描件——看下面的 OCR 部分。

扫描件问题:没有文字可提取的时候
这是 PDF 文字提取里最常见的意外。PDF 装文字有两种完全不同的方式:
- 数字 PDF(从 Word、网页、发票系统导出的)带有真实的文字 层。提取又快又准。
- 扫描 PDF(来自扫描仪或手机相机)只装着文字的图片。字面意 义上无物可提——输出会是空的。
扫描件的解法是 OCR——光学字符识别——它读取像素并构建文字层。先把 扫描件过一遍 OCR,再把结果转成文本。准确率取 决于扫描质量。
纯文本 vs Word vs HTML——你需要多少结构?
纯文本是光谱的一端。落点要选得清醒:
| 你的需求 | 对的工具 | 能保留什么 |
|---|---|---|
| 只要文字,用于脚本或编辑 | PDF 转 TXT | 全部文字,按阅读顺序——零版式、零样式 |
| 带格式的可编辑文档 | PDF 转 Word | [PDF 转 Word](/zh/tools/pdf-to-word) 保留段落、字体、表格 |
| 带标题和链接、可上网页的标记 | PDF 转 HTML | [PDF 转 HTML](/zh/tools/pdf-to-html) 把内容结构化 |
| 要拿来计算的表格 | PDF 转 Excel | [PDF 转 Excel](/zh/tools/pdf-to-excel) 专攻表格数据 |
经验法则:内容是拿来读或处理的,选 TXT;需要有人看到格式的,选 Word 或 HTML。
免费的本地替代方案
一次性的活浏览器最快,但如果提取是你的日常工具链一环——或者文档不 能离开你的机器——这些本地路线很扎实:
pdftotext(poppler-utils——免费、全平台)。 命令行提取的黄金标 准:
pdftotext input.pdf output.txt
加 -layout 可以用空格近似还原原始的分栏位置——对表格类文本真有
用。macOS 经 Homebrew 安装,Linux 用包管理器。
从查看器里复制粘贴。 一两页的话,在 PDF 查看器里全选再贴进编辑 器就行。做好清理换行和偶尔错乱分栏的准备。
Microsoft Word。 Word 能打开 PDF 并转成可编辑文档,再另存为 .txt。更慢,而且过程中会重排文档——只想要原始文字的话属于杀鸡用牛 刀。
实用注意事项
- 版式没了——设计使然。 多栏页面出来是线性文本,表格坍缩成一行
行,文本框落在内容流里它该落的地方。分栏交错得厉害的话,
pdftotext -layout或 PDF 转 Word 对复杂版式处理得更好。 - 页眉、页脚和页码会重复。 每页的页眉都会在输出里出现一次。快 速查找删除一轮(或一行脚本)就能清干净。
- 断词连字。 两端对齐文本里跨行拆开的词(「docu-ment」)保持拆 开。对「- 」后跟小写字母做查找替换可修——不完美但快。
- 连字和符号。 花哨的排版(fi、fl、弯引号)按 PDF 实际编码的字符 输出——UTF-8 下通常没事,分析前偶尔值得做一轮归一化。
- 空或乱码的输出几乎总意味着扫描件(先 OCR),少数情况是字体编 码被故意混淆的 PDF。对后者,讽刺的是 OCR 同样是解法:把页面当像 素读。
常见问题
为什么我的输出文件是空的?
你的 PDF 几乎可以肯定是扫描件——页面的图片,没有文字层。先过一遍 OCR,再提取。5 秒测试:在 PDF 查看器里选不中 文字,就是没有文字。
输出会保留加粗、标题和字体吗?
不会——.txt 文件根本无法表示格式,你拿到的是纯字符。这正是特性:编 辑和写脚本时没有任何东西碍手。要格式,用 PDF 转 Word。
表格会怎样?
压平成普通的行,列对齐一般会丢。需要继续处理的表格, PDF 转 Excel 正是为此而生。
这和「提取文本」工具是一回事吗?
是——提取文本 跑的是同一个引擎。两者 都提取文档文字;先找到哪个用哪个。
能只提取几页的文字吗?
先用 拆分 把 PDF 裁到需要的页面,再转换。输 出更聚焦,也不容易撞上 50 页的免费上限。
带密码的 PDF 能用吗?
先用 解密 去掉密码(你得知道密码),然后正 常转换。
我的文档安全吗?
上传只走 HTTPS,没有账号,文件 1 小时后自动删除。不能上传的文档,
pdftotext 完全离线运行。
免费限额是多少?
单文件 20 MB、50 页,每天 10 次操作——免注册、无水印。Pro ($9/月)解除上限。
pdfty 团队打造注重隐私的在线 PDF 工具——压缩、转换、OCR、签名与保护。文件在 1 小时内删除。 关于我们 →