guide·pdfty 团队··10 分钟阅读

如何把 PDF 转成文本(提取原始文字,编辑分析两相宜)

把任意 PDF 的原始文字提取成纯 .txt 文件,用于编辑、脚本或分析——免费、免注册。还告诉你 PDF 是扫描件时该怎么办。

把 PDF 的原始文字提取成纯文本文件
PDF 进 → 原始、可编辑的文字出

有时候 PDF 恰恰是错误的容器。你不想要字体、页边距和双栏版式——你 要的是文字本身,作为原材料:贴进编辑器、灌进脚本、拿来统计、翻 译、全文检索、丢给分析工具。PDF 转纯文本把内容之外的一切剥掉,而这 正是意义所在。

人们这么做的典型原因:

  • 编辑 —— 改合同套话或报告文字,不用跟 PDF 编辑器搏斗。
  • 脚本和分析 —— grep、词频、数据管线,喂给只吃纯文本的工具。
  • 翻译 —— 大多数翻译流程要的是干净文本,不是带样式的文档。
  • 无障碍和可移植性 —— .txt 在任何东西上都能打开,哪怕是 30 年 前的机器。

开始前说明一点:pdfty 上的 提取文本 用的是同一个引擎——两者 都是把 PDF 里内嵌的文字抽出来。先找到哪个就用哪个,拿到的文字一 样;PDF 转 TXT 以可下载的 .txt 文件交还给你。

PDF 转文本分步教程

1

打开工具

打开 pdfty.com/tools/pdf-to-txt。20 MB、50 页以内免费,无需账号。

Drop PDF here
2

上传你的 PDF

拖进来。有密码保护的话,先用 解密 解开。

Drop PDF here
3

转换

每一页内嵌的文字层按顺序被读出来。只要几秒。

Compressing…69%~2 seconds remaining
4

下载 .txt

一个装着文档全文的纯文本文件。上传内容 1 小时后自动删除。

contract_draft.pdfDownload
5

快速检查输出

扫一眼。如果是空的或乱码,你的 PDF 是扫描件——看下面的 OCR 部分。

All done — file readyAuto-deleted in 1 hour
🔒 pdfty.com/en/tools/pdf-to-txt
pdfty 的 PDF 转 TXT 工具
pdfty PDF 转 TXT:只有文档的文字,别无其他

扫描件问题:没有文字可提取的时候

这是 PDF 文字提取里最常见的意外。PDF 装文字有两种完全不同的方式:

  1. 数字 PDF(从 Word、网页、发票系统导出的)带有真实的文字 层。提取又快又准。
  2. 扫描 PDF(来自扫描仪或手机相机)只装着文字的图片。字面意 义上无物可提——输出会是空的。

扫描件的解法是 OCR——光学字符识别——它读取像素并构建文字层。先把 扫描件过一遍 OCR,再把结果转成文本。准确率取 决于扫描质量。

纯文本 vs Word vs HTML——你需要多少结构?

纯文本是光谱的一端。落点要选得清醒:

你的需求对的工具能保留什么
只要文字,用于脚本或编辑PDF 转 TXT全部文字,按阅读顺序——零版式、零样式
带格式的可编辑文档PDF 转 Word[PDF 转 Word](/zh/tools/pdf-to-word) 保留段落、字体、表格
带标题和链接、可上网页的标记PDF 转 HTML[PDF 转 HTML](/zh/tools/pdf-to-html) 把内容结构化
要拿来计算的表格PDF 转 Excel[PDF 转 Excel](/zh/tools/pdf-to-excel) 专攻表格数据

经验法则:内容是拿来读或处理的,选 TXT;需要有人看到格式的,选 Word 或 HTML。

免费的本地替代方案

一次性的活浏览器最快,但如果提取是你的日常工具链一环——或者文档不 能离开你的机器——这些本地路线很扎实:

pdftotext(poppler-utils——免费、全平台)。 命令行提取的黄金标 准:

pdftotext input.pdf output.txt

加 -layout 可以用空格近似还原原始的分栏位置——对表格类文本真有 用。macOS 经 Homebrew 安装,Linux 用包管理器。

从查看器里复制粘贴。 一两页的话,在 PDF 查看器里全选再贴进编辑 器就行。做好清理换行和偶尔错乱分栏的准备。

Microsoft Word。 Word 能打开 PDF 并转成可编辑文档,再另存为 .txt。更慢,而且过程中会重排文档——只想要原始文字的话属于杀鸡用牛 刀。

实用注意事项

  • 版式没了——设计使然。 多栏页面出来是线性文本,表格坍缩成一行 行,文本框落在内容流里它该落的地方。分栏交错得厉害的话, pdftotext -layout 或 PDF 转 Word 对复杂版式处理得更好。
  • 页眉、页脚和页码会重复。 每页的页眉都会在输出里出现一次。快 速查找删除一轮(或一行脚本)就能清干净。
  • 断词连字。 两端对齐文本里跨行拆开的词(「docu-ment」)保持拆 开。对「- 」后跟小写字母做查找替换可修——不完美但快。
  • 连字和符号。 花哨的排版(fi、fl、弯引号)按 PDF 实际编码的字符 输出——UTF-8 下通常没事,分析前偶尔值得做一轮归一化。
  • 空或乱码的输出几乎总意味着扫描件(先 OCR),少数情况是字体编 码被故意混淆的 PDF。对后者,讽刺的是 OCR 同样是解法:把页面当像 素读。

常见问题

为什么我的输出文件是空的?

你的 PDF 几乎可以肯定是扫描件——页面的图片,没有文字层。先过一遍 OCR,再提取。5 秒测试:在 PDF 查看器里选不中 文字,就是没有文字。

输出会保留加粗、标题和字体吗?

不会——.txt 文件根本无法表示格式,你拿到的是纯字符。这正是特性:编 辑和写脚本时没有任何东西碍手。要格式,用 PDF 转 Word。

表格会怎样?

压平成普通的行,列对齐一般会丢。需要继续处理的表格, PDF 转 Excel 正是为此而生。

这和「提取文本」工具是一回事吗?

是——提取文本 跑的是同一个引擎。两者 都提取文档文字;先找到哪个用哪个。

能只提取几页的文字吗?

先用 拆分 把 PDF 裁到需要的页面,再转换。输 出更聚焦,也不容易撞上 50 页的免费上限。

带密码的 PDF 能用吗?

先用 解密 去掉密码(你得知道密码),然后正 常转换。

我的文档安全吗?

上传只走 HTTPS,没有账号,文件 1 小时后自动删除。不能上传的文档, pdftotext 完全离线运行。

免费限额是多少?

单文件 20 MB、50 页,每天 10 次操作——免注册、无水印。Pro ($9/月)解除上限。

pdfty 团队

pdfty 团队打造注重隐私的在线 PDF 工具——压缩、转换、OCR、签名与保护。文件在 1 小时内删除。 关于我们 →

相关文章