提取文本

将 PDF 中的所有文本提取为纯文本文件

pdfty 的提取工具能取出 PDF 中的每一个字符,并交付为一份干净的纯文本文件。它远胜于全选复制粘贴——后者经常打乱多栏排版、漏掉文本框,处理长文档时更是力不从心——而提取工具一次即可处理全部 50 页,并保持阅读顺序。

提取基于 PyMuPDF 运行,它直接读取 PDF 的内部文本结构并重建自然的阅读顺序——包括双栏排版、表格、页眉和脚注。完整的 Unicode 原样保留:西里尔文、中日韩文字、阿拉伯文、带变音符的字符。提取结果非常适合把文档送入翻译工具、搜索索引或 AI 助手,也适合从论文中摘录和统计字数。

一点重要提示:此工具适用于包含文字层的 PDF。扫描文档只是文字的图片——请先用我们的 OCR 工具(基于 Tesseract)处理,再进行提取。文件不超过 20 MB、50 页即可免费使用,无水印,无需注册。文件会在 1 小时内永久删除。

使用方法

  1. 1

    上传 PDF

    拖放或点击选择。不超过 20 MB、50 页免费。

  2. 2

    提取

    PyMuPDF 读取文字层并重建阅读顺序。大多数文件只需一两秒。

  3. 3

    预览

    在屏幕上查看提取文字的前几页。

  4. 4

    下载 .txt 文件

    一份纯文本文件,并标注分页位置。

  5. 5

    1 小时内清理完毕

    您的 PDF 和文本文件会在 1 小时内从我们的服务器上删除。

常见问题

您的 PDF 几乎可以肯定是扫描件——只有文字的图片,没有文字层。请先用我们的 OCR 工具处理,再进行提取。

相关工具