将 PDF 中的所有文本提取为纯文本文件
将文件拖放到这里
点击浏览
文件最大 20MB
pdfty 的提取工具能取出 PDF 中的每一个字符,并交付为一份干净的纯文本文件。它远胜于全选复制粘贴——后者经常打乱多栏排版、漏掉文本框,处理长文档时更是力不从心——而提取工具一次即可处理全部 50 页,并保持阅读顺序。
提取基于 PyMuPDF 运行,它直接读取 PDF 的内部文本结构并重建自然的阅读顺序——包括双栏排版、表格、页眉和脚注。完整的 Unicode 原样保留:西里尔文、中日韩文字、阿拉伯文、带变音符的字符。提取结果非常适合把文档送入翻译工具、搜索索引或 AI 助手,也适合从论文中摘录和统计字数。
一点重要提示:此工具适用于包含文字层的 PDF。扫描文档只是文字的图片——请先用我们的 OCR 工具(基于 Tesseract)处理,再进行提取。文件不超过 20 MB、50 页即可免费使用,无水印,无需注册。文件会在 1 小时内永久删除。
拖放或点击选择。不超过 20 MB、50 页免费。
PyMuPDF 读取文字层并重建阅读顺序。大多数文件只需一两秒。
在屏幕上查看提取文字的前几页。
一份纯文本文件,并标注分页位置。
您的 PDF 和文本文件会在 1 小时内从我们的服务器上删除。