OCR PDF

通过文字识别让扫描版 PDF 可被搜索

pdfty 的 OCR 工具把图片型 PDF(扫描件、文档照片)变成可搜索、可复制文字的 PDF。我们使用 Tesseract 5 及针对英语、俄语、法语、德语、西班牙语优化的模型——包括西里尔字母和带重音符号的字符。

OCR 之后 PDF 外观不变,但你可以复制文字、搜索内容,还能在保留原始排版的前提下转成 Word。适合扫描的合同、档案文件、白板照片或传真件。

免费版最多 50 页、20 MB。Pro 可解除限制。混合文字的页面也没问题——OCR 会按区域识别文字类型。我们绝不会用你的数据训练模型。

使用方法

  1. 1

    上传扫描件

    拖入扫描版或纯图片 PDF。免费版最大 20 MB。

  2. 2

    选择语言

    从英语、俄语、法语、德语、西班牙语中选择一种或多种。

  3. 3

    运行 OCR

    Tesseract 逐页处理。通常每页 1-3 秒。

  4. 4

    下载可搜索的 PDF

    外观不变,多了隐藏的文字层。现在可以复制、搜索、转换了。

  5. 5

    完成

    文件在 1 小时内删除。

常见问题

在清晰的 300 DPI 扫描件上,拉丁文字准确率 98% 以上,西里尔文字 95% 以上。低分辨率或噪点多的扫描件准确率会下降。

相关工具

指南与教程