PDF 文字识别(OCR):让扫描件可搜索、可复制(免费)
扫描的 PDF 无法搜索和复制?用 OCR 加上隐形文字层:外观不变,但能搜索、能选中、能复制。支持中文,免费、免注册。

一份 200 页的扫描版合同,你想找"违约责任"在第几页——Ctrl+F 搜索却毫无反应。因为扫描出来的 PDF 里根本没有"文字",每一页只是一张照片。OCR(光学字符识别)就是解决这个问题的技术:让机器"读"出图片里的字,把它们变成真正可搜索的文本。整个过程在浏览器里就能完成。
OCR 的原理:隐形文字层
pdfty 的 OCR 不会改动你的扫描图像,而是在它上面叠加一层不可见的真实文字,每个字都精确对齐图片中对应的位置。结果是:
- 看起来——和原扫描件完全相同,一个像素都不差
- 用起来——Ctrl+F 能搜索、鼠标能选中、复制粘贴正常工作
- 屏幕阅读器也能朗读内容,文档变得真正"可访问"
识别由开源引擎 Tesseract 完成——它被全球无数档案馆和图书馆用于数字化项目,支持简体中文、繁体中文、英文等数十种语言,还可以在一份文档里同时识别多种语言。
分步操作
打开 OCR 工具
访问 pdfty.com/tools/ocr。免注册,20 MB 以内免费。
上传扫描版 PDF
把扫描件拖到上传区域。手机拍照转成的 PDF 也可以。
选择文档语言
选对语言识别率会显著提高——中文文档就选中文,中英混排可以同时勾选两种。
开始识别
Tesseract 逐页识别文字,并把隐形文字层叠加到每一页上。
下载——完成
下载处理后的 PDF——外观没变,但已经可以搜索和复制了。文件 1 小时内自动删除。
识别之后:别忘了压缩
扫描件加上文字层后体积可能不小。如果要通过邮件发送,识别完成后顺手用 PDF 压缩 处理一下——通常能把体积缩小一大截,而文字层和搜索功能都完好保留。
常见问题
手写内容能识别吗?
基本不行。包括 Tesseract 在内的免费 OCR 引擎针对的是印刷体——书籍、合同、发票这类文档识别效果很好,但手写笔记的识别率很低。手写识别需要专门的付费引擎,而且效果也因笔迹而异。
识别后文档的排版会乱吗?
不会。你看到的始终是原始扫描图像,OCR 只是在下面"垫"了一层隐形文字。排版、印章、签名、表格线——一切都保持原样。
识别准确率有多高?
对清晰的印刷体扫描件(300 DPI 左右、无严重倾斜),主流语言的准确率通常能达到很高水平。原件模糊、倾斜或分辨率过低时准确率会下降——扫描时尽量放平、调高分辨率。
pdfty 团队打造注重隐私的在线 PDF 工具——压缩、转换、OCR、签名与保护。文件在 1 小时内删除。 关于我们 →
