如何对扫描版 PDF 进行 OCR 识别为可编辑文本
发布于 2026年9月1日 · 阅读约需 4 分钟
一份扫描文档——复印的表格、你拍下的打印合同、收据——实际上只是包裹在 PDF 里的一张图片。没有可供选择或搜索的文本层。光学字符识别(OCR)会读取像素并重建实际文本,而这个工具通过 Tesseract(一款成熟的开源 OCR 引擎)来完成这项工作,借助 WebAssembly 完全在客户端运行,并为 25 种语言自托管了训练数据。
试用OCR PDF步骤
- 1
打开 OCR PDF 工具
访问 PDF 的 OCR 工具。
- 2
上传你的扫描 PDF
选择要提取文本的 PDF(或图片)。
- 3
选择文档语言和选项
选择文档所使用的语言、要处理 OCR 的页面,如果文档版式特殊(例如稀疏的表格),可选择分割模式。
- 4
运行 OCR
工具会渲染每一页并识别其中的文本——由于 OCR 确实比纯文本提取更耗费算力,每页大约需要几秒钟。
- 5
复制或下载文本
查看提取的文本,然后复制它,或将其下载为纯 .txt 文件。
常见问题
准确率在很大程度上取决于扫描质量——清晰、高分辨率、光线良好的印刷文本扫描件识别会非常准确;模糊的手写照片则不会。此工具使用基于 LSTM 的 Tesseract 引擎,专为印刷文本调优。
支持 25 种语言,与本网站可用的每种语言一一对应,每种语言都有自己的自托管训练模型,只有在你选择时才会下载——不会向任何第三方 OCR API 发送任何内容。
有——OCR 每页耗时远高于普通文本提取,因此处理被限制在 50 页以内,以避免该过程在浏览器标签页中运行数分钟之久。如果需要处理更多页面,请先拆分较大的 PDF。
不需要——如果你已经能在 PDF 阅读器中选中文本,请改用速度更快的 PDF 转文本工具。只有当 PDF 本质上是一张文本图片、底层完全没有文本层时,才需要 OCR。
由于 OCR 模型和引擎都是自托管的,并在 Web Worker 中运行,即使是你不想上传到第三方 OCR API 的敏感扫描文档,也可以使用此功能。

