如何对扫描版 PDF 进行 OCR 识别为可编辑文本

发布于 2026年9月1日 · 阅读约需 4 分钟

一份扫描文档——复印的表格、你拍下的打印合同、收据——实际上只是包裹在 PDF 里的一张图片。没有可供选择或搜索的文本层。光学字符识别(OCR)会读取像素并重建实际文本,而这个工具通过 Tesseract(一款成熟的开源 OCR 引擎)来完成这项工作,借助 WebAssembly 完全在客户端运行,并为 25 种语言自托管了训练数据。

试用OCR PDF

步骤

  1. 1

    打开 OCR PDF 工具

    访问 PDF 的 OCR 工具。

  2. 2

    上传你的扫描 PDF

    选择要提取文本的 PDF(或图片)。

  3. 3

    选择文档语言和选项

    选择文档所使用的语言、要处理 OCR 的页面,如果文档版式特殊(例如稀疏的表格),可选择分割模式。

  4. 4

    运行 OCR

    工具会渲染每一页并识别其中的文本——由于 OCR 确实比纯文本提取更耗费算力,每页大约需要几秒钟。

  5. 5

    复制或下载文本

    查看提取的文本,然后复制它,或将其下载为纯 .txt 文件。

常见问题

由于 OCR 模型和引擎都是自托管的,并在 Web Worker 中运行,即使是你不想上传到第三方 OCR API 的敏感扫描文档,也可以使用此功能。

← 返回博客