Cách OCR một PDF đã scan thành văn bản có thể chỉnh sửa

Đăng vào 1 tháng 9, 2026 · 4 phút đọc

Một tài liệu đã scan — một biểu mẫu photocopy, một hợp đồng in mà bạn chụp ảnh lại, một biên lai — thực chất chỉ là một hình ảnh được bọc trong PDF. Không có lớp văn bản nào để chọn hay tìm kiếm. Nhận dạng ký tự quang học (OCR) đọc các pixel và tái tạo lại văn bản thực sự, và công cụ này thực hiện điều đó với Tesseract, một công cụ OCR mã nguồn mở trưởng thành, chạy hoàn toàn phía máy khách thông qua WebAssembly, với dữ liệu đã huấn luyện được tự lưu trữ cho 25 ngôn ngữ.

Dùng thử OCR PDF

Các bước

  1. 1

    Mở công cụ OCR PDF

    Truy cập công cụ OCR cho PDF.

  2. 2

    Tải PDF đã scan của bạn lên

    Chọn PDF (hoặc hình ảnh) bạn muốn trích xuất văn bản.

  3. 3

    Chọn ngôn ngữ tài liệu và các tùy chọn

    Chọn ngôn ngữ mà tài liệu được viết, các trang cần xử lý OCR, và một chế độ phân đoạn nếu tài liệu của bạn có bố cục bất thường (như một biểu mẫu thưa thớt).

  4. 4

    Chạy OCR

    Công cụ hiển thị từng trang và nhận dạng văn bản trên đó — quá trình này mất vài giây mỗi trang vì OCR thực sự cần nhiều công sức hơn so với việc trích xuất văn bản thông thường.

  5. 5

    Sao chép hoặc tải xuống văn bản

    Xem lại văn bản đã trích xuất, sau đó sao chép hoặc tải xuống dưới dạng tệp .txt thuần.

Câu hỏi thường gặp

Vì mô hình và công cụ OCR được tự lưu trữ và chạy trong một Web Worker, điều này hoạt động ngay cả với các tài liệu đã scan nhạy cảm mà bạn không muốn tải lên API OCR của bên thứ ba.

← Quay lại blog