Cách OCR một PDF đã scan thành văn bản có thể chỉnh sửa
Đăng vào 1 tháng 9, 2026 · 4 phút đọc
Một tài liệu đã scan — một biểu mẫu photocopy, một hợp đồng in mà bạn chụp ảnh lại, một biên lai — thực chất chỉ là một hình ảnh được bọc trong PDF. Không có lớp văn bản nào để chọn hay tìm kiếm. Nhận dạng ký tự quang học (OCR) đọc các pixel và tái tạo lại văn bản thực sự, và công cụ này thực hiện điều đó với Tesseract, một công cụ OCR mã nguồn mở trưởng thành, chạy hoàn toàn phía máy khách thông qua WebAssembly, với dữ liệu đã huấn luyện được tự lưu trữ cho 25 ngôn ngữ.
Dùng thử OCR PDFCác bước
- 1
Mở công cụ OCR PDF
Truy cập công cụ OCR cho PDF.
- 2
Tải PDF đã scan của bạn lên
Chọn PDF (hoặc hình ảnh) bạn muốn trích xuất văn bản.
- 3
Chọn ngôn ngữ tài liệu và các tùy chọn
Chọn ngôn ngữ mà tài liệu được viết, các trang cần xử lý OCR, và một chế độ phân đoạn nếu tài liệu của bạn có bố cục bất thường (như một biểu mẫu thưa thớt).
- 4
Chạy OCR
Công cụ hiển thị từng trang và nhận dạng văn bản trên đó — quá trình này mất vài giây mỗi trang vì OCR thực sự cần nhiều công sức hơn so với việc trích xuất văn bản thông thường.
- 5
Sao chép hoặc tải xuống văn bản
Xem lại văn bản đã trích xuất, sau đó sao chép hoặc tải xuống dưới dạng tệp .txt thuần.
Câu hỏi thường gặp
Độ chính xác phụ thuộc rất nhiều vào chất lượng bản scan — một bản scan sạch, độ phân giải cao, ánh sáng tốt của văn bản in sẽ có OCR rất chính xác; một bức ảnh mờ của chữ viết tay thì không. Công cụ này sử dụng công cụ Tesseract dựa trên LSTM, được điều chỉnh cho văn bản in.
25 ngôn ngữ, tương ứng với mọi ngôn ngữ mà trang web này hỗ trợ, mỗi ngôn ngữ có mô hình đã huấn luyện tự lưu trữ riêng chỉ được tải xuống khi bạn chọn — không có gì được gửi đến API OCR của bên thứ ba.
Có — OCR chậm hơn nhiều so với việc trích xuất văn bản thông thường tính theo từng trang, vì vậy các lượt xử lý bị giới hạn ở 50 trang để tránh quá trình chạy nhiều phút trong tab trình duyệt của bạn. Hãy chia nhỏ một PDF lớn hơn trước nếu bạn cần OCR nhiều trang hơn.
Không — nếu bạn đã có thể chọn văn bản trong trình xem PDF của mình, hãy sử dụng công cụ PDF sang Văn Bản nhanh hơn thay thế. OCR chỉ cần thiết khi PDF về cơ bản là một hình ảnh của văn bản, không có lớp văn bản nào bên dưới.
Vì mô hình và công cụ OCR được tự lưu trữ và chạy trong một Web Worker, điều này hoạt động ngay cả với các tài liệu đã scan nhạy cảm mà bạn không muốn tải lên API OCR của bên thứ ba.

