วิธี OCR PDF ที่สแกนเพื่อให้ได้ข้อความที่แก้ไขได้

เผยแพร่เมื่อ 1 กันยายน 2569 · อ่านประมาณ 4 นาที

เอกสารที่สแกน — แบบฟอร์มที่ถ่ายสำเนา สัญญาที่พิมพ์ซึ่งคุณถ่ายรูปไว้ ใบเสร็จ — จริงๆ แล้วเป็นเพียงภาพที่ห่อหุ้มอยู่ใน PDF ไม่มีเลเยอร์ข้อความให้เลือกหรือค้นหา การรู้จำอักขระด้วยแสง (OCR) จะอ่านพิกเซลและสร้างข้อความจริงขึ้นใหม่ และเครื่องมือนี้ทำสิ่งนั้นโดยใช้ Tesseract ซึ่งเป็นเอนจิน OCR โอเพนซอร์สที่เติบโตเต็มที่ ทำงานทั้งหมดฝั่งไคลเอนต์ผ่าน WebAssembly พร้อมข้อมูลที่ผ่านการฝึกฝนที่โฮสต์เองสำหรับ 25 ภาษา

ลองใช้ OCR PDF

ขั้นตอน

  1. 1

    เปิดเครื่องมือ OCR PDF

    ไปที่เครื่องมือ OCR สำหรับ PDF

  2. 2

    อัปโหลด PDF ที่สแกนของคุณ

    เลือก PDF (หรือรูปภาพ) ที่คุณต้องการแยกข้อความออกมา

  3. 3

    เลือกภาษาของเอกสารและตัวเลือก

    เลือกภาษาที่เอกสารเขียนไว้ หน้าที่จะประมวลผล OCR และโหมดการแบ่งส่วนหากเอกสารของคุณมีเลย์เอาต์ที่ไม่ปกติ (เช่น แบบฟอร์มที่กระจัดกระจาย)

  4. 4

    รัน OCR

    เครื่องมือจะเรนเดอร์แต่ละหน้าและรู้จำข้อความบนหน้านั้น — ใช้เวลาสองสามวินาทีต่อหน้า เนื่องจาก OCR ต้องการงานมากกว่าการแยกข้อความแบบธรรมดาจริงๆ

  5. 5

    คัดลอกหรือดาวน์โหลดข้อความ

    ตรวจสอบข้อความที่แยกออกมา จากนั้นคัดลอกหรือดาวน์โหลดเป็นไฟล์ .txt ธรรมดา

คำถามที่พบบ่อย

เนื่องจากโมเดลและเอนจิน OCR ถูกโฮสต์เองและทำงานใน Web Worker สิ่งนี้จึงทำงานได้แม้กับเอกสารที่สแกนที่ละเอียดอ่อนซึ่งคุณไม่ต้องการอัปโหลดไปยัง API OCR ภายนอก

← กลับไปที่บล็อก