Paano I-OCR ang Na-scan na PDF sa Nae-edit na Text

Published Setyembre 1, 2026 · 4 min read

Ang isang na-scan na dokumento — isang photocopied na form, isang naka-print na kontratang kinunan mo ng litrato, isang resibo — ay larawan lang talaga na naka-wrap sa PDF. Walang layer ng text na mapipili o mahahanap. Binabasa ng optical character recognition (OCR) ang mga pixel at muling binubuo ang aktwal na text, at ginagawa ito ng tool na ito gamit ang Tesseract, isang matured na open-source OCR engine, na tumatakbo nang buo sa client-side sa pamamagitan ng WebAssembly, na may self-hosted na trained data para sa 25 wika.

Try OCR PDF

Steps

  1. 1

    Buksan ang tool na OCR PDF

    Pumunta sa tool na OCR PDF.

  2. 2

    I-upload ang iyong na-scan na PDF

    Piliin ang PDF (o larawan) na gusto mong kunan ng text.

  3. 3

    Piliin ang wika at mga opsyon ng dokumento

    Piliin ang wikang ginamit sa dokumento, kung aling mga pahina paganahin ang OCR, at ang segmentation mode kung ang iyong dokumento ay may hindi karaniwang layout (tulad ng isang sparse na form).

  4. 4

    Patakbuhin ang OCR

    Ina-render ng tool ang bawat pahina at kinikilala ang text dito — tumatagal ito ng ilang segundo bawat pahina dahil ang OCR ay tunay na mas maraming trabaho kaysa sa plain text extraction.

  5. 5

    Kopyahin o i-download ang text

    Suriin ang nakuhang text, pagkatapos ay kopyahin ito o i-download bilang plain na .txt file.

Frequently asked questions

Dahil ang OCR model at engine ay self-hosted at tumatakbo sa isang Web Worker, gumagana ito kahit sa mga sensitibong na-scan na dokumentong ayaw mong i-upload sa third-party na OCR API.

← Back to blog