Paano I-OCR ang Na-scan na PDF sa Nae-edit na Text
Published Setyembre 1, 2026 · 4 min read
Ang isang na-scan na dokumento — isang photocopied na form, isang naka-print na kontratang kinunan mo ng litrato, isang resibo — ay larawan lang talaga na naka-wrap sa PDF. Walang layer ng text na mapipili o mahahanap. Binabasa ng optical character recognition (OCR) ang mga pixel at muling binubuo ang aktwal na text, at ginagawa ito ng tool na ito gamit ang Tesseract, isang matured na open-source OCR engine, na tumatakbo nang buo sa client-side sa pamamagitan ng WebAssembly, na may self-hosted na trained data para sa 25 wika.
Try OCR PDFSteps
- 1
Buksan ang tool na OCR PDF
Pumunta sa tool na OCR PDF.
- 2
I-upload ang iyong na-scan na PDF
Piliin ang PDF (o larawan) na gusto mong kunan ng text.
- 3
Piliin ang wika at mga opsyon ng dokumento
Piliin ang wikang ginamit sa dokumento, kung aling mga pahina paganahin ang OCR, at ang segmentation mode kung ang iyong dokumento ay may hindi karaniwang layout (tulad ng isang sparse na form).
- 4
Patakbuhin ang OCR
Ina-render ng tool ang bawat pahina at kinikilala ang text dito — tumatagal ito ng ilang segundo bawat pahina dahil ang OCR ay tunay na mas maraming trabaho kaysa sa plain text extraction.
- 5
Kopyahin o i-download ang text
Suriin ang nakuhang text, pagkatapos ay kopyahin ito o i-download bilang plain na .txt file.
Frequently asked questions
Malaki ang depende ng accuracy sa quality ng scan — ang malinis, high-resolution, maliwanag na scan ng naka-print na text ay magiging napakatumpak sa OCR; ang malabong litrato ng sulat-kamay ay hindi. Gumagamit ang tool na ito ng LSTM-based na Tesseract engine, na naka-tune para sa naka-print na text.
25 wika, tumutugma sa bawat wikang available sa site na ito, bawat isa ay may sariling self-hosted na trained model na ida-download lamang kapag pinili mo ito — walang ipinapadala sa third-party na OCR API.
Oo — ang OCR ay mas mabagal bawat pahina kaysa sa regular na text extraction, kaya ang mga run ay may limitasyon na 50 pahina para hindi tumagal nang maraming minuto sa iyong browser tab. Hatiin muna ang mas malaking PDF kung kailangan mong mag-OCR ng higit pa.
Hindi — kung kaya mo nang pumili ng text sa iyong PDF viewer, gamitin na lang ang mas mabilis na tool na PDF sa Text. Kailangan lang ang OCR kapag ang PDF ay talagang isang larawan lamang ng text, na walang layer ng text sa ilalim.
Dahil ang OCR model at engine ay self-hosted at tumatakbo sa isang Web Worker, gumagana ito kahit sa mga sensitibong na-scan na dokumentong ayaw mong i-upload sa third-party na OCR API.

