Cara Melakukan OCR pada PDF Hasil Pindai Menjadi Teks yang Dapat Diedit
Diterbitkan 1 September 2026 · 4 menit membaca
Dokumen hasil pindai — formulir yang difotokopi, kontrak cetak yang Anda foto, kuitansi — sebenarnya hanyalah gambar yang dibungkus dalam PDF. Tidak ada lapisan teks untuk dipilih atau dicari. Pengenalan karakter optik (OCR) membaca piksel dan merekonstruksi teks sebenarnya, dan alat ini melakukannya dengan Tesseract, mesin OCR sumber terbuka yang matang, berjalan sepenuhnya di sisi klien melalui WebAssembly, dengan data terlatih yang di-hosting sendiri untuk 25 bahasa.
Coba OCR PDFLangkah-langkah
- 1
Buka alat OCR PDF
Kunjungi alat OCR untuk PDF.
- 2
Unggah PDF hasil pindai Anda
Pilih PDF (atau gambar) yang ingin Anda ekstrak teksnya.
- 3
Pilih bahasa dokumen dan opsi
Pilih bahasa tempat dokumen ditulis, halaman mana yang akan diproses dengan OCR, dan mode segmentasi jika dokumen Anda memiliki tata letak yang tidak biasa (seperti formulir yang jarang).
- 4
Jalankan OCR
Alat ini merender setiap halaman dan mengenali teks di dalamnya — ini memakan waktu beberapa detik per halaman karena OCR memang lebih banyak pekerjaan daripada ekstraksi teks biasa.
- 5
Salin atau unduh teks
Tinjau teks yang diekstrak, lalu salin atau unduh sebagai file .txt polos.
Pertanyaan yang sering diajukan
Akurasi sangat bergantung pada kualitas pindaian — pindaian bersih, beresolusi tinggi, dan pencahayaan baik dari teks cetak akan memiliki OCR yang sangat akurat; foto tulisan tangan yang buram tidak akan demikian. Alat ini menggunakan mesin Tesseract berbasis LSTM, disetel untuk teks cetak.
25 bahasa, sesuai dengan setiap bahasa yang tersedia di situs ini, masing-masing dengan model terlatih yang di-hosting sendiri yang hanya diunduh saat Anda memilihnya — tidak ada yang dikirim ke API OCR pihak ketiga.
Ya — OCR jauh lebih lambat per halaman dibandingkan ekstraksi teks biasa, sehingga proses dibatasi hingga 50 halaman untuk mencegah proses berjalan selama berbagai menit di tab browser Anda. Pisahkan dulu PDF yang lebih besar jika Anda perlu melakukan OCR pada lebih banyak halaman.
Tidak — jika Anda sudah dapat memilih teks di penampil PDF Anda, gunakan alat PDF ke Teks yang lebih cepat sebagai gantinya. OCR hanya diperlukan ketika PDF pada dasarnya adalah gambar teks, tanpa lapisan teks di bawahnya.
Karena model dan mesin OCR di-hosting sendiri dan berjalan di Web Worker, ini bekerja bahkan pada dokumen hasil pindai sensitif yang tidak ingin Anda unggah ke API OCR pihak ketiga.

