Cara Melakukan OCR pada PDF Hasil Pindai Menjadi Teks yang Dapat Diedit

Diterbitkan 1 September 2026 · 4 menit membaca

Dokumen hasil pindai — formulir yang difotokopi, kontrak cetak yang Anda foto, kuitansi — sebenarnya hanyalah gambar yang dibungkus dalam PDF. Tidak ada lapisan teks untuk dipilih atau dicari. Pengenalan karakter optik (OCR) membaca piksel dan merekonstruksi teks sebenarnya, dan alat ini melakukannya dengan Tesseract, mesin OCR sumber terbuka yang matang, berjalan sepenuhnya di sisi klien melalui WebAssembly, dengan data terlatih yang di-hosting sendiri untuk 25 bahasa.

Coba OCR PDF

Langkah-langkah

  1. 1

    Buka alat OCR PDF

    Kunjungi alat OCR untuk PDF.

  2. 2

    Unggah PDF hasil pindai Anda

    Pilih PDF (atau gambar) yang ingin Anda ekstrak teksnya.

  3. 3

    Pilih bahasa dokumen dan opsi

    Pilih bahasa tempat dokumen ditulis, halaman mana yang akan diproses dengan OCR, dan mode segmentasi jika dokumen Anda memiliki tata letak yang tidak biasa (seperti formulir yang jarang).

  4. 4

    Jalankan OCR

    Alat ini merender setiap halaman dan mengenali teks di dalamnya — ini memakan waktu beberapa detik per halaman karena OCR memang lebih banyak pekerjaan daripada ekstraksi teks biasa.

  5. 5

    Salin atau unduh teks

    Tinjau teks yang diekstrak, lalu salin atau unduh sebagai file .txt polos.

Pertanyaan yang sering diajukan

Karena model dan mesin OCR di-hosting sendiri dan berjalan di Web Worker, ini bekerja bahkan pada dokumen hasil pindai sensitif yang tidak ingin Anda unggah ke API OCR pihak ketiga.

← Kembali ke blog