Hoe voer je OCR uit op een gescande PDF om bewerkbare tekst te krijgen

Gepubliceerd op 1 september 2026 · 4 min leestijd

Een gescand document — een gefotokopieerd formulier, een afgedrukt contract dat je hebt gefotografeerd, een bonnetje — is eigenlijk gewoon een afbeelding verpakt in een PDF. Er is geen tekstlaag om te selecteren of doorzoeken. Optische tekenherkenning (OCR) leest de pixels en reconstrueert de daadwerkelijke tekst, en deze tool doet dat met Tesseract, een volwassen opensource-OCR-engine, volledig clientside uitgevoerd via WebAssembly, met zelf gehoste getrainde gegevens voor 25 talen.

Probeer OCR PDF

Stappen

  1. 1

    Open de tool OCR PDF

    Ga naar de OCR-tool voor PDF.

  2. 2

    Upload je gescande PDF

    Kies de PDF (of afbeelding) waar je tekst uit wilt halen.

  3. 3

    Kies de documenttaal en opties

    Selecteer de taal waarin het document is geschreven, welke pagina's met OCR moeten worden verwerkt, en een segmentatiemodus als je document een ongebruikelijke lay-out heeft (zoals een spaarzaam formulier).

  4. 4

    Voer OCR uit

    De tool rendert elke pagina en herkent de tekst erop — dit duurt enkele seconden per pagina, omdat OCR echt meer werk vergt dan gewone tekstextractie.

  5. 5

    Kopieer of download de tekst

    Controleer de geëxtraheerde tekst, en kopieer die of download hem als een plat .txt-bestand.

Veelgestelde vragen

Omdat het OCR-model en de engine zelf gehost worden en in een Web Worker draaien, werkt dit zelfs bij gevoelige gescande documenten die je niet naar een OCR-API van derden zou willen uploaden.

← Terug naar blog