Sådan OCR-behandler du en scannet PDF til redigerbar tekst

Udgivet 1. september 2026 · 4 min. læsning

Et scannet dokument — en fotokopieret formular, en trykt kontrakt du fotograferede, en kvittering — er faktisk bare et billede pakket ind i en PDF. Der er intet tekstlag at markere eller søge i. Optisk tegngenkendelse (OCR) læser pixelene og rekonstruerer den faktiske tekst, og dette værktøj gør det ved hjælp af Tesseract, en moden open source OCR-motor, der kører helt på klientsiden via WebAssembly, med selvhostede trænede data for 25 sprog.

Prøv OCR PDF

Trin

  1. 1

    Åbn værktøjet OCR PDF

    Gå til OCR-værktøjet til PDF.

  2. 2

    Upload din scannede PDF

    Vælg den PDF (eller billede), du vil udtrække tekst fra.

  3. 3

    Vælg dokumentsprog og indstillinger

    Vælg det sprog, dokumentet er skrevet på, de sider der skal OCR-behandles, og segmenteringstilstand, hvis dit dokument har et usædvanligt layout (f.eks. en spredt formular).

  4. 4

    Kør OCR

    Værktøjet gengiver hver side og genkender teksten på den — dette tager et par sekunder pr. side, da OCR virkelig kræver mere arbejde end simpel tekstudtrækning.

  5. 5

    Kopier eller download teksten

    Gennemgå den udtrukne tekst, og kopier den derefter eller download den som en almindelig .txt-fil.

Ofte stillede spørgsmål

Fordi OCR-modellen og -motoren er selvhostede og kører i en Web Worker, fungerer dette selv på følsomme scannede dokumenter, du ikke ville uploade til et eksternt OCR-API.

← Tilbage til bloggen