Sådan OCR-behandler du en scannet PDF til redigerbar tekst
Udgivet 1. september 2026 · 4 min. læsning
Et scannet dokument — en fotokopieret formular, en trykt kontrakt du fotograferede, en kvittering — er faktisk bare et billede pakket ind i en PDF. Der er intet tekstlag at markere eller søge i. Optisk tegngenkendelse (OCR) læser pixelene og rekonstruerer den faktiske tekst, og dette værktøj gør det ved hjælp af Tesseract, en moden open source OCR-motor, der kører helt på klientsiden via WebAssembly, med selvhostede trænede data for 25 sprog.
Prøv OCR PDFTrin
- 1
Åbn værktøjet OCR PDF
Gå til OCR-værktøjet til PDF.
- 2
Upload din scannede PDF
Vælg den PDF (eller billede), du vil udtrække tekst fra.
- 3
Vælg dokumentsprog og indstillinger
Vælg det sprog, dokumentet er skrevet på, de sider der skal OCR-behandles, og segmenteringstilstand, hvis dit dokument har et usædvanligt layout (f.eks. en spredt formular).
- 4
Kør OCR
Værktøjet gengiver hver side og genkender teksten på den — dette tager et par sekunder pr. side, da OCR virkelig kræver mere arbejde end simpel tekstudtrækning.
- 5
Kopier eller download teksten
Gennemgå den udtrukne tekst, og kopier den derefter eller download den som en almindelig .txt-fil.
Ofte stillede spørgsmål
Nøjagtigheden afhænger stærkt af scanningskvaliteten — en ren, højopløst, velbelyst scanning af trykt tekst vil give meget nøjagtig OCR; et sløret foto af håndskrift vil ikke. Dette værktøj bruger Tesseracts LSTM-baserede motor, tunet til trykt tekst.
25 sprog, svarende til hvert sprog, der er tilgængeligt på dette websted, hver med sin egen selvhostede trænede model, der kun downloades, når den er valgt — intet sendes til et eksternt OCR-API.
Ja — OCR er betydeligt langsommere pr. side end simpel tekstudtrækning, så kørsler er begrænset til 50 sider, så processen ikke kører i flere minutter i din browserfane. Opdel en større PDF først, hvis du skal OCR-behandle flere sider.
Nej — hvis du allerede kan markere tekst i din PDF-fremviser, brug i stedet det hurtigere værktøj PDF til tekst. OCR er kun nødvendig, når PDF'en i det væsentlige er et billede af tekst uden noget tekstlag under.
Fordi OCR-modellen og -motoren er selvhostede og kører i en Web Worker, fungerer dette selv på følsomme scannede dokumenter, du ikke ville uploade til et eksternt OCR-API.

