Så OCR-behandlar du en skannad PDF för redigerbar text
Publicerad 1 september 2026 · 4 min läsning
Ett skannat dokument — ett kopierat formulär, ett tryckt kontrakt du fotograferade, ett kvitto — är faktiskt bara en bild inpackad i en PDF. Det finns inget textlager att markera eller söka i. Optisk teckenigenkänning (OCR) läser pixlarna och rekonstruerar den faktiska texten, och det här verktyget gör det med Tesseract, en mogen, öppen källkod-OCR-motor som körs helt på klientsidan via WebAssembly, med självhostade tränade data för 25 språk.
Prova OCR PDFSteg
- 1
Öppna verktyget OCR PDF
Gå till OCR-verktyget för PDF.
- 2
Ladda upp din skannade PDF
Välj PDF:en (eller bilden) du vill extrahera text från.
- 3
Välj dokumentspråk och alternativ
Välj vilket språk dokumentet är skrivet på, vilka sidor som ska OCR-behandlas och segmenteringsläge om ditt dokument har en ovanlig layout (t.ex. ett utspritt formulär).
- 4
Kör OCR
Verktyget renderar varje sida och känner igen texten på den — det tar några sekunder per sida, eftersom OCR verkligen kräver mer arbete än enkel textextraktion.
- 5
Kopiera eller ladda ner texten
Granska den extraherade texten och kopiera den sedan eller ladda ner den som en vanlig .txt-fil.
Vanliga frågor
Noggrannheten beror mycket på skanningskvaliteten — en ren, högupplöst, väl upplyst skanning av tryckt text ger mycket exakt OCR; ett suddigt foto av handskrift gör det inte. Det här verktyget använder Tesseracts LSTM-baserade motor, inställd för tryckt text.
25 språk, motsvarande varje språk som är tillgängligt på den här webbplatsen, var och en med sin egen självhostade tränade modell som endast laddas ner när den väljs — inget skickas till ett externt OCR-API.
Ja — OCR är betydligt långsammare per sida än enkel textextraktion, så körningar är begränsade till 50 sidor så att processen inte körs i flera minuter i din webbläsarflik. Dela upp en större PDF först om du behöver OCR-behandla fler sidor.
Nej — om du redan kan markera text i din PDF-läsare, använd istället det snabbare verktyget PDF till text. OCR behövs bara när PDF:en i huvudsak är en bild av text, utan något textlager under.
Eftersom OCR-modellen och motorn är självhostade och körs i en Web Worker fungerar det även på känsliga skannade dokument som du inte skulle vilja ladda upp till ett externt OCR-API.

