Så OCR-behandlar du en skannad PDF för redigerbar text

Publicerad 1 september 2026 · 4 min läsning

Ett skannat dokument — ett kopierat formulär, ett tryckt kontrakt du fotograferade, ett kvitto — är faktiskt bara en bild inpackad i en PDF. Det finns inget textlager att markera eller söka i. Optisk teckenigenkänning (OCR) läser pixlarna och rekonstruerar den faktiska texten, och det här verktyget gör det med Tesseract, en mogen, öppen källkod-OCR-motor som körs helt på klientsidan via WebAssembly, med självhostade tränade data för 25 språk.

Prova OCR PDF

Steg

  1. 1

    Öppna verktyget OCR PDF

    Gå till OCR-verktyget för PDF.

  2. 2

    Ladda upp din skannade PDF

    Välj PDF:en (eller bilden) du vill extrahera text från.

  3. 3

    Välj dokumentspråk och alternativ

    Välj vilket språk dokumentet är skrivet på, vilka sidor som ska OCR-behandlas och segmenteringsläge om ditt dokument har en ovanlig layout (t.ex. ett utspritt formulär).

  4. 4

    Kör OCR

    Verktyget renderar varje sida och känner igen texten på den — det tar några sekunder per sida, eftersom OCR verkligen kräver mer arbete än enkel textextraktion.

  5. 5

    Kopiera eller ladda ner texten

    Granska den extraherade texten och kopiera den sedan eller ladda ner den som en vanlig .txt-fil.

Vanliga frågor

Eftersom OCR-modellen och motorn är självhostade och körs i en Web Worker fungerar det även på känsliga skannade dokument som du inte skulle vilja ladda upp till ett externt OCR-API.

← Tillbaka till bloggen