Hogyan OCR-ezz egy szkennelt PDF-et szerkeszthető szöveghez

Közzétéve: 2026. szeptember 1. · 4 perces olvasás

Egy szkennelt dokumentum — egy fénymásolt űrlap, egy nyomtatott szerződés, amelyet lefotóztál, egy nyugta — valójában csak egy kép, PDF-be csomagolva. Nincs kijelölhető vagy kereshető szövegréteg. Az optikai karakterfelismerés (OCR) beolvassa a pixeleket, és rekonstruálja a tényleges szöveget, és ez az eszköz ezt a Tesseract segítségével teszi, egy érett, nyílt forráskódú OCR motorral, amely teljesen kliens oldalon fut WebAssembly-n keresztül, önhosztolt betanított adatokkal 25 nyelvhez.

OCR PDF kipróbálása

Lépések

  1. 1

    Nyisd meg a PDF OCR eszközt

    Lépj a PDF OCR eszközre.

  2. 2

    Töltsd fel a szkennelt PDF-edet

    Válaszd ki a PDF-et (vagy képet), amelyből szöveget szeretnél kinyerni.

  3. 3

    Válaszd ki a dokumentum nyelvét és a beállításokat

    Válaszd ki, milyen nyelven íródott a dokumentum, mely oldalakat kell OCR-rel feldolgozni, és a szegmentálási módot, ha a dokumentumod szokatlan elrendezésű (pl. egy szétszórt űrlap).

  4. 4

    Futtasd az OCR-t

    Az eszköz megjeleníti minden oldalt, és felismeri rajta a szöveget — ez oldalanként néhány másodpercig tart, mivel az OCR valóban több munkát igényel, mint az egyszerű szövegkinyerés.

  5. 5

    Másold vagy töltsd le a szöveget

    Nézd át a kinyert szöveget, majd másold ki, vagy töltsd le egyszerű .txt fájlként.

Gyakran ismételt kérdések

Mivel az OCR modell és motor önhosztolt, és egy Web Workerben fut, ez még érzékeny szkennelt dokumentumokon is működik, amelyeket nem szeretnél egy külső OCR API-ra feltölteni.

← Vissza a bloghoz