Jak provést OCR naskenovaného PDF pro upravitelný text

Zveřejněno 1. září 2026 · 4 min čtení

Naskenovaný dokument — okopírovaný formulář, tištěná smlouva, kterou jste vyfotografovali, účtenka — je ve skutečnosti jen obrázek zabalený v PDF. Neexistuje žádná textová vrstva k výběru nebo vyhledávání. Optické rozpoznávání znaků (OCR) čte pixely a rekonstruuje skutečný text a tento nástroj to dělá pomocí Tesseractu, vyspělého open source OCR enginu, běžícího zcela na straně klienta prostřednictvím WebAssembly, se samostatně hostovanými trénovanými daty pro 25 jazyků.

Vyzkoušet OCR PDF

Kroky

  1. 1

    Otevřete nástroj OCR PDF

    Přejděte na nástroj OCR pro PDF.

  2. 2

    Nahrajte svůj naskenovaný PDF

    Vyberte PDF (nebo obrázek), ze kterého chcete extrahovat text.

  3. 3

    Vyberte jazyk dokumentu a možnosti

    Vyberte jazyk, ve kterém je dokument napsán, stránky ke zpracování OCR a režim segmentace, pokud má váš dokument neobvyklé rozvržení (např. rozptýlený formulář).

  4. 4

    Spusťte OCR

    Nástroj vykreslí každou stránku a rozpozná na ní text — trvá to pár sekund na stránku, protože OCR skutečně vyžaduje více práce než jednoduchá extrakce textu.

  5. 5

    Zkopírujte nebo stáhněte text

    Zkontrolujte extrahovaný text a poté jej zkopírujte nebo stáhněte jako prostý soubor .txt.

Často kladené otázky

Protože model a engine OCR jsou samostatně hostované a běží ve Web Workeru, funguje to i na citlivých naskenovaných dokumentech, které byste nechtěli nahrávat do externího OCR API.

← Zpět na blog