Jak provést OCR naskenovaného PDF pro upravitelný text
Zveřejněno 1. září 2026 · 4 min čtení
Naskenovaný dokument — okopírovaný formulář, tištěná smlouva, kterou jste vyfotografovali, účtenka — je ve skutečnosti jen obrázek zabalený v PDF. Neexistuje žádná textová vrstva k výběru nebo vyhledávání. Optické rozpoznávání znaků (OCR) čte pixely a rekonstruuje skutečný text a tento nástroj to dělá pomocí Tesseractu, vyspělého open source OCR enginu, běžícího zcela na straně klienta prostřednictvím WebAssembly, se samostatně hostovanými trénovanými daty pro 25 jazyků.
Vyzkoušet OCR PDFKroky
- 1
Otevřete nástroj OCR PDF
Přejděte na nástroj OCR pro PDF.
- 2
Nahrajte svůj naskenovaný PDF
Vyberte PDF (nebo obrázek), ze kterého chcete extrahovat text.
- 3
Vyberte jazyk dokumentu a možnosti
Vyberte jazyk, ve kterém je dokument napsán, stránky ke zpracování OCR a režim segmentace, pokud má váš dokument neobvyklé rozvržení (např. rozptýlený formulář).
- 4
Spusťte OCR
Nástroj vykreslí každou stránku a rozpozná na ní text — trvá to pár sekund na stránku, protože OCR skutečně vyžaduje více práce než jednoduchá extrakce textu.
- 5
Zkopírujte nebo stáhněte text
Zkontrolujte extrahovaný text a poté jej zkopírujte nebo stáhněte jako prostý soubor .txt.
Často kladené otázky
Přesnost velmi závisí na kvalitě skenování — čistý, vysoce rozlišený, dobře osvětlený sken tištěného textu poskytne velmi přesné OCR; rozmazaná fotografie rukopisu ne. Tento nástroj používá Tesseractův engine založený na LSTM, vyladěný pro tištěný text.
25 jazyků, odpovídajících každému jazyku dostupnému na tomto webu, každý s vlastním samostatně hostovaným trénovaným modelem staženým pouze při výběru — nic se neodesílá do externího OCR API.
Ano — OCR je výrazně pomalejší na stránku než jednoduchá extrakce textu, takže běhy jsou omezeny na 50 stránek, aby proces neběžel několik minut na vaší kartě prohlížeče. Nejprve rozdělte větší PDF, pokud potřebujete provést OCR na více stránkách.
Ne — pokud již můžete vybírat text ve svém prohlížeči PDF, použijte místo toho rychlejší nástroj PDF na text. OCR je potřeba pouze tehdy, když je PDF v podstatě obrázkem textu, bez jakékoli textové vrstvy pod ním.
Protože model a engine OCR jsou samostatně hostované a běží ve Web Workeru, funguje to i na citlivých naskenovaných dokumentech, které byste nechtěli nahrávat do externího OCR API.

