Jak wykonać OCR zeskanowanego PDF, aby uzyskać edytowalny tekst
Opublikowano 1 września 2026 · 4 min czytania
Zeskanowany dokument — skserowany formularz, wydrukowana umowa, którą sfotografowałeś, paragon — to w rzeczywistości tylko obraz owinięty w PDF. Nie ma warstwy tekstowej do zaznaczenia ani przeszukania. Optyczne rozpoznawanie znaków (OCR) odczytuje piksele i odtwarza rzeczywisty tekst, a to narzędzie robi to za pomocą Tesseract, dojrzałego silnika OCR o otwartym kodzie źródłowym, działającego całkowicie po stronie klienta przez WebAssembly, z samodzielnie hostowanymi wytrenowanymi danymi dla 25 języków.
Wypróbuj OCR PDFKroki
- 1
Otwórz narzędzie OCR PDF
Przejdź do narzędzia OCR dla PDF.
- 2
Prześlij zeskanowany PDF
Wybierz PDF (lub obraz), z którego chcesz wyodrębnić tekst.
- 3
Wybierz język dokumentu i opcje
Wybierz język, w jakim napisany jest dokument, strony do przetworzenia przez OCR oraz tryb segmentacji, jeśli twój dokument ma nietypowy układ (np. rozproszony formularz).
- 4
Uruchom OCR
Narzędzie renderuje każdą stronę i rozpoznaje na niej tekst — zajmuje to kilka sekund na stronę, ponieważ OCR naprawdę wymaga więcej pracy niż zwykła ekstrakcja tekstu.
- 5
Skopiuj lub pobierz tekst
Sprawdź wyodrębniony tekst, a następnie skopiuj go lub pobierz jako zwykły plik .txt.
Najczęściej zadawane pytania
Dokładność mocno zależy od jakości skanu — czysty, o wysokiej rozdzielczości, dobrze oświetlony skan drukowanego tekstu da bardzo dokładny OCR; rozmyte zdjęcie pisma odręcznego już nie. To narzędzie używa silnika Tesseract opartego na LSTM, dostrojonego do drukowanego tekstu.
25 języków, odpowiadających każdemu językowi dostępnemu na tej stronie, każdy z własnym samodzielnie hostowanym wytrenowanym modelem pobieranym tylko po jego wybraniu — nic nie jest wysyłane do zewnętrznego API OCR.
Tak — OCR jest znacznie wolniejszy na stronę niż zwykła ekstrakcja tekstu, więc uruchomienia są ograniczone do 50 stron, aby proces nie działał przez wiele minut w twojej karcie przeglądarki. Podziel najpierw większy PDF, jeśli musisz wykonać OCR na większej liczbie stron.
Nie — jeśli już możesz zaznaczyć tekst w swojej przeglądarce PDF, użyj zamiast tego szybszego narzędzia PDF na tekst. OCR jest potrzebny tylko wtedy, gdy PDF jest zasadniczo obrazem tekstu, bez żadnej warstwy tekstowej pod spodem.
Ponieważ model i silnik OCR są samodzielnie hostowane i działają w Web Workerze, działa to nawet na wrażliwych zeskanowanych dokumentach, których nie chciałbyś przesyłać do zewnętrznego API OCR.

