Jak wykonać OCR zeskanowanego PDF, aby uzyskać edytowalny tekst

Opublikowano 1 września 2026 · 4 min czytania

Zeskanowany dokument — skserowany formularz, wydrukowana umowa, którą sfotografowałeś, paragon — to w rzeczywistości tylko obraz owinięty w PDF. Nie ma warstwy tekstowej do zaznaczenia ani przeszukania. Optyczne rozpoznawanie znaków (OCR) odczytuje piksele i odtwarza rzeczywisty tekst, a to narzędzie robi to za pomocą Tesseract, dojrzałego silnika OCR o otwartym kodzie źródłowym, działającego całkowicie po stronie klienta przez WebAssembly, z samodzielnie hostowanymi wytrenowanymi danymi dla 25 języków.

Wypróbuj OCR PDF

Kroki

  1. 1

    Otwórz narzędzie OCR PDF

    Przejdź do narzędzia OCR dla PDF.

  2. 2

    Prześlij zeskanowany PDF

    Wybierz PDF (lub obraz), z którego chcesz wyodrębnić tekst.

  3. 3

    Wybierz język dokumentu i opcje

    Wybierz język, w jakim napisany jest dokument, strony do przetworzenia przez OCR oraz tryb segmentacji, jeśli twój dokument ma nietypowy układ (np. rozproszony formularz).

  4. 4

    Uruchom OCR

    Narzędzie renderuje każdą stronę i rozpoznaje na niej tekst — zajmuje to kilka sekund na stronę, ponieważ OCR naprawdę wymaga więcej pracy niż zwykła ekstrakcja tekstu.

  5. 5

    Skopiuj lub pobierz tekst

    Sprawdź wyodrębniony tekst, a następnie skopiuj go lub pobierz jako zwykły plik .txt.

Najczęściej zadawane pytania

Ponieważ model i silnik OCR są samodzielnie hostowane i działają w Web Workerze, działa to nawet na wrażliwych zeskanowanych dokumentach, których nie chciałbyś przesyłać do zewnętrznego API OCR.

← Powrót do bloga