Як розпізнати текст у скановaному PDF для редагованого тексту

Опубліковано 1 вересня 2026 р. · 4 хв читання

Сканований документ — ксерокопія форми, надрукований контракт, який ви сфотографували, квитанція — насправді є лише зображенням, загорнутим у PDF. Немає текстового шару для виділення чи пошуку. Оптичне розпізнавання символів (OCR) читає пікселі й реконструює справжній текст, і цей інструмент робить це за допомогою Tesseract, зрілого рушія OCR з відкритим кодом, що працює повністю на стороні клієнта через WebAssembly, з навченими даними для 25 мов, що розміщуються самостійно.

Спробувати OCR PDF

Кроки

  1. 1

    Відкрийте інструмент OCR PDF

    Перейдіть до інструмента OCR для PDF.

  2. 2

    Завантажте свій сканований PDF

    Виберіть PDF (або зображення), з якого хочете витягти текст.

  3. 3

    Виберіть мову документа та опції

    Виберіть мову, якою написаний документ, сторінки для обробки OCR та режим сегментації, якщо ваш документ має незвичайний макет (наприклад, розкидана форма).

  4. 4

    Запустіть OCR

    Інструмент рендерить кожну сторінку та розпізнає на ній текст — це займає кілька секунд на сторінку, оскільки OCR дійсно вимагає більше роботи, ніж просте вилучення тексту.

  5. 5

    Скопіюйте або завантажте текст

    Перегляньте витягнутий текст, а потім скопіюйте його або завантажте як звичайний файл .txt.

Часті запитання

Оскільки модель і рушій OCR розміщуються самостійно та працюють у Web Worker, це працює навіть із конфіденційними сканованими документами, які ви не хотіли б завантажувати до зовнішнього API OCR.

← Назад до блогу