Як розпізнати текст у скановaному PDF для редагованого тексту
Опубліковано 1 вересня 2026 р. · 4 хв читання
Сканований документ — ксерокопія форми, надрукований контракт, який ви сфотографували, квитанція — насправді є лише зображенням, загорнутим у PDF. Немає текстового шару для виділення чи пошуку. Оптичне розпізнавання символів (OCR) читає пікселі й реконструює справжній текст, і цей інструмент робить це за допомогою Tesseract, зрілого рушія OCR з відкритим кодом, що працює повністю на стороні клієнта через WebAssembly, з навченими даними для 25 мов, що розміщуються самостійно.
Спробувати OCR PDFКроки
- 1
Відкрийте інструмент OCR PDF
Перейдіть до інструмента OCR для PDF.
- 2
Завантажте свій сканований PDF
Виберіть PDF (або зображення), з якого хочете витягти текст.
- 3
Виберіть мову документа та опції
Виберіть мову, якою написаний документ, сторінки для обробки OCR та режим сегментації, якщо ваш документ має незвичайний макет (наприклад, розкидана форма).
- 4
Запустіть OCR
Інструмент рендерить кожну сторінку та розпізнає на ній текст — це займає кілька секунд на сторінку, оскільки OCR дійсно вимагає більше роботи, ніж просте вилучення тексту.
- 5
Скопіюйте або завантажте текст
Перегляньте витягнутий текст, а потім скопіюйте його або завантажте як звичайний файл .txt.
Часті запитання
Точність сильно залежить від якості сканування — чисте, високоякісне, добре освітлене сканування надрукованого тексту дасть дуже точний OCR; розмите фото рукописного тексту — ні. Цей інструмент використовує рушій Tesseract на основі LSTM, налаштований на друкований текст.
25 мов, що відповідають кожній мові, доступній на цьому сайті, кожна з власною навченою моделлю, що розміщується самостійно та завантажується лише при виборі — нічого не надсилається до зовнішнього API OCR.
Так — OCR значно повільніший на сторінку, ніж просте вилучення тексту, тому запуски обмежені 50 сторінками, щоб процес не працював кілька хвилин у вашій вкладці браузера. Спочатку розділіть більший PDF, якщо вам потрібно розпізнати текст на більшій кількості сторінок.
Ні — якщо ви вже можете виділяти текст у своєму переглядачі PDF, використайте натомість швидший інструмент PDF в текст. OCR потрібен лише тоді, коли PDF по суті є зображенням тексту, без жодного текстового шару під ним.
Оскільки модель і рушій OCR розміщуються самостійно та працюють у Web Worker, це працює навіть із конфіденційними сканованими документами, які ви не хотіли б завантажувати до зовнішнього API OCR.

