Как распознать отсканированный PDF в редактируемый текст с помощью OCR
Опубликовано 1 сентября 2026 г. · 4 мин на чтение
Отсканированный документ — скопированная форма, распечатанный договор, который вы сфотографировали, чек — на самом деле представляет собой просто изображение, обёрнутое в PDF. Текстового слоя для выделения или поиска там нет. Оптическое распознавание символов (OCR) считывает пиксели и восстанавливает настоящий текст, и этот инструмент делает это с помощью Tesseract — зрелого OCR-движка с открытым исходным кодом, работающего полностью на стороне клиента через WebAssembly, с самостоятельно размещёнными обученными данными для 25 языков.
Попробовать OCR PDFШаги
- 1
Откройте инструмент OCR PDF
Перейдите к инструменту OCR для PDF.
- 2
Загрузите отсканированный PDF
Выберите PDF (или изображение), из которого хотите извлечь текст.
- 3
Выберите язык документа и параметры
Укажите язык, на котором написан документ, страницы для обработки OCR и режим сегментации, если у вашего документа необычный макет (например, разрозненная форма).
- 4
Запустите OCR
Инструмент отрисовывает каждую страницу и распознаёт на ней текст — это занимает несколько секунд на страницу, поскольку OCR действительно требует больше работы, чем простое извлечение текста.
- 5
Скопируйте или скачайте текст
Проверьте извлечённый текст, затем скопируйте его или скачайте в виде обычного файла .txt.
Часто задаваемые вопросы
Точность сильно зависит от качества скана — чистый, высококачественный, хорошо освещённый скан печатного текста распознаётся очень точно; размытое фото рукописного текста — нет. Этот инструмент использует движок Tesseract на основе LSTM, настроенный на печатный текст.
25 языков, соответствующих каждому языку, на котором доступен этот сайт, каждый со своей самостоятельно размещённой обученной моделью, которая скачивается только при выборе — ничего не отправляется в стороннее API OCR.
Да — OCR значительно медленнее на страницу, чем обычное извлечение текста, поэтому обработка ограничена 50 страницами, чтобы процесс не работал много минут в вашей вкладке браузера. Сначала разделите более крупный PDF, если вам нужно распознать больше страниц.
Нет — если вы уже можете выделять текст в своей программе для просмотра PDF, используйте вместо этого более быстрый инструмент «PDF в текст». OCR нужен только тогда, когда PDF по сути является изображением текста без какого-либо текстового слоя под ним.
Поскольку модель и движок OCR размещены самостоятельно и работают в Web Worker, это работает даже с конфиденциальными отсканированными документами, которые вы не хотели бы загружать в стороннее API OCR.

