Как распознать отсканированный PDF в редактируемый текст с помощью OCR

Опубликовано 1 сентября 2026 г. · 4 мин на чтение

Отсканированный документ — скопированная форма, распечатанный договор, который вы сфотографировали, чек — на самом деле представляет собой просто изображение, обёрнутое в PDF. Текстового слоя для выделения или поиска там нет. Оптическое распознавание символов (OCR) считывает пиксели и восстанавливает настоящий текст, и этот инструмент делает это с помощью Tesseract — зрелого OCR-движка с открытым исходным кодом, работающего полностью на стороне клиента через WebAssembly, с самостоятельно размещёнными обученными данными для 25 языков.

Попробовать OCR PDF

Шаги

  1. 1

    Откройте инструмент OCR PDF

    Перейдите к инструменту OCR для PDF.

  2. 2

    Загрузите отсканированный PDF

    Выберите PDF (или изображение), из которого хотите извлечь текст.

  3. 3

    Выберите язык документа и параметры

    Укажите язык, на котором написан документ, страницы для обработки OCR и режим сегментации, если у вашего документа необычный макет (например, разрозненная форма).

  4. 4

    Запустите OCR

    Инструмент отрисовывает каждую страницу и распознаёт на ней текст — это занимает несколько секунд на страницу, поскольку OCR действительно требует больше работы, чем простое извлечение текста.

  5. 5

    Скопируйте или скачайте текст

    Проверьте извлечённый текст, затем скопируйте его или скачайте в виде обычного файла .txt.

Часто задаваемые вопросы

Поскольку модель и движок OCR размещены самостоятельно и работают в Web Worker, это работает даже с конфиденциальными отсканированными документами, которые вы не хотели бы загружать в стороннее API OCR.

← Назад к блогу