Como fazer OCR em um PDF escaneado e obter texto editável

Publicado em 1 de setembro de 2026 · 4 min de leitura

Um documento escaneado — um formulário fotocopiado, um contrato impresso que você fotografou, um recibo — na verdade é só uma imagem envolta em um PDF. Não há camada de texto para selecionar ou pesquisar. O reconhecimento óptico de caracteres (OCR) lê os pixels e reconstrói o texto de verdade, e esta ferramenta faz isso com o Tesseract, um motor de OCR de código aberto e maduro, rodando totalmente no lado do cliente via WebAssembly, com dados treinados auto-hospedados para 25 idiomas.

Experimentar OCR PDF

Passos

  1. 1

    Abra a ferramenta OCR PDF

    Acesse a ferramenta de OCR para PDF.

  2. 2

    Envie seu PDF escaneado

    Escolha o PDF (ou imagem) do qual você quer extrair texto.

  3. 3

    Escolha o idioma do documento e as opções

    Selecione o idioma em que o documento está escrito, quais páginas processar com OCR, e um modo de segmentação se seu documento tiver um layout incomum (como um formulário esparso).

  4. 4

    Execute o OCR

    A ferramenta renderiza cada página e reconhece o texto nela — isso leva alguns segundos por página, já que o OCR é genuinamente mais trabalhoso do que a extração de texto simples.

  5. 5

    Copie ou baixe o texto

    Revise o texto extraído, depois copie-o ou baixe-o como um arquivo .txt simples.

Perguntas frequentes

Como o modelo e o motor de OCR são auto-hospedados e rodam em um Web Worker, isso funciona mesmo em documentos escaneados sensíveis que você não gostaria de enviar a uma API de OCR de terceiros.

← Voltar ao blog