Cómo hacer OCR de un PDF escaneado para obtener texto editable

Publicado el 1 de septiembre de 2026 · 4 min de lectura

Un documento escaneado —un formulario fotocopiado, un contrato impreso que fotografiaste, un recibo— en realidad es solo una imagen envuelta en un PDF. No hay una capa de texto que seleccionar ni buscar. El reconocimiento óptico de caracteres (OCR) lee los píxeles y reconstruye el texto real, y esta herramienta lo hace con Tesseract, un motor de OCR de código abierto maduro, ejecutado completamente del lado del cliente vía WebAssembly, con datos entrenados autoalojados para 25 idiomas.

Probar OCR PDF

Pasos

  1. 1

    Abre la herramienta OCR PDF

    Ve a la herramienta de OCR para PDF.

  2. 2

    Sube tu PDF escaneado

    Elige el PDF (o imagen) del que quieres extraer texto.

  3. 3

    Elige el idioma del documento y las opciones

    Selecciona el idioma en el que está escrito el documento, qué páginas procesar con OCR, y un modo de segmentación si tu documento tiene un diseño inusual (como un formulario disperso).

  4. 4

    Ejecuta el OCR

    La herramienta renderiza cada página y reconoce el texto en ella; esto tarda unos segundos por página, ya que el OCR es realmente más trabajo que la simple extracción de texto.

  5. 5

    Copia o descarga el texto

    Revisa el texto extraído, y luego cópialo o descárgalo como archivo .txt plano.

Preguntas frecuentes

Como el modelo y el motor de OCR están autoalojados y se ejecutan en un Web Worker, esto funciona incluso con documentos escaneados sensibles que no querrías subir a una API de OCR de terceros.

← Volver al blog