Comment faire de l'OCR sur un PDF scanné pour obtenir du texte modifiable

Publié le 1 septembre 2026 · 4 min de lecture

Un document scanné — un formulaire photocopié, un contrat imprimé que vous avez photographié, un reçu — n'est en réalité qu'une image enveloppée dans un PDF. Il n'y a aucune couche de texte à sélectionner ou à rechercher. La reconnaissance optique de caractères (OCR) lit les pixels et reconstruit le texte réel, et cet outil le fait avec Tesseract, un moteur OCR open source mature, exécuté entièrement côté client via WebAssembly, avec des données entraînées auto-hébergées pour 25 langues.

Essayer OCR PDF

Étapes

  1. 1

    Ouvrez l'outil OCR PDF

    Accédez à l'outil OCR pour PDF.

  2. 2

    Envoyez votre PDF scanné

    Choisissez le PDF (ou l'image) dont vous voulez extraire le texte.

  3. 3

    Choisissez la langue du document et les options

    Sélectionnez la langue dans laquelle le document est écrit, les pages à traiter par OCR, et un mode de segmentation si votre document a une mise en page inhabituelle (comme un formulaire épars).

  4. 4

    Lancez l'OCR

    L'outil affiche chaque page et en reconnaît le texte — cela prend quelques secondes par page, car l'OCR demande réellement plus de travail que la simple extraction de texte.

  5. 5

    Copiez ou téléchargez le texte

    Vérifiez le texte extrait, puis copiez-le ou téléchargez-le sous forme de fichier .txt brut.

Questions fréquentes

Comme le modèle et le moteur OCR sont auto-hébergés et s'exécutent dans un Web Worker, cela fonctionne même sur des documents scannés sensibles que vous ne voudriez pas envoyer à une API OCR tierce.

← Retour au blog