Comment faire de l'OCR sur un PDF scanné pour obtenir du texte modifiable
Publié le 1 septembre 2026 · 4 min de lecture
Un document scanné — un formulaire photocopié, un contrat imprimé que vous avez photographié, un reçu — n'est en réalité qu'une image enveloppée dans un PDF. Il n'y a aucune couche de texte à sélectionner ou à rechercher. La reconnaissance optique de caractères (OCR) lit les pixels et reconstruit le texte réel, et cet outil le fait avec Tesseract, un moteur OCR open source mature, exécuté entièrement côté client via WebAssembly, avec des données entraînées auto-hébergées pour 25 langues.
Essayer OCR PDFÉtapes
- 1
Ouvrez l'outil OCR PDF
Accédez à l'outil OCR pour PDF.
- 2
Envoyez votre PDF scanné
Choisissez le PDF (ou l'image) dont vous voulez extraire le texte.
- 3
Choisissez la langue du document et les options
Sélectionnez la langue dans laquelle le document est écrit, les pages à traiter par OCR, et un mode de segmentation si votre document a une mise en page inhabituelle (comme un formulaire épars).
- 4
Lancez l'OCR
L'outil affiche chaque page et en reconnaît le texte — cela prend quelques secondes par page, car l'OCR demande réellement plus de travail que la simple extraction de texte.
- 5
Copiez ou téléchargez le texte
Vérifiez le texte extrait, puis copiez-le ou téléchargez-le sous forme de fichier .txt brut.
Questions fréquentes
La précision dépend fortement de la qualité du scan — un scan propre, haute résolution et bien éclairé de texte imprimé donnera un OCR très précis ; une photo floue d'une écriture manuscrite non. Cet outil utilise le moteur Tesseract basé sur LSTM, optimisé pour le texte imprimé.
25 langues, correspondant à chaque langue disponible sur ce site, chacune avec son propre modèle entraîné auto-hébergé téléchargé uniquement lorsque vous le sélectionnez — rien n'est envoyé à une API OCR tierce.
Oui — l'OCR est bien plus lent par page que l'extraction de texte classique, donc les traitements sont limités à 50 pages pour éviter que le processus ne tourne pendant de longues minutes dans votre onglet de navigateur. Divisez d'abord un PDF plus volumineux si vous devez traiter plus de pages en OCR.
Non — si vous pouvez déjà sélectionner du texte dans votre visionneuse PDF, utilisez plutôt l'outil plus rapide PDF vers texte. L'OCR n'est nécessaire que lorsque le PDF est essentiellement une image de texte, sans aucune couche de texte sous-jacente.
Comme le modèle et le moteur OCR sont auto-hébergés et s'exécutent dans un Web Worker, cela fonctionne même sur des documents scannés sensibles que vous ne voudriez pas envoyer à une API OCR tierce.

