Wie man ein gescanntes PDF per OCR in bearbeitbaren Text umwandelt

Veröffentlicht am 1. September 2026 · 4 Min. Lesezeit

Ein gescanntes Dokument – ein fotokopiertes Formular, ein ausgedruckter Vertrag, den du fotografiert hast, eine Quittung – ist eigentlich nur ein Bild, verpackt in ein PDF. Es gibt keine Textebene zum Auswählen oder Durchsuchen. Optische Zeichenerkennung (OCR) liest die Pixel und rekonstruiert den tatsächlichen Text, und dieses Tool macht das mit Tesseract, einer ausgereiften Open-Source-OCR-Engine, vollständig clientseitig über WebAssembly ausgeführt, mit selbst gehosteten Trainingsdaten für 25 Sprachen.

OCR PDF ausprobieren

Schritte

  1. 1

    Öffne das Tool OCR-PDF

    Rufe das OCR-Tool für PDF auf.

  2. 2

    Lade dein gescanntes PDF hoch

    Wähle das PDF (oder Bild), aus dem du Text extrahieren möchtest.

  3. 3

    Dokumentsprache und Optionen wählen

    Wähle die Sprache, in der das Dokument verfasst ist, welche Seiten per OCR verarbeitet werden sollen, und bei ungewöhnlichem Layout (wie einem spärlich befüllten Formular) einen Segmentierungsmodus.

  4. 4

    OCR ausführen

    Das Tool rendert jede Seite und erkennt den Text darauf – das dauert einige Sekunden pro Seite, da OCR tatsächlich aufwendiger ist als reine Textextraktion.

  5. 5

    Text kopieren oder herunterladen

    Überprüfe den extrahierten Text und kopiere ihn dann oder lade ihn als reine .txt-Datei herunter.

Häufig gestellte Fragen

Da Modell und OCR-Engine selbst gehostet sind und in einem Web Worker laufen, funktioniert das sogar bei sensiblen gescannten Dokumenten, die du nicht an eine externe OCR-API hochladen möchtest.

← Zurück zum Blog