Πώς να κάνετε OCR σε σαρωμένο PDF για επεξεργάσιμο κείμενο

Δημοσιεύτηκε στις 1 Σεπτεμβρίου 2026 · 4 λεπτά ανάγνωσης

Ένα σαρωμένο έγγραφο — μια φωτοτυπημένη φόρμα, ένα τυπωμένο συμβόλαιο που φωτογραφήσατε, μια απόδειξη — είναι στην πραγματικότητα μόνο μια εικόνα τυλιγμένη σε PDF. Δεν υπάρχει επίπεδο κειμένου για επιλογή ή αναζήτηση. Η οπτική αναγνώριση χαρακτήρων (OCR) διαβάζει τα pixel και ανακατασκευάζει το πραγματικό κείμενο, και αυτό το εργαλείο το κάνει χρησιμοποιώντας το Tesseract, μια ώριμη μηχανή OCR ανοιχτού κώδικα, που εκτελείται εξ ολοκλήρου στην πλευρά του πελάτη μέσω WebAssembly, με αυτο-φιλοξενούμενα εκπαιδευμένα δεδομένα για 25 γλώσσες.

Δοκιμάστε το OCR PDF

Βήματα

  1. 1

    Ανοίξτε το εργαλείο OCR PDF

    Μεταβείτε στο εργαλείο OCR για PDF.

  2. 2

    Μεταφορτώστε το σαρωμένο PDF σας

    Επιλέξτε το PDF (ή την εικόνα) από το οποίο θέλετε να εξάγετε κείμενο.

  3. 3

    Επιλέξτε γλώσσα εγγράφου και επιλογές

    Επιλέξτε τη γλώσσα στην οποία είναι γραμμένο το έγγραφο, τις σελίδες προς επεξεργασία με OCR και τη λειτουργία τμηματοποίησης αν το έγγραφό σας έχει ασυνήθιστη διάταξη (π.χ. μια διάσπαρτη φόρμα).

  4. 4

    Εκτελέστε το OCR

    Το εργαλείο αποδίδει κάθε σελίδα και αναγνωρίζει το κείμενο σε αυτήν — αυτό διαρκεί μερικά δευτερόλεπτα ανά σελίδα, καθώς το OCR πραγματικά απαιτεί περισσότερη δουλειά από την απλή εξαγωγή κειμένου.

  5. 5

    Αντιγράψτε ή κατεβάστε το κείμενο

    Ελέγξτε το εξαγόμενο κείμενο, στη συνέχεια αντιγράψτε το ή κατεβάστε το ως απλό αρχείο .txt.

Συχνές ερωτήσεις

Επειδή το μοντέλο και η μηχανή OCR είναι αυτο-φιλοξενούμενα και εκτελούνται σε ένα Web Worker, αυτό λειτουργεί ακόμα και σε ευαίσθητα σαρωμένα έγγραφα που δεν θα θέλατε να μεταφορτώσετε σε εξωτερικό API OCR.

← Επιστροφή στο ιστολόγιο