Πώς να κάνετε OCR σε σαρωμένο PDF για επεξεργάσιμο κείμενο
Δημοσιεύτηκε στις 1 Σεπτεμβρίου 2026 · 4 λεπτά ανάγνωσης
Ένα σαρωμένο έγγραφο — μια φωτοτυπημένη φόρμα, ένα τυπωμένο συμβόλαιο που φωτογραφήσατε, μια απόδειξη — είναι στην πραγματικότητα μόνο μια εικόνα τυλιγμένη σε PDF. Δεν υπάρχει επίπεδο κειμένου για επιλογή ή αναζήτηση. Η οπτική αναγνώριση χαρακτήρων (OCR) διαβάζει τα pixel και ανακατασκευάζει το πραγματικό κείμενο, και αυτό το εργαλείο το κάνει χρησιμοποιώντας το Tesseract, μια ώριμη μηχανή OCR ανοιχτού κώδικα, που εκτελείται εξ ολοκλήρου στην πλευρά του πελάτη μέσω WebAssembly, με αυτο-φιλοξενούμενα εκπαιδευμένα δεδομένα για 25 γλώσσες.
Δοκιμάστε το OCR PDFΒήματα
- 1
Ανοίξτε το εργαλείο OCR PDF
Μεταβείτε στο εργαλείο OCR για PDF.
- 2
Μεταφορτώστε το σαρωμένο PDF σας
Επιλέξτε το PDF (ή την εικόνα) από το οποίο θέλετε να εξάγετε κείμενο.
- 3
Επιλέξτε γλώσσα εγγράφου και επιλογές
Επιλέξτε τη γλώσσα στην οποία είναι γραμμένο το έγγραφο, τις σελίδες προς επεξεργασία με OCR και τη λειτουργία τμηματοποίησης αν το έγγραφό σας έχει ασυνήθιστη διάταξη (π.χ. μια διάσπαρτη φόρμα).
- 4
Εκτελέστε το OCR
Το εργαλείο αποδίδει κάθε σελίδα και αναγνωρίζει το κείμενο σε αυτήν — αυτό διαρκεί μερικά δευτερόλεπτα ανά σελίδα, καθώς το OCR πραγματικά απαιτεί περισσότερη δουλειά από την απλή εξαγωγή κειμένου.
- 5
Αντιγράψτε ή κατεβάστε το κείμενο
Ελέγξτε το εξαγόμενο κείμενο, στη συνέχεια αντιγράψτε το ή κατεβάστε το ως απλό αρχείο .txt.
Συχνές ερωτήσεις
Η ακρίβεια εξαρτάται σε μεγάλο βαθμό από την ποιότητα σάρωσης — μια καθαρή, υψηλής ανάλυσης, καλά φωτισμένη σάρωση τυπωμένου κειμένου θα παράγει πολύ ακριβές OCR· μια θολή φωτογραφία γραφικού χαρακτήρα δεν θα το κάνει. Αυτό το εργαλείο χρησιμοποιεί τη μηχανή βασισμένη σε LSTM του Tesseract, ρυθμισμένη για τυπωμένο κείμενο.
25 γλώσσες, αντίστοιχες με κάθε γλώσσα διαθέσιμη σε αυτόν τον ιστότοπο, καθεμία με το δικό της αυτο-φιλοξενούμενο εκπαιδευμένο μοντέλο που κατεβάζεται μόνο όταν επιλεγεί — τίποτα δεν αποστέλλεται σε εξωτερικό API OCR.
Ναι — το OCR είναι σημαντικά πιο αργό ανά σελίδα από την απλή εξαγωγή κειμένου, οπότε οι εκτελέσεις περιορίζονται σε 50 σελίδες, ώστε η διαδικασία να μην εκτελείται για λεπτά στην καρτέλα του προγράμματος περιήγησής σας. Χωρίστε πρώτα ένα μεγαλύτερο PDF αν χρειάζεται να κάνετε OCR σε περισσότερες σελίδες.
Όχι — αν μπορείτε ήδη να επιλέξετε κείμενο στο πρόγραμμα προβολής PDF σας, χρησιμοποιήστε αντ' αυτού το ταχύτερο εργαλείο PDF σε κείμενο. Το OCR χρειάζεται μόνο όταν το PDF είναι ουσιαστικά μια εικόνα κειμένου, χωρίς κανένα επίπεδο κειμένου από κάτω.
Επειδή το μοντέλο και η μηχανή OCR είναι αυτο-φιλοξενούμενα και εκτελούνται σε ένα Web Worker, αυτό λειτουργεί ακόμα και σε ευαίσθητα σαρωμένα έγγραφα που δεν θα θέλατε να μεταφορτώσετε σε εξωτερικό API OCR.

