स्कैन की गई PDF को OCR से एडिटेबल टेक्स्ट में कैसे बदलें
प्रकाशित 1 सितंबर 2026 · 4 मिनट का पठन
स्कैन किया गया दस्तावेज़ — एक फ़ोटोकॉपी किया गया फ़ॉर्म, आपके द्वारा फ़ोटो खींचा गया प्रिंटेड अनुबंध, एक रसीद — असल में बस एक PDF में लिपटी हुई इमेज है। इसमें सिलेक्ट या सर्च करने के लिए कोई टेक्स्ट लेयर नहीं होती। ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) पिक्सेल को पढ़ता है और असली टेक्स्ट को फिर से बनाता है, और यह टूल Tesseract के साथ ऐसा करता है, जो एक परिपक्व ओपन-सोर्स OCR इंजन है, जो WebAssembly के ज़रिए पूरी तरह क्लाइंट-साइड पर चलता है, 25 भाषाओं के लिए सेल्फ़-होस्टेड ट्रेन्ड डेटा के साथ।
OCR PDF आज़माएँचरण
- 1
OCR PDF टूल खोलें
PDF के लिए OCR टूल पर जाएँ।
- 2
अपनी स्कैन की गई PDF अपलोड करें
वह PDF (या इमेज) चुनें जिससे आप टेक्स्ट निकालना चाहते हैं।
- 3
दस्तावेज़ की भाषा और विकल्प चुनें
वह भाषा चुनें जिसमें दस्तावेज़ लिखा गया है, किन पेजों पर OCR चलाना है, और अगर आपके दस्तावेज़ का लेआउट असामान्य है (जैसे कोई विरल फ़ॉर्म) तो एक सेगमेंटेशन मोड।
- 4
OCR चलाएँ
टूल हर पेज को रेंडर करता है और उस पर टेक्स्ट पहचानता है — इसमें प्रति पेज कुछ सेकंड लगते हैं, क्योंकि OCR सादे टेक्स्ट एक्सट्रैक्शन से सचमुच ज़्यादा काम करता है।
- 5
टेक्स्ट कॉपी या डाउनलोड करें
निकाले गए टेक्स्ट की समीक्षा करें, फिर उसे कॉपी करें या एक सादी .txt फ़ाइल के रूप में डाउनलोड करें।
अक्सर पूछे जाने वाले प्रश्न
सटीकता स्कैन क्वालिटी पर बहुत निर्भर करती है — प्रिंटेड टेक्स्ट का साफ़, हाई-रिज़ॉल्यूशन, अच्छी रोशनी वाला स्कैन बहुत सटीक OCR देगा; हस्तलेख की धुंधली फ़ोटो नहीं देगी। यह टूल LSTM-आधारित Tesseract इंजन का उपयोग करता है, जो प्रिंटेड टेक्स्ट के लिए ट्यून किया गया है।
25 भाषाएँ, जो इस साइट की हर उपलब्ध भाषा से मेल खाती हैं, हर एक का अपना सेल्फ़-होस्टेड ट्रेन्ड मॉडल है जो केवल आपके द्वारा चुने जाने पर डाउनलोड होता है — किसी थर्ड-पार्टी OCR API को कुछ नहीं भेजा जाता।
हाँ — OCR प्रति पेज सामान्य टेक्स्ट एक्सट्रैक्शन से कहीं ज़्यादा धीमा है, इसलिए रन को 50 पेज तक सीमित रखा गया है ताकि प्रोसेस आपके ब्राउज़र टैब में कई मिनट तक न चले। ज़्यादा पेजों पर OCR चलाने की ज़रूरत हो तो पहले बड़ी PDF को विभाजित करें।
नहीं — अगर आप पहले से अपने PDF व्यूअर में टेक्स्ट सिलेक्ट कर सकते हैं, तो इसके बजाय तेज़ PDF से टेक्स्ट टूल का उपयोग करें। OCR की ज़रूरत तभी होती है जब PDF मूल रूप से टेक्स्ट की एक इमेज हो, जिसके नीचे कोई टेक्स्ट लेयर न हो।
चूँकि OCR मॉडल और इंजन सेल्फ़-होस्टेड हैं और एक Web Worker में चलते हैं, यह संवेदनशील स्कैन किए गए दस्तावेज़ों पर भी काम करता है जिन्हें आप किसी थर्ड-पार्टी OCR API पर अपलोड नहीं करना चाहेंगे।

