स्कैन की गई PDF को OCR से एडिटेबल टेक्स्ट में कैसे बदलें

प्रकाशित 1 सितंबर 2026 · 4 मिनट का पठन

स्कैन किया गया दस्तावेज़ — एक फ़ोटोकॉपी किया गया फ़ॉर्म, आपके द्वारा फ़ोटो खींचा गया प्रिंटेड अनुबंध, एक रसीद — असल में बस एक PDF में लिपटी हुई इमेज है। इसमें सिलेक्ट या सर्च करने के लिए कोई टेक्स्ट लेयर नहीं होती। ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) पिक्सेल को पढ़ता है और असली टेक्स्ट को फिर से बनाता है, और यह टूल Tesseract के साथ ऐसा करता है, जो एक परिपक्व ओपन-सोर्स OCR इंजन है, जो WebAssembly के ज़रिए पूरी तरह क्लाइंट-साइड पर चलता है, 25 भाषाओं के लिए सेल्फ़-होस्टेड ट्रेन्ड डेटा के साथ।

OCR PDF आज़माएँ

चरण

  1. 1

    OCR PDF टूल खोलें

    PDF के लिए OCR टूल पर जाएँ।

  2. 2

    अपनी स्कैन की गई PDF अपलोड करें

    वह PDF (या इमेज) चुनें जिससे आप टेक्स्ट निकालना चाहते हैं।

  3. 3

    दस्तावेज़ की भाषा और विकल्प चुनें

    वह भाषा चुनें जिसमें दस्तावेज़ लिखा गया है, किन पेजों पर OCR चलाना है, और अगर आपके दस्तावेज़ का लेआउट असामान्य है (जैसे कोई विरल फ़ॉर्म) तो एक सेगमेंटेशन मोड।

  4. 4

    OCR चलाएँ

    टूल हर पेज को रेंडर करता है और उस पर टेक्स्ट पहचानता है — इसमें प्रति पेज कुछ सेकंड लगते हैं, क्योंकि OCR सादे टेक्स्ट एक्सट्रैक्शन से सचमुच ज़्यादा काम करता है।

  5. 5

    टेक्स्ट कॉपी या डाउनलोड करें

    निकाले गए टेक्स्ट की समीक्षा करें, फिर उसे कॉपी करें या एक सादी .txt फ़ाइल के रूप में डाउनलोड करें।

अक्सर पूछे जाने वाले प्रश्न

चूँकि OCR मॉडल और इंजन सेल्फ़-होस्टेड हैं और एक Web Worker में चलते हैं, यह संवेदनशील स्कैन किए गए दस्तावेज़ों पर भी काम करता है जिन्हें आप किसी थर्ड-पार्टी OCR API पर अपलोड नहीं करना चाहेंगे।

← ब्लॉग पर वापस जाएँ