كيفية استخدام التعرف الضوئي على الحروف (OCR) لتحويل PDF ممسوح ضوئيًا إلى نص قابل للتحرير
نُشر في 1 سبتمبر 2026 · 4 دقيقة قراءة
المستند الممسوح ضوئيًا — نموذج مصوَّر، عقد مطبوع صوّرته، إيصال — هو في الحقيقة مجرد صورة ملفوفة داخل PDF. لا توجد طبقة نصية للتحديد أو البحث. يقرأ التعرف الضوئي على الحروف (OCR) وحدات البكسل ويعيد بناء النص الفعلي، وتقوم هذه الأداة بذلك باستخدام Tesseract، محرك OCR ناضج مفتوح المصدر، يعمل بالكامل من جهة العميل عبر WebAssembly، مع بيانات مدرَّبة مستضافة ذاتيًا لـ 25 لغة.
جرّب OCR PDFالخطوات
- 1
افتح أداة OCR لملفات PDF
انتقل إلى أداة OCR لملفات PDF.
- 2
ارفع ملف PDF الممسوح ضوئيًا
اختر ملف PDF (أو الصورة) الذي تريد استخراج النص منه.
- 3
اختر لغة المستند والخيارات
حدد اللغة التي كُتب بها المستند، والصفحات المراد معالجتها بـ OCR، ووضع تجزئة إذا كان تخطيط مستندك غير معتاد (مثل نموذج متناثر).
- 4
شغّل OCR
تعرض الأداة كل صفحة وتتعرف على النص فيها — يستغرق ذلك بضع ثوانٍ لكل صفحة، لأن OCR يتطلب فعليًا عملًا أكثر من مجرد استخراج النص.
- 5
انسخ أو نزّل النص
راجع النص المستخرج، ثم انسخه أو نزّله كملف .txt عادي.
الأسئلة الشائعة
تعتمد الدقة بشدة على جودة المسح الضوئي — مسح نظيف وعالي الدقة وجيد الإضاءة لنص مطبوع سيُتعرَّف عليه بدقة عالية جدًا؛ أما صورة مشوّشة لخط يد فلن تكون كذلك. تستخدم هذه الأداة محرك Tesseract المعتمد على LSTM، المضبوط للنص المطبوع.
25 لغة، تطابق كل لغة متاحة على هذا الموقع، لكل منها نموذج مدرَّب مستضاف ذاتيًا يُنزَّل فقط عند اختيارك له — لا يُرسل شيء إلى واجهة برمجة تطبيقات OCR تابعة لجهة خارجية.
نعم — OCR أبطأ بكثير لكل صفحة من استخراج النص العادي، لذا تُحدَّد العمليات بـ 50 صفحة لمنع استمرار العملية لدقائق طويلة في تبويب متصفحك. قسّم ملف PDF الأكبر أولًا إذا احتجت إلى معالجة المزيد من الصفحات بـ OCR.
لا — إذا كنت تستطيع بالفعل تحديد النص في عارض PDF الخاص بك، استخدم بدلًا من ذلك أداة PDF إلى نص الأسرع. لا يلزم OCR إلا عندما يكون ملف PDF في الأساس صورة لنص، دون أي طبقة نصية تحتها.
بما أن نموذج ومحرك OCR مستضافان ذاتيًا ويعملان في Web Worker، فإن هذا يعمل حتى مع المستندات الممسوحة ضوئيًا الحساسة التي لا ترغب في رفعها إلى واجهة برمجة تطبيقات OCR تابعة لجهة خارجية.

