التحويل والاستخراج

التعرّف الضوئي مقابل تحويل PDF إلى Word

ما الفرق بين التعرّف الضوئي على الحروف وتحويل ملف PDF إلى Word؟

الإجابة المختصرة

ينظر التعرّف الضوئي إلى بكسلات الصفحة الممسوحة ويخمّن الحروف التي تمثّلها. أما تحويل PDF إلى Word فيأخذ نصاً مخزَّناً أصلاً في الملف ويعيد بناءه كمستند قابل للتحرير. فإن كان ملف PDF لديك ممسوحاً ضوئياً فليس هناك نص ليُحوَّل، ولا يفيد عندها سوى التعرّف الضوئي — وiBuildPDF لا يملك أداة تعرّف ضوئي.

نوعان من ملفات PDF يبدوان متطابقين

كل الالتباس حول التعرّف الضوئي تقريباً ينبع من حقيقة واحدة: يستطيع ملف PDF تخزين الصفحة بطريقتين مختلفتين تماماً، وتبدو الطريقتان متماثلتين على الشاشة.

1T e x t54 65 78 74234

الصفحة نفسها، بنص وبلا نص

  1. ملف PDF رقمي. لا يمكن تمييزه على الشاشة عن الذي على اليمين.
  2. وتحته: رموز حروف، لكل منها خط وموضع. قابل للبحث والتحديد والتحويل.
  3. ملف PDF ممسوح ضوئياً. الصفحة نفسها، والمظهر نفسه.
  4. وتحته: شبكة عيّنات فاتحة وداكنة. لا حروف، لا كلمات، لا شيء للبحث فيه.

النوع الأول له طبقة نص. فالملف يحوي كائنات نص حقيقية — سلسلة حروف وخطاً وحجماً وإحداثيات تحدد موضع رسم كل جزء على الصفحة. والصفحة مجموعة تعليمات لرسم الحروف. ويستطيع برنامج قراءة تلك الحروف من جديد بدقة تامة، لأنها لم تكن يوماً سوى حروف.

والنوع الثاني هو صور الصفحات. وهذا ما ينتجه الماسح الضوئي أو كاميرا الهاتف أو الفاكس: كل صفحة صورة واحدة مغلَّفة في ملف PDF. ولا يوجد نص في أي مكان من الملف. فما يبدو أنه حرف «ع» ليس إلا نمطاً من البكسلات الداكنة تتعرّف عليه العين البشرية بوصفه «ع»؛ أما بالنسبة إلى البرنامج فهو لا يختلف عن صورة قطة.

اختبار الثانيتين

حاول تحديد كلمة بسحب المؤشر عليها في أي عارض. فإن أُضيئت الكلمات فرادى، فللملف طبقة نص. وإن رسم المؤشر مستطيلاً بدلاً من ذلك — أي مربع تحديد لا تحديد نص — فلا توجد طبقة نص وأنت أمام صورة.

وهناك أداتان هنا تؤكدان ذلك دون تخمين. فأداة عدد الصفحات تبلّغك بوجود طبقة نص في المستند من عدمه. وأداة PDF إلى نص لا تعيد شيئاً مفيداً من مستند ممسوح — نتيجة فارغة عادةً، وأحياناً سطراً شارداً أضافه برنامج المسح. وتلك النتيجة الفارغة ليست علّة؛ بل هي الجواب الصحيح عن سؤال «ما النص الموجود في هذا الملف؟»

وقد تكون المستندات مختلطة. فالعقد المكتوب في معالج نصوص ثم الموقَّع والممسوح ضوئياً قد تكون له طبقة نص في معظم صفحاته ولا طبقة في الصفحة الممسوحة. تحقّق من الصفحة التي تهمّك.

ماذا يفعل التعرّف الضوئي

يشير اختصار OCR إلى التعرّف الضوئي على الحروف. وهو يأخذ صورة، ويعثر على المناطق التي تبدو نصاً، ويقسّمها إلى أسطر ثم إلى أشكال حروف مفردة، ويقارن كل شكل بنموذج لأشكال الحروف. ويُخرج لكل حرف أفضل تخمين لديه ورقم ثقة — أي مدى تأكده.

وكلمة تخمين هي المهمة هنا. فالتعرّف الضوئي لا يستعيد النص الأصلي، لأن النص الأصلي غير موجود في الملف. بل ينتج نصاً جديداً يعتقد أنه يطابق الصورة — جيداً جداً في العادة، وخاطئاً أحياناً، ولا شيء في الناتج يخبرك أيّهما أيّ ما لم تفحص قيم الثقة.

وتعتمد الدقة على أمور يمكنك في معظمها أن تراها بنفسك:

  • جودة المسح. الدقة والتباين والميل والظلال الناتجة عن كاميرا الهاتف والتنقيط الناتج عن ماسح رخيص والنص المصوَّر بآلة النسخ مرات أكثر من اللازم.
  • اللغة ونوع الخط. لا بد أن يُخبَر المحرك باللغة المتوقعة؛ فالنموذج الخاطئ ينتج هراءً واثقاً. والخطوط غير المألوفة والكتابة اليدوية أصعب بكثير من النثر المطبوع العادي.
  • التخطيط. وهنا يخطئ التعرّف الضوئي أكثر ما يخطئ. فترتيب القراءة يجب أن يُستنتج من المواضع، وقد تعود صفحة من عمودين بأعمدة متداخلة سطراً بسطر. والجداول أسوأ: فحدود الخلايا قد تكون خطوطاً مرسومة وقد لا تكون سوى فراغ، وكثيراً ما يصل الجدول على هيئة سيل من الأرقام وقد اختفت صفوفه وأعمدته.

والمحرك القياسي مفتوح المصدر هو Tesseract، وهو ما تستخدمه في العمق معظم أدوات التعرّف الضوئي المجانية والمستضافة ذاتياً. وأياً كان المحرك الذي تستخدمه، عامِل الناتج بوصفه مسودة: راجعه، وانظر خصوصاً في الأرقام وفي أزواج الحروف المتشابهة في الطباعة.

ماذا يفعل تحويل PDF إلى Word

يفعل محوّل PDF إلى Word شيئاً مختلفاً تماماً. فهو يقرأ كائنات النص الموجودة أصلاً في الملف، مع خطوطها وإحداثياتها، ويعيد بناء مستند قابل للتحرير منها.

فالحروف معروفة بدقة — لأنها خُزِّنت كحروف. وما يجب استنتاجه هو البنية، لأن صفحة PDF تقول «ارسم هذه السلسلة عند هذا الموضع»، لا «هذه فقرة» ولا «هذه الخلية الثانية من الصف الرابع». فيستنتج المحوّل:

  • الفقرات، من الأسطر التي تتشارك خطاً واحداً وتقع على تباعد وإزاحة منتظمين؛
  • العناوين والتوكيد، من الخطوط الأكبر أو الأثقل؛
  • القوائم، من رموز التعداد أو الأرقام المتكررة ضمن إزاحة معلّقة؛
  • الجداول، من الخطوط المرسومة أو من نص يصطف في أعمدة على امتداد الصفحة.

وهذا الاستنتاج تخمين أيضاً، لكنه تخمين من نوع مختلف عن تخمين التعرّف الضوئي. فقد يخطئ المحوّل في تحديد موضع نهاية الفقرة؛ لكنه لا يخطئ في الحروف التي تتألف منها.

وإن شغّلت محوّلاً على مستند ممسوح فسيفشل لسبب بسيط: لا يوجد ما يُحوَّل. فهو لا يقرأ البكسلات، ولذلك لا يجد نصاً وينتج إما مستنداً فارغاً وإما ملف Word فيه صورة واحدة بحجم الصفحة لكل صفحة — لا يقبل التحرير أكثر مما كان يقبله ملف PDF.

أيّهما تحتاج

مسار القرار قصير:

  1. حاول تحديد كلمة في ملف PDF.
  2. إن أُضيئت الكلمات، فأنت تحتاج إلى تحويل. فالنص موجود؛ وأنت تريده بصيغة قابلة للتحرير.
  3. وإن حصلت على مربع تحديد، فأنت تحتاج إلى تعرّف ضوئي أولاً. فليس لدى التحويل ما يعمل عليه حتى ينشئ التعرّف الضوئي طبقة نص.
  4. وإن كنت تريد الكلمات فحسب — للاقتباس أو البحث أو اللصق — فإن أداة PDF إلى نص تكفي؛ ولا تحتاج إلى ملف Word إطلاقاً.
التعرّف الضوئيتحويل PDF إلى Word
المُدخلمستند ممسوح ضوئياً أو صورة: صفحات بلا طبقة نصملف PDF له طبقة نص أصلاً
ما الذي يقرؤهالبكسلاتكائنات النص وإحداثياتها
المُخرجنص متعرَّف عليه، ولكل حرف رقم ثقةمستند قابل للتحرير بفقرات وأنماط وجداول مستنتَجة
أبرز أوجه الإخفاقحروف تُقرأ خطأً، وضياع ترتيب القراءة في الجداول والصفحات متعددة الأعمدةبنية خاطئة — فقرات مدموجة وجداول مكسورة؛ وإخفاق تام مع المستند الممسوح، لأنه لا يوجد نص يُقرأ

وإن لم تكن متأكداً من كيفية إنتاج ملف ما، فكثيراً ما تقول ذلك بياناته الوصفية. فحقل المنتِج يذكر عادةً اسم الماسح الضوئي أو التطبيق الذي كتب ملف PDF — راجع ما الذي تحتويه بيانات PDF الوصفية.

ما يستطيعه iBuildPDF وما لا يستطيعه هنا

بصراحة: لا يستطيع iBuildPDF إنجاز أي من شطري هذه المهمة نيابةً عنك.

لا توجد أداة تعرّف ضوئي في هذا الموقع. فلا شيء من الأدوات يتعرّف على الحروف داخل صورة. وأداة PDF إلى نص تستخرج طبقة نص موجودة أصلاً؛ ولا تستطيع إنشاء واحدة. وهي لا تعيد شيئاً من ملف PDF ممسوح ضوئياً، ولا يغيّر ذلك أي إعداد.

ومحوّل PDF إلى Word غير متاح. فهو مدرَج بوصفه «قريباً» وهو معطَّل، وكذلك مدخلَا PDF إلى Excel وPDF إلى PowerPoint. فلا تبنِ خططك عليها.

وإليك ما تفعله بدلاً من ذلك، بالترتيب الجدير بالتجربة:

  • اطلب النسخة الأصلية من المرسِل. فإن كان أحدهم قد مسح مستنداً كتبه بنفسه، فالملف المصدر ما زال موجوداً، وسيكون أدقّ من أي شيء يستطيع التعرّف الضوئي أو التحويل إعادة بنائه.
  • استخدم أداة تعرّف ضوئي مخصصة. فـTesseract مجاني ومتوفر في حزم كثيرة؛ والمنتجات التجارية تتعامل عموماً مع الجداول والمسح الرديء بشكل أفضل. واختر أداة تتيح لك تحديد اللغة.
  • حسّن المسح أولاً. فإعادة المسح بدقة أعلى، مستوياً ومستقيماً وبتباين جيد، تفيد الدقة أكثر من أي معالجة لاحقة.
  • تحقّق بأداة عدد الصفحات قبل أن تبدأ، لتعرف أي مشكلة لديك فعلاً.

الأدوات التي يغطيها هذا المقال

المصادر

التوثيق الأساسي للمعلومات الواردة أعلاه.

آخر مراجعة: 16 سبتمبر 2026

نشر بواسطة iBuildPDF.

المزيد من قاعدة المعرفة

تصفّح قاعدة المعرفة