ما الذي يجعل ملف PDF قابلاً للوصول
ما الذي يجعل ملف PDF قابلاً للوصول عبر قارئ الشاشة؟
احفظ أدواتك المفضلة
أنشئ حساباً مجانياً على iBuildPDF للاحتفاظ بأدواتك المفضلة والوصول إليها بسرعة في أي وقت.
حساب مجاني. أدوات PDF نفسها لا تحتاج إلى حساب أبداً.
الإجابة المختصرة
البنية، لا النص وحده. فقارئ الشاشة يحتاج أن يعرف أن هذا السطر عنوان، وأن تلك الكتلة جدول بهذه الأعمدة، وأن هذه الصورة تعني كذا، وأن ترتيب القراءة يسير على هذا النحو. وتوجد هذه المعلومات في طبقة من الوسوم قد يحملها ملف PDF وقد لا يحملها. والنص القابل للتحديد ضروري لكنه أبعد ما يكون عن الكفاية: فقد يكون المستند قابلاً للبحث تماماً ويظل مع ذلك غير صالح للاستعمال.
ما الوسوم
صفحة PDF بصرياً مجموعة من تعليمات الرسم: ضع هذه الأشكال الطباعية عند هذه الإحداثيات. وليس في ذلك ما يبيّن أي الأشكال يؤلف عنواناً، ولا أيها ينتمي إلى الفقرة نفسها، ولا أن هذه السلاسل النصية الاثنتي عشرة خلايا في جدول. والقارئ المبصر يستنتج ذلك كله من الحجم والوزن والموضع. أما البرمجيات فلا تستطيع.
ترتيب القراءة مُخزَّن، لا مُخمَّن
- ما يراه القارئ المبصر: عنوان، ثم عمودان.
- شجرة الوسوم — عنوان، ثم فقرة، ثم فقرة. هذا ما يحدد أي عمود يأتي أولاً.
- دون وسوم، يجب استنتاج الترتيب من الموضع، وصفحة العمودين هي حيث يفسد ذلك.
ويضيف ملف PDF الموسوم شجرة بنية موازية — عناوين وفقرات وقوائم وجداول وأشكال — تشبه إلى حد بعيد بنية مستند HTML. وبها تستطيع التقنيات المساعدة أن تعلن "عنوان من المستوى الثاني"، وأن تتيح للمستخدم التنقل بين الأقسام، وأن تقرأ جدولاً صفاً صفاً وعموداً عموداً، وأن تقرأ النص البديل لشكل ما. ومن دونها يرتد البرنامج نفسه إلى التخمين من التنسيق، وهو تخمين رديء في كل ما عدا أبسط الصفحات ذات العمود الواحد.
وثمة ثلاثة أمور أخرى تحملها طبقة الوسوم، وكلها مهمة وليس منها ما هو مرئي:
- ترتيب القراءة، وهو ليس ترتيب رسم العناصر. فتنسيق من عمودين مرسوم عموداً بعد عمود يُقرأ قراءة صحيحة؛ أما إذا رُسم سطراً سطراً عبر العمودين فيُقرأ كلاماً لا معنى له، ومظهره واحد في الحالتين.
- النص البديل للصور، الذي من دونه يُعلَن عن الشكل بوصفه "رسماً" لا أكثر.
- لغة المستند، التي تخبر قارئ الشاشة بقواعد النطق التي يستخدمها. فمستند فرنسي يُقرأ بقواعد إنجليزية يكاد لا يُفهم.
لماذا لا يُعدّ OCR إمكانية وصول
هذا أشيع سوء فهم وأكثره كلفة، فيستحق الحديث عنه بصراحة.
إن تشغيل التعرّف الضوئي على المحارف على مستند ممسوح يضيف طبقة من النص المتعرَّف عليه خلف الصورة. فيصبح المستند قابلاً للبحث، ويصبح النص قابلاً للتحديد، وسيقرأ قارئ الشاشة شيئاً بدل لا شيء. وهذا تحسّن حقيقي وكبير، وهو ليس إمكانية وصول.
فما ينتجه OCR تدفّق غير مميَّز من الكلمات. فهو لا يعرف أن سطراً كان عنواناً؛ وإنما ينتج سطر نص. ولا يعرف أن الجدول جدول؛ وإنما ينتج محتويات الخلايا بالترتيب الذي مسحها به، وهو في الجداول ترتيب خاطئ في كثير من الأحيان، ويُعلَن دون أي إشارة إلى العمود الذي ينتمي إليه رقم ما. ولا يستطيع كتابة نص بديل لصورة فوتوغرافية، لأنه لا يعرف موضوعها.
إذاً: التعرّف الضوئي هو الخطوة الأولى الضرورية لأي مسح ضوئي، ويظل المستند بعده خالياً من كل البنية التي تجعله صالحاً للاستعمال. واعتبار "لقد شغّلنا OCR عليه" مساوياً لـ"لقد جعلناه قابلاً للوصول" هو الطريق الذي تنتهي به المؤسسات إلى الاعتقاد بأن أرشيف مستنداتها مطابق للمعايير وهو ليس كذلك.
فحص المستند بصدق
يمكن فحص بعض هذا بسرعة، ويستحق الأمر أن يُفعل قبل افتراض سلامة الملف.
- هل ثمة نص أصلاً؟ جرّب تحديد جملة. فإن لم يُحدَّد شيء، فالصفحة صورة وتحتاج إلى OCR قبل أي شيء آخر. وتجيب أداة استخراج النص من ملف PDF عن السؤال نفسه — فالنتيجة الفارغة تعني أنه لا توجد طبقة نص.
- هل ترتيب القراءة صحيح؟ حدّد كل النص في صفحة معقدة والصقه في محرّر نصوص عادي. فما تحصل عليه قريب من الترتيب الذي سيستخدمه قارئ الشاشة. فإن خرجت صفحة من عمودين متداخلةً، فترتيب القراءة خاطئ مهما بدا شكلها.
- هل هو موسوم؟ تعرض العارضات المكتبية ذلك في خصائص المستند، عادةً بصيغة "PDF موسوم: نعم/لا". و"لا" حاسمة؛ أما "نعم" فتعني فقط أن الوسوم موجودة، لا أنها صحيحة.
- هل اللغة مضبوطة؟ يعرض محرّر البيانات الوصفية الخصائص المسجَّلة في الملف على مستوى المستند.
والفاحصات الآلية مفيدة ومحدودة بطريقة بعينها: فهي تتحقق من وجود البنى وسلامة تكوينها، لا من صحتها. ولا يستطيع الفاحص أن يخبرك بأن عنواناً وُسم فقرةً، ولا بأن النص البديل لصورة فوتوغرافية يقول "image1.jpg". فهذه تحتاج إلى إنسان.
ما تستطيعه أدوات المتصفح وما لا تستطيعه في هذا الشأن
لنكن صريحين بشأن الحدود: لا يجعل iBuildPDF ملفات PDF قابلة للوصول، ولا تستطيع ذلك حقاً أي أداة تكتفي بتحرير ملف قائم. فإمكانية الوصول تتقرر في معظمها حيث يُؤلَّف المستند — فنمط عنوان يُطبَّق في معالج نصوص يصير وسم عنوان عند التصدير؛ والنص المكتوب داخل مربع نص يصير جزءاً غير موسوم. والتصدير الصحيح من المصدر أجدى من أي شيء يُفعل بعد ذلك.
أما ما تستطيعه الأدوات هنا فهو التمهيد والتشخيص:
- التعرّف الضوئي يمنح المسح الضوئي طبقة نص، وهي شرط لازم لكل ما عداها.
- استخراج النص يريك ما تراه الآلة فعلاً، بما في ذلك ترتيب القراءة.
- PDF إلى Word ينقل المستند إلى محرِّر يمكن فيه تطبيق العناوين والنص البديل وبنية الجداول تطبيقاً سليماً ثم إعادة التصدير.
- محرّر البيانات الوصفية يكشف الخصائص على مستوى المستند، ومنها العنوان الذي تعلنه التقنيات المساعدة أولاً.
وثمة عمليتان تزيدان إمكانية الوصول سوءاً فعلياً، وكلتاهما تُجرى أحياناً لأسباب وجيهة: فـتحويل الصفحات إلى صور يدمّر طبقة النص تدميراً كاملاً، والتسطيح يزيل البنية التفاعلية لحقول النماذج. وليست أي منهما خطأً، لكن لا ينبغي إجراء أي منهما على مستند يحتاج أحدهم إلى قراءته بتقنية مساعدة.
وإن كان على المستند التزام قانوني أو تعاقدي بإمكانية الوصول، فالمعياران اللذان يُعمل بهما هما PDF/UA (ISO 14289) وتقنيات PDF المنشورة إلى جانب WCAG، وكلاهما مرتبط أدناه.
الأدوات التي يغطيها هذا المقال
المصادر
التوثيق الأساسي للمعلومات الواردة أعلاه.