تختلف نتائج التعرّف الضوئي على الحروف (OCR) داخل ملف PDF واحد ممسوح ضوئيًا لأن كل صفحة قد تختلف في الدقة، والميلان، والتباين، والضغط، والتخطيط، واللغة، وهندسة الصورة.
قد يحتوي أرشيف منزلي على ملف PDF واحد جُمِع من عدة جلسات مسح ضوئي، أو لقطات بهاتف، أو نسخ مصوّرة، أو صور مستوردة. يبدو المستند متصلًا في العارض، لكن محرك OCR يعالج صور الصفحات بشكل مستقل. قد تكون إحدى الصفحات مسحًا نظيفًا بدقة 300 نقطة لكل بوصة، بينما تكون الصفحة التالية منخفضة الدقة، أو مدوّرة، أو مشوّهة قرب التجليد، أو مغطاة بنسيج خلفية، أو تحتوي أصلًا على طبقة نصية تالفة. لذلك غالبًا ما يكون سبب عدم الاتساق هو اختلاف مدخلات الصفحات، وليس تغيّر نموذج OCR أثناء المهمة.
قد تختلف الدقة الفعلية للصفحات داخل ملف PDF واحد
صفحة PDF عبارة عن حاوية، وليست ضمانًا بأن كل صورة مضمنة فيها تتمتع بالكثافة نفسها من وحدات البكسل. قد تُمسح الصفحات بإعدادات مختلفة أو يُعاد تحجيمها عند دمج عدة ملفات.
تتناول إرشادات الجودة الخاصة بـ Tesseract الدقة وحجم بكسلات الأحرف باعتبارهما من مدخلات OCR المهمة.
تفقد الصفحة منخفضة الدقة علامات الترقيم الصغيرة وحواف الأحرف أولًا، بينما قد تظل الصفحة عالية الدقة دقيقة. ويتبع هذا الفرق أبعاد الصورة النقطية للصفحة وارتفاع الأحرف، وليس رقم الصفحة.
يؤثر الدوران والميلان وتقوّس الصفحة في تقسيم النص
لا يتعرّف OCR على الأحرف المعزولة قبل العثور على الأسطر ومناطق النص. حتى الميلان الطفيف قد يجعل الأسطر تندمج أو تنقسم أو تتجاوز حدود التقسيم المتوقعة.
يطبّق OCRmyPDF مراحل معالجة الصور بترتيب محدد—الدوران وإزالة الخلفية وتصحيح الميلان والتنظيف—لأن هندسة الصفحة تؤثر في التعرّف اللاحق.
إذا تركزت الأخطاء قرب حافة التجليد أو الصفحة المنحنية أو الملحق المدوّر، فسببها هندسي. أما الاستبدالات الموحدة للأحرف في الصفحات المستقيمة غالبًا فتشير بدرجة أكبر إلى إعدادات اللغة أو النموذج.
تُربك الإضاءة غير المتساوية ونسيج الخلفية أي عتبة عامة واحدة
قد يمتلك المسح الضوئي المسطح خلفية بيضاء شبه موحدة، بينما يمكن أن تحتوي الصفحة الملتقطة بالهاتف على ظلال أو تدرجات أو بقع أو أثر النص الموجود على الوجه الخلفي.
يميّز OpenCV بين التحويل إلى أبيض وأسود العام والتحويل التكيفي إلى أبيض وأسود، حيث تتلقى المناطق المحلية عتبات مختلفة عند وجود إضاءة غير متساوية.
قد يحسّن إعداد واحد للمعالجة المسبقة الصفحات النظيفة، لكنه يمحو النص الباهت في الصفحات الداكنة. يظهر هذا السبب عندما تتوافق أخطاء OCR مع الظلال أو لون الورق أو المناطق منخفضة التباين، لا مع كلمات محددة.
يغيّر التشوّه والمنظور أشكال الأحرف
تمدد الصفحات المصوّرة بزاوية أو المثنية قرب كعب الكتاب بعض الأحرف وتضغط بعضها الآخر. وتتحول أسطر النص المستقيمة إلى منحنيات أو خطوط أساس متقاربة.
يوفّر PaddleOCR معالجة مسبقة للمستندات من أجل تصنيف الاتجاه وإزالة التشوّه من الصور.
ينتج عن المنظور وتقوّس الصفحة أخطاء تعتمد على الموقع: فقد يتعرّف OCR على النص في الوسط بشكل صحيح، بينما تفشل الهوامش الخارجية. أما مشكلة نموذج اللغة فعادةً فستؤثر في الرموز نفسها أينما ظهرت.
يزيل الضغط والتدهور المادي تفاصيل مختلفة من كل صفحة
قد تمحو كتل JPEG والتشوهات الحلقية والضبابية والأنماط النصفية وأجيال النسخ المصوّرة وانخفاض كثافة الحبر ضربات الأحرف أو تنشئ حواف زائفة.
تقيّم الأبحاث المتعلقة بتحليل المستندات المتين تشوهات تشمل المسح الضوئي والميلان والتشوّه والتصوير من الشاشة والإضاءة.
قد تختلف هذه العيوب لأن الصفحات جاءت من مصادر مختلفة قبل دمجها. ولا تستطيع إعدادات الضغط على مستوى الملف استعادة التفاصيل التي فُقدت أصلًا في مسح ضوئي أو نسخة مصوّرة سابقة.
قد يُساء تفسير تغيّر التخطيط على أنه فشل في التعرّف
تتطلب صفحة الفقرات العادية، والجدول، والملحق ذي العمودين، والملاحظات المكتوبة بخط اليد، والنموذج افتراضات مختلفة بشأن المناطق وترتيب القراءة.
يعرض Tesseract ومحركات OCR الأخرى أوضاعًا لتقسيم الصفحة، لأن التعرّف يعتمد على ما إذا كان الإدخال سيُعامل ككتلة أو نص متناثر أو أعمدة أو تخطيط آخر.
إذا كانت الأحرف صحيحة في معظمها، لكن الأعمدة تتداخل أو تظهر خلايا الجدول بترتيب خاطئ، فإن الفشل الأساسي يكمن في تحليل التخطيط. وقد يخفي قياس مسافة التحرير للنص العادي فقط هذا التمييز.
تغيّر اللغات والخطوط ومجموعات الأحرف مساحة المرشحين
قد ينتقل التقرير من فقرات باللغة الإنجليزية إلى أسماء تحتوي على علامات تشكيل، أو رموز رياضية، أو كتابة يدوية، أو نص بلغة أخرى في الصفحات اللاحقة.
عندما تفتقر لغة التعرّف المُعدّة إلى أنماط الأحرف ذات الصلة، يستبدل المحرك الرموز غير المألوفة بأحرف مدعومة تشبهها بصريًا. وقد تضخّم الخطوط الزخرفية والنصوص المتدهورة أحادية المسافة التأثير نفسه.
يتبع هذا السبب حدود النصوص والخطوط. فإذا فشلت جميع الصفحات التي تحتوي على لغة أو عائلة خطوط واحدة بالطريقة نفسها رغم جودة الصور، فسيكون نموذج التعرّف أو حزمة اللغة تفسيرًا أقوى من ضوضاء المسح الضوئي.
قد يمرر تحويل PDF إلى صورة صورًا مختلفة إلى محرك OCR
تحتوي بعض الصفحات على صور نقطية مضمنة، بينما تحتوي صفحات أخرى على نص متجهي مع صور، وقد تتضمن صفحات أخرى طبقة OCR مخفية أصلًا. وتحدد إعدادات العرض وحدات البكسل التي تتلقاها عملية OCR الجديدة.
توضح إرشادات OCR في PyMuPDF أن OCR يعمل على صورة صفحة، وأن عرض الصفحة والنص الموجود مسبقًا يؤثران في إجراء OCR وكيفيته.
تقدم مقالة ZimaSpace حول البحث في المستندات وRAG الحد الفاصل في المرحلة اللاحقة: إذ يتحول OCR غير المتسق إلى مقاطع واستشهادات غير متسقة ما لم يحافظ مسار إدخال البيانات على مصدر كل صفحة ومستوى الثقة.
الأسئلة الشائعة
هل يمكن لإعداد لغة OCR واحد أن يعمل مع ملف PDF متعدد اللغات؟
يمكن ذلك عندما يدعم المحرك نماذج لغات مدمجة، لكن الدقة قد تظل متفاوتة عند اختلاف النصوص والخطوط وجودة الصفحات. وقد يكون لاكتشاف اللغة والإعداد على مستوى الصفحة دور مهم.
هل تضمن دقة 300 نقطة لكل بوصة اتساق OCR؟
لا. فهي تحسّن التفاصيل المتاحة، لكن الميلان والضبابية وضوضاء الخلفية والضغط والتشوّه والتخطيط قد تظل العوامل المهيمنة على جودة التعرّف.
لماذا يبدو ملف PDF واضحًا بينما يظل OCR ضعيفًا؟
قد ينعّم العارض الصورة أو يغيّر حجمها بطريقة جذابة. يعتمد OCR على وحدات البكسل الأساسية، وحالة طبقة النص، وتحويل الصورة إلى صورة نقطية الذي يستخدمه مسار التعرّف.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

ما الذي يسبب حلقات إعادة اتصال WebSocket في واجهة ذكاء اصطناعي منزلية عن بُعد؟
شخّص حلقات WebSocket عبر طبقات المصافحة والوكيل والمصادقة ونبضات الإبقاء على الاتصال ومسار الشبكة واستعادة الجلسة والتراجع لدى العميل.

ما الذي يسبب عدم تطابق المجموع الاختباري للنسخة الاحتياطية بعد انقطاع عملية النقل؟
تتبّع حالات عدم تطابق المجموع الاختباري عبر لقطات المصدر وبيانات تعريف الأجزاء وإزاحات الاستئناف والملفات الجزئية والتحويلات وعمليات الكتابة إلى وحدة التخزين والتحقق النهائي.

ما الذي يسبب الكيانات المنزلية المكررة في رسم بياني خاص للمعرفة؟
شخّص العُقَد المكرّرة في رسم المعرفة من خلال فصل متغيّرات الاستخراج، ومفاتيح الهوية، وعتبات المطابقة، ونَسَب المصادر، وعمليات الدمج المتزامنة.

