لماذا تفشل مسارات عمل التعرّف الضوئي على الحروف في رصد العلاقات بين الجداول في المستندات المنزلية الممسوحة ضوئيًا؟

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

تفشل مسارات معالجة التعرف الضوئي على الحروف (OCR) في التقاط علاقات الجداول، لأن التعرف على الأحرف لا يستعيد تلقائيًا الصفوف والأعمدة والعناوين والخلايا الممددة وترتيب القراءة المحيط بها.

قد تحتوي فاتورة مرافق ممسوحة ضوئيًا أو إيصال أو ورقة جرد أو كشف طبي أو جدول أجهزة على كلمات واضحة تمامًا، لكنها تتحول إلى تدفق مسطح من النص بعد تنفيذ OCR. المعلومات المفقودة بنيوية: أي قيمة تنتمي إلى أي عنوان، وأي خلايا تشترك في صف، وما إذا كان عنوان واحد يمتد عبر عدة أعمدة، وكيف تستمر الأقسام المتكررة عبر الصفحة. يحل OCR مشكلة التعرف البصري على النص، بينما يتطلب فهم الجداول أيضًا اكتشاف التخطيط، وتقسيم الخلايا، ومحاذاة الإحداثيات، وإعادة البناء المنطقي.

يحوّل OCR مناطق الصورة إلى نص، وليس إلى مخطط جدول

يحدد التعرف على الأحرف الحروف والأرقام والكلمات من وحدات بكسل الصورة. وقد يحافظ الإخراج النصي العادي على الكلمات، لكنه يتخلص من إحداثياتها الأصلية.

تصف Google النص القابل للقراءة آليًا بأنه النتيجة الأساسية لـ OCR.

يتطلب الجدول عناصر إضافية: الخلايا، ومجموعات الصفوف، ومجموعات الأعمدة، والعناوين، وعمليات الامتداد، والروابط بينها. هذه العلاقات ليست أحرفًا، ولا يمكن استعادتها اعتمادًا على دقة التهجئة وحدها.

تؤدي تسوية مخرجات OCR إلى إزالة الأدلة المكانية

قد تفصل المسافات البيضاء بين قيمتين لأنهما تنتميان إلى عمودين مختلفين، أو لأن إحدى الخليتين فارغة، أو لأن المسح يتضمن مسافات مرئية.

تشير Microsoft Research إلى أن نص OCR الحر يفتقر إلى بنية جدول صريحة، ويتطلب استدلالًا إضافيًا لإعادة بناء الصفوف والأعمدة والعناوين.

بعد التخلص من الإحداثيات، يجب على مسار المعالجة استنتاج البنية من الفواصل والأنماط المتكررة وأنواع القيم والاتساق الدلالي. وقد تدعم التخطيطات الغامضة عدة عمليات إعادة بناء محتملة.

احتفظ بالمربعات المحيطة وأرقام الصفحات ومعرّفات الأسطر وقيم الثقة إلى جانب النص المتعرف عليه كلما كانت هناك حاجة إلى استخراج الجداول لاحقًا.

تعتمد الصفوف والأعمدة على المحاذاة المرئية

تعتمد الجداول التي لا تحتوي على خطوط فاصلة ظاهرة على التباعد والمحاذاة المتسقين. وقد يؤدي الميل أو المنظور أو الضبابية أو المسح غير المتساوي إلى إزاحة الخلايا بما يكفي لإفساد الاستدلالات البسيطة للصفوف والأعمدة.

تستخدم أبحاث التعرف على الجداول نمذجة الإحداثيات لاستعادة بنية الجدول المنطقية والمادية من صور المستندات.

يظل نص OCR الصحيح الموضوع في الصف الخطأ جدولًا خاطئًا. ويجب قياس دقة العلاقات بشكل منفصل عن دقة الأحرف.

-15% OFF

تنشئ العناوين والخلايا الممددة علاقات هرمية

قد يغطي عنوان علوي عدة أعمدة فرعية، وقد يصف تصنيف جانبي أيسر عدة صفوف تالية. وقد تعني الخلايا الفارغة استمرارًا، لا بيانات مفقودة.

يُدرَّب Pix2Struct على التحليل الموضوع بصريًا، لأن معنى المستند يعتمد على التخطيط إلى جانب الرموز المتعرف عليها.

غالبًا ما يكرر النص المسطح العنوان مرة واحدة، ثم يسرد قيمًا عديدة دون رابط دائم به. وتتطلب الخلايا المدمجة والعناوين متعددة المستويات تمثيلًا هرميًا للجدول بدلًا من مجرد تقسيمه إلى أسطر.

يمكن لامتدادات الصفوف والأعمدة بأسلوب HTML، أو رسم بياني للخلايا، أو معرّفات صريحة للعناوين الأصلية، الحفاظ على هذه العلاقات بعد الاستخراج.

قد يخلط ترتيب القراءة بين خلايا الجدول ومحتوى الصفحة الآخر

قد تحتوي الصفحة على عنوان وحواشٍ وعمودين وتصنيفات بجانب الجدول ونص متابعة أسفله. وقد يُدخل منطق ترتيب القراءة العام تلك المناطق بين صفوف الجدول.

توضح IBM أن OCR يمثل مرحلة واحدة ضمن استخراج بيانات المستندات، وليس تمثيلًا كاملًا لعلاقات التخطيط.

ينبغي لاكتشاف الجدول عزل منطقة الجدول قبل ترتيب الصفوف، مع إبقاء الحواشي والتعليقات التوضيحية مرتبطة عبر بيانات وصفية منفصلة.

تحتاج الجداول متعددة الصفحات أيضًا إلى منطق للاستمرار حتى لا تُفهرس العناوين المتكررة كصفوف بيانات عادية.

لا تزال نماذج الجداول الشاملة بحاجة إلى التحقق من العلاقات

يمكن للأنظمة الحديثة التنبؤ بمربعات الجداول والصفوف والأعمدة وتجاور الخلايا مباشرة من الصور، لكن التخطيطات المعقدة والمسوح منخفضة الجودة وأنماط المستندات غير المألوفة لا تزال صعبة.

قدّم Table Transformer التعرف على البنية بوصفه مهمة مخصصة تتجاوز OCR العادي.

يعتمد سير عمل البحث في المستندات من ZimaSpace على الحفاظ على الأدلة المهمة قبل التقسيم والفهرسة؛ إذ لا يمكن لجدول مسطح أن ينتج لاحقًا استشهادات موثوقة على مستوى الصف.

تحقق من نص الخلية، وانتمائها إلى الصف، وانتمائها إلى العمود، وارتباطها بالعنوان، وعمليات الامتداد، وترتيب القراءة، وإحداثيات المصدر. ينجح مسار المعالجة فقط عندما يمكن تتبع قيمة مسترجعة إلى علاقة الجدول الصحيحة.

الأسئلة الشائعة

هل يمكن أن تؤدي دقة الأحرف العالية في OCR إلى إنتاج جدول خاطئ؟

نعم. قد يتم التعرف على كل كلمة بشكل صحيح، بينما تُسند القيم إلى الصف أو العمود أو العنوان أو قسم الاستمرار الخطأ.

هل ينبغي تحويل الجداول الممسوحة ضوئيًا مباشرة إلى نص عادي لاستخدامها في RAG؟

فقط عندما تكون البنية غير مهمة. أما في البحث القائم على الحقائق، فاحتفظ بتمثيل منظم للجدول وإحداثيات المصدر إلى جانب أي عرض نصي.

هل تضمن خطوط الشبكة الظاهرة استخراجًا صحيحًا؟

لا. تساعد الخطوط في التقسيم، لكن الخلايا المدمجة والمسوح التالفة والعناوين المتداخلة وأخطاء محاذاة OCR قد تؤدي مع ذلك إلى إنتاج علاقات غير صحيحة.

مركز التكنولوجيا والذكاء الاصطناعي

المزيد للقراءة

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.