تفشل مسارات معالجة التعرف الضوئي على الحروف (OCR) في التقاط علاقات الجداول، لأن التعرف على الأحرف لا يستعيد تلقائيًا الصفوف والأعمدة والعناوين والخلايا الممددة وترتيب القراءة المحيط بها.
قد تحتوي فاتورة مرافق ممسوحة ضوئيًا أو إيصال أو ورقة جرد أو كشف طبي أو جدول أجهزة على كلمات واضحة تمامًا، لكنها تتحول إلى تدفق مسطح من النص بعد تنفيذ OCR. المعلومات المفقودة بنيوية: أي قيمة تنتمي إلى أي عنوان، وأي خلايا تشترك في صف، وما إذا كان عنوان واحد يمتد عبر عدة أعمدة، وكيف تستمر الأقسام المتكررة عبر الصفحة. يحل OCR مشكلة التعرف البصري على النص، بينما يتطلب فهم الجداول أيضًا اكتشاف التخطيط، وتقسيم الخلايا، ومحاذاة الإحداثيات، وإعادة البناء المنطقي.
يحوّل OCR مناطق الصورة إلى نص، وليس إلى مخطط جدول
يحدد التعرف على الأحرف الحروف والأرقام والكلمات من وحدات بكسل الصورة. وقد يحافظ الإخراج النصي العادي على الكلمات، لكنه يتخلص من إحداثياتها الأصلية.
تصف Google النص القابل للقراءة آليًا بأنه النتيجة الأساسية لـ OCR.
يتطلب الجدول عناصر إضافية: الخلايا، ومجموعات الصفوف، ومجموعات الأعمدة، والعناوين، وعمليات الامتداد، والروابط بينها. هذه العلاقات ليست أحرفًا، ولا يمكن استعادتها اعتمادًا على دقة التهجئة وحدها.
تؤدي تسوية مخرجات OCR إلى إزالة الأدلة المكانية
قد تفصل المسافات البيضاء بين قيمتين لأنهما تنتميان إلى عمودين مختلفين، أو لأن إحدى الخليتين فارغة، أو لأن المسح يتضمن مسافات مرئية.
تشير Microsoft Research إلى أن نص OCR الحر يفتقر إلى بنية جدول صريحة، ويتطلب استدلالًا إضافيًا لإعادة بناء الصفوف والأعمدة والعناوين.
بعد التخلص من الإحداثيات، يجب على مسار المعالجة استنتاج البنية من الفواصل والأنماط المتكررة وأنواع القيم والاتساق الدلالي. وقد تدعم التخطيطات الغامضة عدة عمليات إعادة بناء محتملة.
احتفظ بالمربعات المحيطة وأرقام الصفحات ومعرّفات الأسطر وقيم الثقة إلى جانب النص المتعرف عليه كلما كانت هناك حاجة إلى استخراج الجداول لاحقًا.
تعتمد الصفوف والأعمدة على المحاذاة المرئية
تعتمد الجداول التي لا تحتوي على خطوط فاصلة ظاهرة على التباعد والمحاذاة المتسقين. وقد يؤدي الميل أو المنظور أو الضبابية أو المسح غير المتساوي إلى إزاحة الخلايا بما يكفي لإفساد الاستدلالات البسيطة للصفوف والأعمدة.
تستخدم أبحاث التعرف على الجداول نمذجة الإحداثيات لاستعادة بنية الجدول المنطقية والمادية من صور المستندات.
يظل نص OCR الصحيح الموضوع في الصف الخطأ جدولًا خاطئًا. ويجب قياس دقة العلاقات بشكل منفصل عن دقة الأحرف.
تنشئ العناوين والخلايا الممددة علاقات هرمية
قد يغطي عنوان علوي عدة أعمدة فرعية، وقد يصف تصنيف جانبي أيسر عدة صفوف تالية. وقد تعني الخلايا الفارغة استمرارًا، لا بيانات مفقودة.
يُدرَّب Pix2Struct على التحليل الموضوع بصريًا، لأن معنى المستند يعتمد على التخطيط إلى جانب الرموز المتعرف عليها.
غالبًا ما يكرر النص المسطح العنوان مرة واحدة، ثم يسرد قيمًا عديدة دون رابط دائم به. وتتطلب الخلايا المدمجة والعناوين متعددة المستويات تمثيلًا هرميًا للجدول بدلًا من مجرد تقسيمه إلى أسطر.
يمكن لامتدادات الصفوف والأعمدة بأسلوب HTML، أو رسم بياني للخلايا، أو معرّفات صريحة للعناوين الأصلية، الحفاظ على هذه العلاقات بعد الاستخراج.
قد يخلط ترتيب القراءة بين خلايا الجدول ومحتوى الصفحة الآخر
قد تحتوي الصفحة على عنوان وحواشٍ وعمودين وتصنيفات بجانب الجدول ونص متابعة أسفله. وقد يُدخل منطق ترتيب القراءة العام تلك المناطق بين صفوف الجدول.
توضح IBM أن OCR يمثل مرحلة واحدة ضمن استخراج بيانات المستندات، وليس تمثيلًا كاملًا لعلاقات التخطيط.
ينبغي لاكتشاف الجدول عزل منطقة الجدول قبل ترتيب الصفوف، مع إبقاء الحواشي والتعليقات التوضيحية مرتبطة عبر بيانات وصفية منفصلة.
تحتاج الجداول متعددة الصفحات أيضًا إلى منطق للاستمرار حتى لا تُفهرس العناوين المتكررة كصفوف بيانات عادية.
لا تزال نماذج الجداول الشاملة بحاجة إلى التحقق من العلاقات
يمكن للأنظمة الحديثة التنبؤ بمربعات الجداول والصفوف والأعمدة وتجاور الخلايا مباشرة من الصور، لكن التخطيطات المعقدة والمسوح منخفضة الجودة وأنماط المستندات غير المألوفة لا تزال صعبة.
قدّم Table Transformer التعرف على البنية بوصفه مهمة مخصصة تتجاوز OCR العادي.
يعتمد سير عمل البحث في المستندات من ZimaSpace على الحفاظ على الأدلة المهمة قبل التقسيم والفهرسة؛ إذ لا يمكن لجدول مسطح أن ينتج لاحقًا استشهادات موثوقة على مستوى الصف.
تحقق من نص الخلية، وانتمائها إلى الصف، وانتمائها إلى العمود، وارتباطها بالعنوان، وعمليات الامتداد، وترتيب القراءة، وإحداثيات المصدر. ينجح مسار المعالجة فقط عندما يمكن تتبع قيمة مسترجعة إلى علاقة الجدول الصحيحة.
الأسئلة الشائعة
هل يمكن أن تؤدي دقة الأحرف العالية في OCR إلى إنتاج جدول خاطئ؟
نعم. قد يتم التعرف على كل كلمة بشكل صحيح، بينما تُسند القيم إلى الصف أو العمود أو العنوان أو قسم الاستمرار الخطأ.
هل ينبغي تحويل الجداول الممسوحة ضوئيًا مباشرة إلى نص عادي لاستخدامها في RAG؟
فقط عندما تكون البنية غير مهمة. أما في البحث القائم على الحقائق، فاحتفظ بتمثيل منظم للجدول وإحداثيات المصدر إلى جانب أي عرض نصي.
هل تضمن خطوط الشبكة الظاهرة استخراجًا صحيحًا؟
لا. تساعد الخطوط في التقسيم، لكن الخلايا المدمجة والمسوح التالفة والعناوين المتداخلة وأخطاء محاذاة OCR قد تؤدي مع ذلك إلى إنتاج علاقات غير صحيحة.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

ما الميزات التي تتيح إنشاء حدود ثقة للذكاء الاصطناعي المنزلي حول الملفات الحساسة؟
يجمع حدّ الثقة للذكاء الاصطناعي المنزلي بين التشفير أثناء السكون، وصلاحيات الحد الأدنى، والعزل الآمن أثناء التشغيل، والاسترجاع المقيّد النطاق؛ ولا تكفي أي ميزة...

ما الذي يجعل نتائج البحث الخاصة تُفضّل الملفات التي يتم تعديلها بشكل متكرر؟
تحظى الملفات التي تُعدَّل بكثرة بمزايا في الترتيب عندما يضيف كل تحديث إشارات إلى الحداثة أو المقاطع أو الإصدارات أو التفاعل، من دون إجراء...

ما الذي يتسبب في خلط نماذج الحضور في المنازل الذكية بين الضيوف والمقيمين؟
قد يبدو الضيوف كأنهم من المقيمين عندما يرصد النظام أنماط نشاط الأسرة، لكنه يفتقر إلى إشارة هوية مستقرة للشخص الذي يصدر هذه الأنماط.

