Pourquoi les pipelines OCR ne parviennent-ils pas à détecter les relations entre les tableaux dans les documents personnels numérisés ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Les pipelines OCR omettent les relations entre les tableaux, car reconnaître les caractères ne permet pas automatiquement de reconstituer les lignes, les colonnes, les en-têtes, les cellules fusionnées et l’ordre de lecture qui les entourent.

Une facture de services publics, un reçu, une feuille d’inventaire, un relevé médical ou un planning d’appareils numérisé peut contenir des mots parfaitement lisibles tout en produire un flux de texte linéaire après OCR. L’information manquante est structurelle : quelle valeur correspond à quel en-tête, quelles cellules appartiennent à la même ligne, si une étiquette s’étend sur plusieurs colonnes et comment les sections répétées se poursuivent sur la page. L’OCR résout la reconnaissance visuelle du texte, tandis que la compréhension des tableaux nécessite également la détection de la mise en page, la segmentation des cellules, l’alignement des coordonnées et la reconstruction logique.

L’OCR convertit les zones d’image en texte, pas en schéma de tableau

La reconnaissance des caractères identifie les lettres, les chiffres et les mots à partir des pixels de l’image. Une sortie en texte brut peut conserver les mots tout en supprimant leurs coordonnées d’origine.

Google décrit le texte lisible par machine comme le résultat principal de l’OCR.

Un tableau nécessite des objets supplémentaires : cellules, groupes de lignes, groupes de colonnes, en-têtes, cellules fusionnées et liens entre ces éléments. Ces relations ne sont pas des caractères et ne peuvent pas être reconstituées à partir de la seule précision orthographique.

La linéarisation de la sortie OCR supprime les indices spatiaux

Deux valeurs peuvent être séparées par des espaces parce qu’elles appartiennent à des colonnes différentes, parce qu’une cellule est vide ou parce que la numérisation contient un espacement visuel.

Microsoft Research indique que le texte OCR libre ne contient pas de structure explicite de tableau et nécessite des inférences supplémentaires pour reconstruire les lignes, les colonnes et les en-têtes.

Une fois les coordonnées supprimées, le pipeline doit déduire la structure à partir des délimiteurs, des motifs répétitifs, des types de valeurs et de la cohérence sémantique. Les mises en page ambiguës peuvent permettre plusieurs reconstructions plausibles.

Conservez les cadres englobants, les numéros de page, les identifiants de ligne et les niveaux de confiance avec le texte reconnu chaque fois qu’une extraction ultérieure de tableaux est nécessaire.

Les lignes et les colonnes dépendent de l’alignement visuel

Les tableaux dépourvus de lignes de séparation visibles reposent sur un espacement et un alignement cohérents. Une inclinaison, une perspective, un flou ou une numérisation irrégulière peuvent décaler suffisamment les cellules pour perturber les heuristiques simples de détection des lignes et des colonnes.

Les recherches sur la reconnaissance des tableaux utilisent la modélisation des coordonnées afin de reconstituer la structure logique et physique des tableaux dans les images de documents.

Une chaîne OCR correcte placée sur la mauvaise ligne reste un tableau erroné. La précision des relations doit être mesurée séparément de la précision des caractères.

-15% OFF

Les en-têtes et les cellules fusionnées créent des relations hiérarchiques

Un en-tête supérieur peut couvrir plusieurs sous-colonnes, tandis qu’une étiquette située à gauche peut décrire plusieurs lignes suivantes. Les cellules vides peuvent signifier une continuation plutôt qu’une donnée manquante.

Pix2Struct est entraîné sur une analyse visuellement située, car le sens d’un document dépend autant de sa mise en page que des jetons reconnus.

Le texte linéaire répète souvent un en-tête une seule fois, puis énumère de nombreuses valeurs sans lien durable avec celui-ci. Les cellules fusionnées et les en-têtes à plusieurs niveaux nécessitent une représentation hiérarchique du tableau plutôt qu’une simple séparation par lignes.

Les attributs HTML d’extension des lignes et des colonnes, un graphe de cellules ou des identifiants explicites d’en-têtes parents peuvent préserver ces relations après l’extraction.

L’ordre de lecture peut entrelacer les cellules du tableau avec d’autres éléments de la page

Une page peut contenir un titre, des notes de bas de page, deux colonnes, des étiquettes à côté du tableau et un texte de continuation en dessous. Une logique générique d’ordre de lecture peut insérer ces régions entre les lignes du tableau.

IBM explique que l’OCR constitue une étape de l’extraction des données des documents, et non une représentation complète des relations de mise en page.

La détection du tableau doit isoler sa région avant de classer les lignes, tandis que les notes de bas de page et les légendes doivent rester liées au moyen de métadonnées distinctes.

Les tableaux multipages nécessitent également une logique de continuation afin que les en-têtes répétés ne soient pas indexés comme des lignes de données ordinaires.

Les modèles de tableaux de bout en bout nécessitent toujours une validation des relations

Les systèmes modernes peuvent prédire directement à partir des images les cadres des tableaux, les lignes, les colonnes et l’adjacence des cellules, mais les mises en page complexes, les numérisations de mauvaise qualité et les styles de documents inconnus restent difficiles à traiter.

Table Transformer a introduit la reconnaissance de la structure comme une tâche dédiée allant au-delà de l’OCR ordinaire.

Le workflow de recherche documentaire de ZimaSpace dépend de la préservation d’éléments probants pertinents avant le découpage et l’indexation ; un tableau linéarisé ne peut pas ensuite produire de citations fiables au niveau des lignes.

Validez le texte des cellules, leur appartenance aux lignes et aux colonnes, leur association aux en-têtes, les cellules fusionnées, l’ordre de lecture et les coordonnées sources. Le pipeline n’est fiable que lorsqu’une valeur récupérée peut être rattachée à la bonne relation dans le tableau.

FAQ

Une grande précision des caractères OCR peut-elle malgré tout produire un tableau erroné ?

Oui. Chaque mot peut être reconnu correctement alors que les valeurs sont attribuées à la mauvaise ligne, à la mauvaise colonne, au mauvais en-tête ou à la mauvaise section de continuation.

Faut-il convertir directement les tableaux numérisés en texte brut pour le RAG ?

Uniquement lorsque la structure n’a aucune importance. Pour la recherche factuelle, conservez une représentation structurée du tableau et les coordonnées sources en plus de tout rendu textuel.

Des lignes de grille visibles garantissent-elles une extraction correcte ?

Non. Les lignes facilitent la segmentation, mais les cellules fusionnées, les numérisations dégradées, les en-têtes imbriqués et les erreurs d’alignement OCR peuvent toujours produire des relations incorrectes.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.