Les pipelines OCR omettent les relations entre les tableaux, car reconnaître les caractères ne permet pas automatiquement de reconstituer les lignes, les colonnes, les en-têtes, les cellules fusionnées et l’ordre de lecture qui les entourent.
Une facture de services publics, un reçu, une feuille d’inventaire, un relevé médical ou un planning d’appareils numérisé peut contenir des mots parfaitement lisibles tout en produire un flux de texte linéaire après OCR. L’information manquante est structurelle : quelle valeur correspond à quel en-tête, quelles cellules appartiennent à la même ligne, si une étiquette s’étend sur plusieurs colonnes et comment les sections répétées se poursuivent sur la page. L’OCR résout la reconnaissance visuelle du texte, tandis que la compréhension des tableaux nécessite également la détection de la mise en page, la segmentation des cellules, l’alignement des coordonnées et la reconstruction logique.
L’OCR convertit les zones d’image en texte, pas en schéma de tableau
La reconnaissance des caractères identifie les lettres, les chiffres et les mots à partir des pixels de l’image. Une sortie en texte brut peut conserver les mots tout en supprimant leurs coordonnées d’origine.
Google décrit le texte lisible par machine comme le résultat principal de l’OCR.
Un tableau nécessite des objets supplémentaires : cellules, groupes de lignes, groupes de colonnes, en-têtes, cellules fusionnées et liens entre ces éléments. Ces relations ne sont pas des caractères et ne peuvent pas être reconstituées à partir de la seule précision orthographique.
La linéarisation de la sortie OCR supprime les indices spatiaux
Deux valeurs peuvent être séparées par des espaces parce qu’elles appartiennent à des colonnes différentes, parce qu’une cellule est vide ou parce que la numérisation contient un espacement visuel.
Microsoft Research indique que le texte OCR libre ne contient pas de structure explicite de tableau et nécessite des inférences supplémentaires pour reconstruire les lignes, les colonnes et les en-têtes.
Une fois les coordonnées supprimées, le pipeline doit déduire la structure à partir des délimiteurs, des motifs répétitifs, des types de valeurs et de la cohérence sémantique. Les mises en page ambiguës peuvent permettre plusieurs reconstructions plausibles.
Conservez les cadres englobants, les numéros de page, les identifiants de ligne et les niveaux de confiance avec le texte reconnu chaque fois qu’une extraction ultérieure de tableaux est nécessaire.
Les lignes et les colonnes dépendent de l’alignement visuel
Les tableaux dépourvus de lignes de séparation visibles reposent sur un espacement et un alignement cohérents. Une inclinaison, une perspective, un flou ou une numérisation irrégulière peuvent décaler suffisamment les cellules pour perturber les heuristiques simples de détection des lignes et des colonnes.
Les recherches sur la reconnaissance des tableaux utilisent la modélisation des coordonnées afin de reconstituer la structure logique et physique des tableaux dans les images de documents.
Une chaîne OCR correcte placée sur la mauvaise ligne reste un tableau erroné. La précision des relations doit être mesurée séparément de la précision des caractères.
Les en-têtes et les cellules fusionnées créent des relations hiérarchiques
Un en-tête supérieur peut couvrir plusieurs sous-colonnes, tandis qu’une étiquette située à gauche peut décrire plusieurs lignes suivantes. Les cellules vides peuvent signifier une continuation plutôt qu’une donnée manquante.
Pix2Struct est entraîné sur une analyse visuellement située, car le sens d’un document dépend autant de sa mise en page que des jetons reconnus.
Le texte linéaire répète souvent un en-tête une seule fois, puis énumère de nombreuses valeurs sans lien durable avec celui-ci. Les cellules fusionnées et les en-têtes à plusieurs niveaux nécessitent une représentation hiérarchique du tableau plutôt qu’une simple séparation par lignes.
Les attributs HTML d’extension des lignes et des colonnes, un graphe de cellules ou des identifiants explicites d’en-têtes parents peuvent préserver ces relations après l’extraction.
L’ordre de lecture peut entrelacer les cellules du tableau avec d’autres éléments de la page
Une page peut contenir un titre, des notes de bas de page, deux colonnes, des étiquettes à côté du tableau et un texte de continuation en dessous. Une logique générique d’ordre de lecture peut insérer ces régions entre les lignes du tableau.
IBM explique que l’OCR constitue une étape de l’extraction des données des documents, et non une représentation complète des relations de mise en page.
La détection du tableau doit isoler sa région avant de classer les lignes, tandis que les notes de bas de page et les légendes doivent rester liées au moyen de métadonnées distinctes.
Les tableaux multipages nécessitent également une logique de continuation afin que les en-têtes répétés ne soient pas indexés comme des lignes de données ordinaires.
Les modèles de tableaux de bout en bout nécessitent toujours une validation des relations
Les systèmes modernes peuvent prédire directement à partir des images les cadres des tableaux, les lignes, les colonnes et l’adjacence des cellules, mais les mises en page complexes, les numérisations de mauvaise qualité et les styles de documents inconnus restent difficiles à traiter.
Table Transformer a introduit la reconnaissance de la structure comme une tâche dédiée allant au-delà de l’OCR ordinaire.
Le workflow de recherche documentaire de ZimaSpace dépend de la préservation d’éléments probants pertinents avant le découpage et l’indexation ; un tableau linéarisé ne peut pas ensuite produire de citations fiables au niveau des lignes.
Validez le texte des cellules, leur appartenance aux lignes et aux colonnes, leur association aux en-têtes, les cellules fusionnées, l’ordre de lecture et les coordonnées sources. Le pipeline n’est fiable que lorsqu’une valeur récupérée peut être rattachée à la bonne relation dans le tableau.
FAQ
Une grande précision des caractères OCR peut-elle malgré tout produire un tableau erroné ?
Oui. Chaque mot peut être reconnu correctement alors que les valeurs sont attribuées à la mauvaise ligne, à la mauvaise colonne, au mauvais en-tête ou à la mauvaise section de continuation.
Faut-il convertir directement les tableaux numérisés en texte brut pour le RAG ?
Uniquement lorsque la structure n’a aucune importance. Pour la recherche factuelle, conservez une représentation structurée du tableau et les coordonnées sources en plus de tout rendu textuel.
Des lignes de grille visibles garantissent-elles une extraction correcte ?
Non. Les lignes facilitent la segmentation, mais les cellules fusionnées, les numérisations dégradées, les en-têtes imbriqués et les erreurs d’alignement OCR peuvent toujours produire des relations incorrectes.
Centre Tech & IA
Plus à lire

Quelles fonctionnalités permettent de créer une frontière de confiance pour l’IA domestique autour des fichiers sensibles ?
Une frontière de confiance pour l’IA à domicile combine le chiffrement des données au repos, des autorisations selon le principe du moindre privilège, un...

Pourquoi les résultats de recherche privés privilégient-ils les fichiers fréquemment modifiés ?
Les fichiers fréquemment modifiés bénéficient d’un meilleur classement lorsque chaque mise à jour ajoute des signaux de fraîcheur, des segments, des versions ou des...

Qu’est-ce qui pousse les modèles de détection de présence pour maison intelligente à confondre les invités avec les résidents ?
Les invités peuvent être pris pour des résidents lorsque le système observe des habitudes d’activité du foyer, mais ne dispose d’aucun signal d’identité stable...

