Qu’est-ce qui provoque des résultats OCR incohérents entre les pages d’un même PDF numérisé ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

La qualité de l’OCR peut varier au sein d’un même PDF numérisé, car chaque page peut différer par sa résolution, son inclinaison, son contraste, sa compression, sa mise en page, sa langue et sa géométrie.

Une archive familiale peut contenir un seul PDF assemblé à partir de plusieurs sessions de numérisation, de photos prises au téléphone, de photocopies ou d’images importées. Le document semble continu dans une visionneuse, mais le moteur OCR traite les images des pages indépendamment. Une page peut être un scan propre à 300 DPI, tandis que la suivante peut avoir été sous-échantillonnée, tournée, déformée près de la reliure, recouverte d’une texture d’arrière-plan ou contenir déjà une couche de texte endommagée. L’incohérence provient donc souvent d’une variation des entrées entre les pages plutôt que d’un changement du modèle OCR pendant le traitement.

Les pages d’un même PDF peuvent avoir des résolutions effectives différentes

Une page PDF est un conteneur : elle ne garantit pas que chaque image intégrée possède la même densité de pixels. Les pages peuvent être numérisées avec des réglages différents ou redimensionnées lors de la fusion de plusieurs fichiers.

Les recommandations de Tesseract concernant la qualité abordent la résolution et la taille des caractères en pixels comme des paramètres importants pour l’OCR.

Une page basse résolution perd d’abord les petites ponctuations et les contours des caractères, tandis qu’une page haute résolution peut rester précise. La différence dépend des dimensions du raster de la page et de la hauteur des caractères, et non du numéro de page.

La rotation, l’inclinaison et la courbure des pages modifient la segmentation du texte

L’OCR ne reconnaît pas des caractères isolés avant d’identifier les lignes et les régions de texte. Même une légère inclinaison peut provoquer la fusion ou la séparation des lignes, ou leur faire franchir les limites attendues de segmentation.

OCRmyPDF applique les étapes de traitement d’image dans un ordre défini — rotation, suppression de l’arrière-plan, redressement et nettoyage — car la géométrie de la page influence la reconnaissance ultérieure.

Si les erreurs se concentrent près du bord relié, d’une page courbée ou d’un encart tourné, la cause est géométrique. Des substitutions de caractères uniformes sur des pages par ailleurs droites indiquent davantage un problème de langue ou de configuration du modèle.

Un éclairage irrégulier et une texture d’arrière-plan rendent inefficace un seuil global unique

Un scan réalisé à plat peut avoir un arrière-plan blanc presque uniforme, tandis qu’une page photographiée au téléphone peut comporter des ombres, des dégradés, des taches ou de la transparence provenant du verso.

OpenCV distingue le seuillage global du seuillage adaptatif, dans lequel différentes régions locales reçoivent des seuils différents lorsque l’éclairage est irrégulier.

Un seul réglage de prétraitement peut améliorer les pages propres et effacer le texte pâle des pages plus sombres. Cette cause est visible lorsque les erreurs correspondent aux ombres, à la couleur du papier ou aux zones à faible contraste, plutôt qu’à des mots précis.

La déformation et la distorsion de perspective modifient la forme des caractères

Les pages photographiées de biais ou pliées près du dos d’un livre étirent certains caractères et en compressent d’autres. Les lignes de texte droites deviennent des courbes ou des lignes de base convergentes.

PaddleOCR propose un prétraitement des documents pour la classification de l’orientation et le redressement des images.

La perspective et la courbure produisent des erreurs dépendantes de l’emplacement : le centre peut être correctement reconnu tandis que les marges extérieures échouent. Un problème de modèle linguistique affecterait normalement les mêmes symboles quel que soit leur emplacement.

La compression et la dégradation physique suppriment des détails différents selon les pages

Les blocs JPEG, les effets de halo, le flou, les motifs de trame, les générations successives de photocopies et la faible densité d’encre peuvent effacer des traits de caractères ou créer de faux contours.

Les recherches sur l’analyse robuste des documents évaluent des dégradations telles que la numérisation, l’inclinaison, la déformation, la photographie d’écran et l’éclairage.

Ces artefacts peuvent varier parce que les pages provenaient de sources différentes avant leur assemblage. Les paramètres de compression au niveau du fichier ne peuvent pas recréer les détails déjà perdus lors d’un scan ou d’une photocopie antérieurs.

Les changements de mise en page peuvent être pris pour des erreurs de reconnaissance

Une page composée de paragraphes classiques, un tableau, une annexe en deux colonnes, des notes manuscrites et un formulaire nécessitent des hypothèses différentes concernant les régions et l’ordre de lecture.

Tesseract et d’autres moteurs OCR proposent différents modes de segmentation des pages, car la reconnaissance dépend de la façon dont l’entrée est interprétée : bloc, texte épars, colonnes ou autre mise en page.

Si les caractères sont globalement corrects, mais que les colonnes s’entremêlent ou que les cellules d’un tableau apparaissent dans le mauvais ordre, le problème principal vient de l’analyse de la mise en page. Mesurer uniquement la distance d’édition du texte brut peut masquer cette distinction.

Les langues, polices et jeux de caractères mixtes modifient l’espace des candidats

Un rapport peut passer de paragraphes en anglais à des noms accentués, des symboles mathématiques, de l’écriture manuscrite, du texte dactylographié ou une autre langue dans les pages suivantes.

Lorsque la langue de reconnaissance configurée ne contient pas les motifs de caractères concernés, le moteur remplace les glyphes inconnus par des caractères pris en charge visuellement similaires. Les polices décoratives et le texte monospace dégradé peuvent accentuer le même effet.

Cette cause suit les limites entre les écritures et les typographies. Si toutes les pages contenant une langue ou une famille de polices donnée échouent de manière similaire malgré une bonne qualité d’image, le modèle de reconnaissance ou le pack linguistique constitue une explication plus probable que le bruit de numérisation.

La rastérisation du PDF peut fournir des images différentes au moteur OCR

Certaines pages contiennent des images raster intégrées, d’autres du texte vectoriel accompagné d’images, et d’autres encore une couche OCR masquée. Les paramètres de rendu déterminent les pixels reçus par le nouveau passage OCR.

Les recommandations OCR de PyMuPDF expliquent que l’OCR fonctionne sur une image de page et que le rendu de la page et le texte existant influencent le déclenchement et le fonctionnement de l’OCR.

L’article de ZimaSpace sur la recherche documentaire et le RAG définit la limite en aval : un OCR incohérent produit des segments et des citations incohérents, sauf si le pipeline d’ingestion conserve la provenance et le niveau de confiance au niveau de chaque page.

FAQ

Un seul réglage de langue OCR peut-il fonctionner pour un PDF multilingue ?

Oui, lorsque le moteur prend en charge des modèles linguistiques combinés, mais la précision peut tout de même varier si les écritures, les polices et la qualité des pages diffèrent. La détection de la langue et la configuration au niveau de chaque page peuvent être importantes.

300 DPI garantissent-ils un OCR cohérent ?

Non. Cette résolution améliore les détails disponibles, mais l’inclinaison, le flou, le bruit de fond, la compression, la déformation et la mise en page peuvent toujours dominer la qualité de la reconnaissance.

Pourquoi le PDF semble-t-il net alors que l’OCR reste médiocre ?

Une visionneuse peut lisser ou redimensionner l’image de manière agréable. L’OCR dépend des pixels sous-jacents, de l’état de la couche de texte et de la rastérisation utilisée par le pipeline de reconnaissance.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.