OCR verschilt binnen één gescande pdf omdat elke pagina een andere resolutie, scheefstand, contrastwaarde, compressie, indeling, taal en afbeeldingsgeometrie kan hebben.
Een huishoudelijk archief kan één pdf bevatten die uit meerdere scansessies, telefoonfoto’s, fotokopieën of geïmporteerde afbeeldingen is samengesteld. In een viewer lijkt het document doorlopend, maar de OCR-engine verwerkt de pagina-afbeeldingen afzonderlijk. De ene pagina kan een scherpe scan van 300 DPI zijn, terwijl de volgende is verkleind, gedraaid, vervormd bij de bindrand, bedekt met achtergrondstructuur of al een beschadigde tekstlaag bevat. De inconsistentie komt daarom vaak door verschuivingen in de pagina-invoer en niet doordat een OCR-model tijdens de taak verandert.
Pagina’s in één pdf kunnen een verschillende effectieve resolutie hebben
Een pdf-pagina is een container en biedt geen garantie dat elke ingesloten afbeelding dezelfde pixeldichtheid heeft. Pagina’s kunnen met verschillende instellingen zijn gescand of opnieuw zijn geschaald toen meerdere bestanden werden samengevoegd.
De kwaliteitsrichtlijnen van Tesseract bespreken resolutie en pixelgrootte van tekens als belangrijke invoergegevens voor OCR.
Een pagina met lage resolutie verliest als eerste kleine leestekens en randen van tekens, terwijl een pagina met hoge resolutie nauwkeurig kan blijven. Het verschil volgt de rasterafmetingen van de pagina en de tekenhoogte, niet het paginanummer.
Rotatie, scheefstand en paginakrul veranderen de tekstsegmentatie
OCR herkent geen losse tekens voordat regels en tekstgebieden zijn gevonden. Zelfs een geringe scheefstand kan ervoor zorgen dat regels samensmelten, worden opgesplitst of de verwachte segmentatiegrenzen overschrijden.
OCRmyPDF past beeldverwerkingsfasen in een vaste volgorde toe—rotatie, achtergrondverwijdering, rechtzetten en opschonen—omdat de paginageometrie latere herkenning beïnvloedt.
Als fouten zich ophopen bij een bindrand, gebogen pagina of gedraaid invoegvel, is de oorzaak geometrisch. Gelijkmatige vervanging van tekens op verder rechte pagina’s wijst sterker op taal- of modelconfiguratie.
Ongelijkmatige belichting en achtergrondstructuur verstoren één globale drempelwaarde
Een flatbedscan kan een vrijwel gelijkmatige witte achtergrond hebben, terwijl een met een telefoon gemaakte foto schaduwen, verlopen, vlekken of doorschijnende inkt van de achterzijde kan bevatten.
OpenCV maakt onderscheid tussen globale en adaptieve drempelbepaling, waarbij lokale gebieden bij ongelijkmatige belichting verschillende drempelwaarden krijgen.
Eén vaste voorbewerkingsinstelling kan schone pagina’s verbeteren, maar vage tekst op donkerdere pagina’s wegvagen. Deze hoofdoorzaak is zichtbaar wanneer OCR-fouten samenvallen met schaduwen, papierkleur of gebieden met weinig contrast, in plaats van met specifieke woorden.
Vervorming en perspectiefvervorming veranderen de vormen van tekens
Pagina’s die schuin zijn gefotografeerd of bij een boekrug zijn gebogen, rekken sommige tekens uit en drukken andere samen. Rechte tekstregels worden kromme lijnen of krijgen naar elkaar toelopende basislijnen.
PaddleOCR biedt documentvoorbewerking voor oriëntatieclassificatie en het rechtzetten van afbeeldingen.
Perspectief en paginakrul veroorzaken locatieafhankelijke fouten: het midden kan correct worden gelezen, terwijl de buitenste marges mislukken. Een probleem met het taalmodel zou normaal gesproken dezelfde symbolen aantasten, ongeacht hun positie.
Compressie en fysieke beschadiging verwijderen per pagina andere details
JPEG-blokken, ringing, onscherpte, halftoonpatronen, opeenvolgende fotokopieën en een lage inktdichtheid kunnen lijnen van tekens verwijderen of valse randen creëren.
Onderzoek naar robuuste documentanalyse beoordeelt vervormingen zoals scannen, scheefstand, vervorming, schermfotografie en belichting.
Deze artefacten kunnen verschillen omdat de pagina’s vóór het samenvoegen uit verschillende bronnen kwamen. Compressie-instellingen op bestandsniveau kunnen details niet herstellen die bij een eerdere scan of fotokopie al verloren zijn gegaan.
Veranderingen in de lay-out kunnen worden aangezien voor herkenningsfouten
Een pagina met normale alinea’s, een tabel, een bijlage met twee kolommen, handgeschreven notities en een formulier vereisen verschillende aannames over gebieden en leesvolgorde.
Tesseract en andere OCR-engines bieden modi voor paginasegmentatie omdat herkenning ervan afhangt of de invoer wordt behandeld als een blok, verspreide tekst, kolommen of een andere lay-out.
Als de tekens grotendeels correct zijn, maar kolommen door elkaar lopen of tabelcellen in de verkeerde volgorde verschijnen, ligt de belangrijkste fout bij de lay-outanalyse. Alleen de bewerkingsafstand van platte tekst meten kan dat onderscheid verbergen.
Gemengde talen, lettertypen en tekensets veranderen de kandidatenruimte
Een rapport kan overschakelen van Engelse alinea’s naar namen met accenten, wiskundige symbolen, handschrift, typemachinetekst of een andere taal op latere pagina’s.
Wanneer de geconfigureerde herkenningstaal de relevante tekenpatronen niet bevat, vervangt de engine onbekende glyphs door visueel vergelijkbare ondersteunde tekens. Decoratieve lettertypen en slecht leesbare monospacede tekst kunnen hetzelfde effect versterken.
Deze oorzaak volgt grenzen in schrift en typografie. Als alle pagina’s met één taal of lettertypefamilie op vergelijkbare wijze mislukken ondanks een goede beeldkwaliteit, is het herkenningsmodel of taalpakket een waarschijnlijkere verklaring dan scanningsruis.
Rasterisatie van pdf’s kan verschillende afbeeldingen aan de OCR-engine leveren
Sommige pagina’s bevatten ingesloten rasterafbeeldingen, andere vectoriële tekst plus afbeeldingen, en weer andere bevatten al een verborgen OCR-laag. Renderinstellingen bepalen welke pixels de nieuwe OCR-bewerking ontvangt.
De OCR-richtlijnen van PyMuPDF leggen uit dat OCR op een pagina-afbeelding werkt en dat pagin rendering en bestaande tekst bepalen of en hoe OCR wordt uitgevoerd.
Het artikel van ZimaSpace over documentzoeken en RAG beschrijft de grens in de vervolgstap: inconsistente OCR leidt tot inconsistente fragmenten en citaten, tenzij de ingestiepijplijn herkomst en betrouwbaarheid per pagina bewaart.
Veelgestelde vragen
Kan één OCR-taalinstelling werken voor een meertalige pdf?
Dat kan wanneer de engine gecombineerde taalmodellen ondersteunt, maar de nauwkeurigheid kan nog steeds variëren wanneer schrift, lettertypen en paginakwaliteit verschillen. Taalherkenning en configuratie per pagina kunnen belangrijk zijn.
Garandeert 300 DPI consistente OCR?
Nee. Het vergroot de beschikbare details, maar scheefstand, onscherpte, achtergrondruis, compressie, vervorming en lay-out kunnen de herkenningskwaliteit nog steeds overheersen.
Waarom ziet de pdf er scherp uit terwijl de OCR slecht blijft?
Een viewer kan de afbeelding aantrekkelijk gladstrijken of schalen. OCR is afhankelijk van de onderliggende pixels, de status van de tekstlaag en de rasterisatie die door de herkenningspijplijn wordt gebruikt.
Tech & AI HUB
Meer om te lezen

Waardoor ontstaan WebSocket-herverbindingslussen in een externe AI-interface voor thuis?
Diagnoseer WebSocket-lussen in de lagen voor handshakes, proxy's, authenticatie, heartbeats, netwerkpaden, sessieherstel en client-back-off.

Waardoor komen back-upcontrolesommen niet overeen na een onderbroken overdracht?
Traceer checksumverschillen door bronsnapshots, chunkmanifests, hervattingsoffsets, gedeeltelijke bestanden, transformaties, opslagbewerkingen en de uiteindelijke verificatie.

Wat veroorzaakt dubbele huishoudentiteiten in een privékennisgrafiek?
Diagnoseer dubbele knooppunten in de kennisgrafiek door extractievarianten, identiteitssleutels, resolutiedrempels, bronherkomst en gelijktijdige samenvoegingen van elkaar te scheiden.

