Was verursacht inkonsistente OCR-Ergebnisse auf den Seiten desselben gescannten PDFs?

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Die OCR-Ergebnisse können innerhalb eines gescannten PDFs variieren, weil sich Auflösung, Schräglage, Kontrast, Komprimierung, Layout, Sprache und Bildgeometrie von Seite zu Seite unterscheiden können.

Ein privates Archiv kann ein einzelnes PDF enthalten, das aus mehreren Scans, Handyaufnahmen, Fotokopien oder importierten Bildern zusammengesetzt wurde. Im Viewer wirkt das Dokument zusammenhängend, doch die OCR-Engine verarbeitet die Seitenbilder unabhängig voneinander. Eine Seite kann ein sauberer Scan mit 300 DPI sein, während die nächste herunterskaliert, gedreht, am Buchrücken verzerrt, von einer Hintergrundstruktur überlagert ist oder bereits eine beschädigte Textebene enthält. Die Inkonsistenz ist daher häufig eher auf unterschiedliche Seiteneingaben als auf eine während des Vorgangs wechselnde OCR-Modellkonfiguration zurückzuführen.

Seiten in einem PDF können eine unterschiedliche effektive Auflösung haben

Eine PDF-Seite ist ein Container und keine Garantie dafür, dass jedes eingebettete Bild dieselbe Pixeldichte aufweist. Seiten können mit unterschiedlichen Einstellungen gescannt oder beim Zusammenführen mehrerer Dateien skaliert worden sein.

Die Qualitätsrichtlinien von Tesseract behandeln Auflösung und Pixelgröße von Zeichen als wichtige OCR-Eingaben.

Eine Seite mit niedriger Auflösung verliert zuerst kleine Satzzeichen und Zeichenschrägen, während eine Seite mit hoher Auflösung möglicherweise weiterhin präzise erkannt wird. Der Unterschied hängt von den Rasterabmessungen der Seite und der Zeichenhöhe ab, nicht von der Seitenzahl.

Drehung, Schräglage und Wölbung der Seite verändern die Textsegmentierung

OCR erkennt keine isolierten Zeichen, bevor es Zeilen und Textbereiche identifiziert. Selbst eine geringe Schräglage kann dazu führen, dass Zeilen verschmelzen, geteilt werden oder erwartete Segmentierungsgrenzen überschreiten.

OCRmyPDF wendet Bildverarbeitungsschritte in einer festgelegten Reihenfolge an – Drehung, Hintergrundentfernung, Entzerrung und Bereinigung –, weil die Seitengeometrie die spätere Erkennung beeinflusst.

Wenn sich die Fehler am Rand des Buchrückens, auf einer gekrümmten Seite oder bei einer gedrehten Einlage häufen, ist die Ursache geometrischer Natur. Einheitliche Zeichenverwechslungen auf ansonsten geraden Seiten deuten eher auf die Sprach- oder Modellkonfiguration hin.

Ungleichmäßige Beleuchtung und Hintergrundstrukturen setzen einen globalen Schwellenwert außer Kraft

Ein Flachbettscan kann einen nahezu gleichmäßig weißen Hintergrund haben, während eine mit dem Handy aufgenommene Seite Schatten, Verläufe, Flecken oder Durchscheinen von der Rückseite enthalten kann.

OpenCV unterscheidet zwischen globaler und adaptiver Schwellwertbildung, bei der lokale Bereiche bei ungleichmäßiger Beleuchtung unterschiedliche Schwellenwerte erhalten.

Eine einzige feste Vorverarbeitungseinstellung kann saubere Seiten verbessern und schwachen Text auf dunkleren Seiten löschen. Diese Ursache ist erkennbar, wenn OCR-Fehler mit Schatten, der Papierfarbe oder kontrastarmen Bereichen zusammenfallen und nicht mit bestimmten Wörtern.

Verzerrung und perspektivische Verformung verändern die Zeichenformen

Seiten, die schräg fotografiert oder in der Nähe des Buchrückens gebogen wurden, dehnen manche Zeichen und stauchen andere. Gerade Textzeilen werden zu Kurven oder zusammenlaufenden Grundlinien.

PaddleOCR bietet eine Dokumentvorverarbeitung für die Ausrichtungsklassifizierung und Entkrümmung von Bildern.

Perspektive und Wölbung verursachen ortsabhängige Fehler: Die Mitte kann korrekt erkannt werden, während die äußeren Ränder fehlschlagen. Ein Problem mit dem Sprachmodell würde normalerweise dieselben Symbole unabhängig von ihrer Position beeinträchtigen.

Komprimierung und physische Beschädigung entfernen auf jeder Seite unterschiedliche Details

JPEG-Blöcke, Ringing-Artefakte, Unschärfe, Rastermuster, mehrere Kopiergenerationen und geringe Tintendichte können Zeichenstriche löschen oder falsche Kanten erzeugen.

Forschungen zur robusten Dokumentanalyse bewerten Verzerrungen wie Scannen, Schräglage, Verformung, Bildschirmfotografie und Beleuchtung.

Diese Artefakte können variieren, weil die Seiten vor dem Zusammenführen aus unterschiedlichen Quellen stammten. Komprimierungseinstellungen auf Dateiebene können Details nicht wiederherstellen, die bereits in einem früheren Scan oder einer Fotokopie verloren gegangen sind.

Layoutänderungen können mit Erkennungsfehlern verwechselt werden

Eine Seite mit normalen Absätzen, eine Tabelle, ein Anhang mit zwei Spalten, handschriftliche Notizen und ein Formular erfordern unterschiedliche Annahmen über Textbereiche und Lesereihenfolge.

Tesseract und andere OCR-Engines bieten Seitensegmentierungsmodi, weil die Erkennung davon abhängt, ob die Eingabe als Block, Text mit geringer Dichte, Spalten oder ein anderes Layout behandelt wird.

Wenn die Zeichen größtenteils korrekt sind, aber Spalten ineinanderlaufen oder Tabellenzellen in der falschen Reihenfolge erscheinen, liegt der primäre Fehler in der Layoutanalyse. Wird nur die Editierdistanz von Klartext gemessen, kann dieser Unterschied verborgen bleiben.

Unterschiedliche Sprachen, Schriftarten und Zeichensätze verändern den Kandidatenraum

Ein Bericht kann von englischen Absätzen zu Namen mit Akzenten, mathematischen Symbolen, Handschrift, Schreibmaschinentext oder auf späteren Seiten zu einer anderen Sprache wechseln.

Wenn der konfigurierten Erkennungssprache die relevanten Zeichenmuster fehlen, ersetzt die Engine unbekannte Glyphen durch visuell ähnliche unterstützte Zeichen. Dekorative Schriftarten und beschädigter Monospace-Text können denselben Effekt verstärken.

Diese Ursache folgt den Grenzen von Schrift und Typografie. Wenn alle Seiten mit einer bestimmten Sprache oder Schriftfamilie trotz guter Bildqualität ähnlich fehlschlagen, sind das Erkennungsmodell oder das Sprachpaket eine plausiblere Erklärung als Scanrauschen.

Die PDF-Rasterisierung kann der OCR-Engine unterschiedliche Bilder zuführen

Einige Seiten enthalten eingebettete Rasterbilder, andere Vektortext plus Bilder, und wieder andere bereits eine verborgene OCR-Ebene. Die Rendereinstellungen bestimmen, welche Pixel der neue OCR-Durchlauf erhält.

Die OCR-Dokumentation von PyMuPDF erklärt, dass OCR auf einem Seitenbild arbeitet und dass Seitenrendering und vorhandener Text beeinflussen, ob und wie OCR durchgeführt wird.

Der Artikel von ZimaSpace über Dokumentensuche und RAG beschreibt die nachgelagerte Grenze: Uneinheitliche OCR führt zu uneinheitlichen Textabschnitten und Quellenangaben, sofern die Erfassungspipeline nicht die Herkunft und Konfidenz auf Seitenebene bewahrt.

FAQ

Kann eine einzige OCR-Spracheinstellung für ein mehrsprachiges PDF funktionieren?

Das ist möglich, wenn die Engine kombinierte Sprachmodelle unterstützt. Die Genauigkeit kann jedoch weiterhin variieren, wenn sich Schrift, Schriftarten und Seitenqualität unterscheiden. Spracherkennung und eine Konfiguration auf Seitenebene können entscheidend sein.

Garantieren 300 DPI eine einheitliche OCR?

Nein. Dadurch stehen zwar mehr Details zur Verfügung, doch Schräglage, Unschärfe, Hintergrundrauschen, Komprimierung, Verformung und Layout können die Erkennungsqualität weiterhin maßgeblich bestimmen.

Warum sieht das PDF scharf aus, während die OCR trotzdem schlecht ist?

Ein Viewer kann das Bild ansprechend glätten oder skalieren. OCR hängt von den zugrunde liegenden Pixeln, dem Zustand der Textebene und der Rasterisierung ab, die von der Erkennungspipeline verwendet wird.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.