Die OCR-Ergebnisse können innerhalb eines gescannten PDFs variieren, weil sich Auflösung, Schräglage, Kontrast, Komprimierung, Layout, Sprache und Bildgeometrie von Seite zu Seite unterscheiden können.
Ein privates Archiv kann ein einzelnes PDF enthalten, das aus mehreren Scans, Handyaufnahmen, Fotokopien oder importierten Bildern zusammengesetzt wurde. Im Viewer wirkt das Dokument zusammenhängend, doch die OCR-Engine verarbeitet die Seitenbilder unabhängig voneinander. Eine Seite kann ein sauberer Scan mit 300 DPI sein, während die nächste herunterskaliert, gedreht, am Buchrücken verzerrt, von einer Hintergrundstruktur überlagert ist oder bereits eine beschädigte Textebene enthält. Die Inkonsistenz ist daher häufig eher auf unterschiedliche Seiteneingaben als auf eine während des Vorgangs wechselnde OCR-Modellkonfiguration zurückzuführen.
Seiten in einem PDF können eine unterschiedliche effektive Auflösung haben
Eine PDF-Seite ist ein Container und keine Garantie dafür, dass jedes eingebettete Bild dieselbe Pixeldichte aufweist. Seiten können mit unterschiedlichen Einstellungen gescannt oder beim Zusammenführen mehrerer Dateien skaliert worden sein.
Die Qualitätsrichtlinien von Tesseract behandeln Auflösung und Pixelgröße von Zeichen als wichtige OCR-Eingaben.
Eine Seite mit niedriger Auflösung verliert zuerst kleine Satzzeichen und Zeichenschrägen, während eine Seite mit hoher Auflösung möglicherweise weiterhin präzise erkannt wird. Der Unterschied hängt von den Rasterabmessungen der Seite und der Zeichenhöhe ab, nicht von der Seitenzahl.
Drehung, Schräglage und Wölbung der Seite verändern die Textsegmentierung
OCR erkennt keine isolierten Zeichen, bevor es Zeilen und Textbereiche identifiziert. Selbst eine geringe Schräglage kann dazu führen, dass Zeilen verschmelzen, geteilt werden oder erwartete Segmentierungsgrenzen überschreiten.
OCRmyPDF wendet Bildverarbeitungsschritte in einer festgelegten Reihenfolge an – Drehung, Hintergrundentfernung, Entzerrung und Bereinigung –, weil die Seitengeometrie die spätere Erkennung beeinflusst.
Wenn sich die Fehler am Rand des Buchrückens, auf einer gekrümmten Seite oder bei einer gedrehten Einlage häufen, ist die Ursache geometrischer Natur. Einheitliche Zeichenverwechslungen auf ansonsten geraden Seiten deuten eher auf die Sprach- oder Modellkonfiguration hin.
Ungleichmäßige Beleuchtung und Hintergrundstrukturen setzen einen globalen Schwellenwert außer Kraft
Ein Flachbettscan kann einen nahezu gleichmäßig weißen Hintergrund haben, während eine mit dem Handy aufgenommene Seite Schatten, Verläufe, Flecken oder Durchscheinen von der Rückseite enthalten kann.
OpenCV unterscheidet zwischen globaler und adaptiver Schwellwertbildung, bei der lokale Bereiche bei ungleichmäßiger Beleuchtung unterschiedliche Schwellenwerte erhalten.
Eine einzige feste Vorverarbeitungseinstellung kann saubere Seiten verbessern und schwachen Text auf dunkleren Seiten löschen. Diese Ursache ist erkennbar, wenn OCR-Fehler mit Schatten, der Papierfarbe oder kontrastarmen Bereichen zusammenfallen und nicht mit bestimmten Wörtern.
Verzerrung und perspektivische Verformung verändern die Zeichenformen
Seiten, die schräg fotografiert oder in der Nähe des Buchrückens gebogen wurden, dehnen manche Zeichen und stauchen andere. Gerade Textzeilen werden zu Kurven oder zusammenlaufenden Grundlinien.
PaddleOCR bietet eine Dokumentvorverarbeitung für die Ausrichtungsklassifizierung und Entkrümmung von Bildern.
Perspektive und Wölbung verursachen ortsabhängige Fehler: Die Mitte kann korrekt erkannt werden, während die äußeren Ränder fehlschlagen. Ein Problem mit dem Sprachmodell würde normalerweise dieselben Symbole unabhängig von ihrer Position beeinträchtigen.
Komprimierung und physische Beschädigung entfernen auf jeder Seite unterschiedliche Details
JPEG-Blöcke, Ringing-Artefakte, Unschärfe, Rastermuster, mehrere Kopiergenerationen und geringe Tintendichte können Zeichenstriche löschen oder falsche Kanten erzeugen.
Forschungen zur robusten Dokumentanalyse bewerten Verzerrungen wie Scannen, Schräglage, Verformung, Bildschirmfotografie und Beleuchtung.
Diese Artefakte können variieren, weil die Seiten vor dem Zusammenführen aus unterschiedlichen Quellen stammten. Komprimierungseinstellungen auf Dateiebene können Details nicht wiederherstellen, die bereits in einem früheren Scan oder einer Fotokopie verloren gegangen sind.
Layoutänderungen können mit Erkennungsfehlern verwechselt werden
Eine Seite mit normalen Absätzen, eine Tabelle, ein Anhang mit zwei Spalten, handschriftliche Notizen und ein Formular erfordern unterschiedliche Annahmen über Textbereiche und Lesereihenfolge.
Tesseract und andere OCR-Engines bieten Seitensegmentierungsmodi, weil die Erkennung davon abhängt, ob die Eingabe als Block, Text mit geringer Dichte, Spalten oder ein anderes Layout behandelt wird.
Wenn die Zeichen größtenteils korrekt sind, aber Spalten ineinanderlaufen oder Tabellenzellen in der falschen Reihenfolge erscheinen, liegt der primäre Fehler in der Layoutanalyse. Wird nur die Editierdistanz von Klartext gemessen, kann dieser Unterschied verborgen bleiben.
Unterschiedliche Sprachen, Schriftarten und Zeichensätze verändern den Kandidatenraum
Ein Bericht kann von englischen Absätzen zu Namen mit Akzenten, mathematischen Symbolen, Handschrift, Schreibmaschinentext oder auf späteren Seiten zu einer anderen Sprache wechseln.
Wenn der konfigurierten Erkennungssprache die relevanten Zeichenmuster fehlen, ersetzt die Engine unbekannte Glyphen durch visuell ähnliche unterstützte Zeichen. Dekorative Schriftarten und beschädigter Monospace-Text können denselben Effekt verstärken.
Diese Ursache folgt den Grenzen von Schrift und Typografie. Wenn alle Seiten mit einer bestimmten Sprache oder Schriftfamilie trotz guter Bildqualität ähnlich fehlschlagen, sind das Erkennungsmodell oder das Sprachpaket eine plausiblere Erklärung als Scanrauschen.
Die PDF-Rasterisierung kann der OCR-Engine unterschiedliche Bilder zuführen
Einige Seiten enthalten eingebettete Rasterbilder, andere Vektortext plus Bilder, und wieder andere bereits eine verborgene OCR-Ebene. Die Rendereinstellungen bestimmen, welche Pixel der neue OCR-Durchlauf erhält.
Die OCR-Dokumentation von PyMuPDF erklärt, dass OCR auf einem Seitenbild arbeitet und dass Seitenrendering und vorhandener Text beeinflussen, ob und wie OCR durchgeführt wird.
Der Artikel von ZimaSpace über Dokumentensuche und RAG beschreibt die nachgelagerte Grenze: Uneinheitliche OCR führt zu uneinheitlichen Textabschnitten und Quellenangaben, sofern die Erfassungspipeline nicht die Herkunft und Konfidenz auf Seitenebene bewahrt.
FAQ
Kann eine einzige OCR-Spracheinstellung für ein mehrsprachiges PDF funktionieren?
Das ist möglich, wenn die Engine kombinierte Sprachmodelle unterstützt. Die Genauigkeit kann jedoch weiterhin variieren, wenn sich Schrift, Schriftarten und Seitenqualität unterscheiden. Spracherkennung und eine Konfiguration auf Seitenebene können entscheidend sein.
Garantieren 300 DPI eine einheitliche OCR?
Nein. Dadurch stehen zwar mehr Details zur Verfügung, doch Schräglage, Unschärfe, Hintergrundrauschen, Komprimierung, Verformung und Layout können die Erkennungsqualität weiterhin maßgeblich bestimmen.
Warum sieht das PDF scharf aus, während die OCR trotzdem schlecht ist?
Ein Viewer kann das Bild ansprechend glätten oder skalieren. OCR hängt von den zugrunde liegenden Pixeln, dem Zustand der Textebene und der Rasterisierung ab, die von der Erkennungspipeline verwendet wird.
Tech- & KI-Zentrum
Mehr zum Lesen

Was verursacht WebSocket-Wiederverbindungsschleifen in einer entfernten KI-Heimoberfläche?
Diagnostizieren Sie WebSocket-Schleifen über die Ebenen von Handshake, Proxy, Authentifizierung, Heartbeat, Netzwerkpfad, Sitzungswiederherstellung und Client-Backoff.

Was verursacht abweichende Prüfsummen von Backups nach einer unterbrochenen Übertragung?
Verfolge Prüfsummenabweichungen durch Quell-Snapshots, Chunk-Manifeste, Fortsetzungs-Offsets, Teildateien, Transformationen, Speicherschreibvorgänge und die abschließende Verifizierung.

Was verursacht doppelte Haushaltsentitäten in einem privaten Wissensgraphen?
Diagnostizieren Sie doppelte Knoten im Wissensgraphen, indem Sie Extraktionsvarianten, Identitätsschlüssel, Auflösungsschwellenwerte, Quellenherkunft und parallele Zusammenführungen voneinander trennen.

