OCR pomija wyblakły tekst po ponownej kompresji PDF, ponieważ kreski o niskim kontraście mogą zostać zmniejszone, skwantyzowane, rozmyte lub połączone z tłem strony.
Przeglądarka PDF może sprawiać, że strona po ponownej kompresji wygląda poprawnie dzięki interpolacji przy powiększaniu, wyostrzaniu i odczytywaniu kontekstu przez człowieka. OCR natomiast korzysta z wyrenderowanego rastra w wybranej rozdzielczości i przekształca lokalne wzorce intensywności w znaki. Gdy wyblakły atrament zajmuje tylko kilka pikseli, niewielkie zmiany kompresji lub przetwarzania kolorów mogą zepchnąć te piksele poniżej progów segmentacji i rozpoznawania.
Ponowna kompresja może zrasteryzować i zmniejszyć rozdzielczość strony
Optymalizator PDF może ponownie próbkować osadzone skany, zmniejszać liczbę punktów na cal, konwertować przestrzenie kolorów lub spłaszczać przezroczystość przed zastosowaniem nowego kodeka. Cienkie kreski zajmują wtedy mniej pikseli, a uśrednianie miesza ich intensywność z białym tłem.
Szeroki przegląd binaryzacji dokumentów opisuje, jak binaryzacja dokumentów oddziela pierwszy plan od tła przy nierównomiernym oświetleniu, degradacji i niskim kontraście. Zawarte w nim dowody pokazują, że odzyskiwanie wyblakłego tekstu zależy od informacji zachowanej przed progowaniem. Rozróżnienie to pozostaje widoczne podczas późniejszych testów domowych.
Wielokrotne zapisy stratne pogłębiają problem, ponieważ każda generacja przetwarza wcześniejsze artefakty. Transformacje blokowe JPEG i kwantyzacja usuwają subtelne zmiany wysokoczęstotliwościowe, a agresywna konwersja monochromatyczna może całkowicie usunąć graniczną szarą kreskę. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim zostanie uruchomiona automatyzacja.
Renderowanie OCR i wstępne przetwarzanie wprowadzają dodatkowe progi
Silnik OCR lub biblioteka PDF wybiera DPI renderowania, tryb antyaliasingu, konwersję kolorów, odszumianie, prostowanie i metodę binaryzacji. Strona, która pozostaje czytelna przy powiększeniu na ekranie, może dać bitmapę OCR o niższej rozdzielczości lub przefiltrowaną w inny sposób.
Badania nad binaryzacją uwzględniającą OCR wspólnie optymalizują parametry binaryzacji pod kątem OCR, pokazując, że jeden wybór progowania nie sprawdza się w każdym dokumencie. Kreski o niskim kontraście mogą zostać zaklasyfikowane jako tło, nawet gdy człowiek odczytuje je na podstawie otaczających słów.
Progi adaptacyjne mogą odzyskać lokalnie wyblakły tekst, ale mogą też wzmocnić fakturę papieru i dzwonienie kompresji, tworząc fałszywe znaki. Progi globalne bardziej konsekwentnie tłumią szum, lecz zawodzą tam, gdzie intensywności atramentu i tła się pokrywają. Tę granicę należy mierzyć osobno w realistycznych warunkach działania.
Wzrok człowieka i OCR zawodzą w różnych punktach granicznych
Ludzie łączą powiększenie, kształt słów, znajomość języka i sąsiednie zdania, podczas gdy OCR wymaga wystarczających lokalnych danych do segmentacji i klasyfikacji. Strona wyglądająca wiarygodnie nie jest więc dowodem, że piksele znaków przetrwały. Praktyczna konsekwencja staje się widoczna, gdy kilka źródeł konkuruje o ograniczony kontekst.
Analiza wpływu wstępnego przetwarzania na OCR łączy przetwarzanie wstępne z dokładnością OCR w przypadku zdegradowanych dokumentów, potwierdzając, że rozdzielczość, kontrast, szum i progowanie oddziałują na siebie, zamiast wpływać niezależnie. Zależność ta powinna pozostać wyraźnie uwzględniona w interfejsie końcowym.
Błędem jest przypisywanie każdego pominięcia ponownej kompresji. Nowe uruchomienie OCR może korzystać z innego pakietu językowego, renderera, DPI, trybu układu lub buforowanego obrazu strony. Porównaj dokładne rastry przekazywane temu samemu silnikowi.
Porównaj oryginalne i ponownie skompresowane strony na wejściu OCR
Wyrenderuj oryginalne i ponownie skompresowane strony przy identycznych ustawieniach DPI i kolorów. Zmierz wymiary pikselowe, kodek, efektywną rozdzielczość, lokalny kontrast kreski względem tła, szerokość krawędzi, artefakty blokowe, pewność OCR, współczynnik błędów znaków oraz brakujące obszary, korzystając ze zweryfikowanej prawdy odniesienia.
Użyj niespójności OCR, aby sprawdzić, czy niespójność na poziomie stron wynika z układu czy jakości obrazu. Powtórz OCR przy stałym wstępnym przetwarzaniu, a następnie zmieniaj wyłącznie DPI renderowania, metodę progowania i jakość ponownej kompresji. Wynik należy zatem sprawdzić względem pierwotnych danych.
Uznaj ponowną kompresję za przyczynową, gdy ten sam silnik działa poprawnie na oryginalnym rastrze, a zawodzi tam, gdzie mierzalne informacje o kreskach uległy pogorszeniu. Zachowuj oryginały, unikaj wielokrotnej optymalizacji stratnej i wybieraj ścieżkę o wyższej jakości lub bezstratną w przypadku dokumentów, których wyblakłe oznaczenia mają znaczenie prawne lub historyczne.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego zmiany plików SMB docierają do indeksatora przyrostowego seriami?
Zobacz, jak buforowanie zapisu SMB, dzierżawy, CHANGE_NOTIFY, przepełnienie bufora, ponowne połączenie i grupowanie zadań indeksatora przekształcają regularne edycje w skokowe zdarzenia pozyskiwania danych.

Dlaczego opóźnienia lokalnej sztucznej inteligencji oscylują wraz z krzywą pracy wentylatora serwera domowego?
Zobacz, jak ciepło, sterowanie wentylatorem, limity taktowania zegara, opóźnienia czujników i harmonogram obciążenia powodują okresowe opóźnienia lokalnej sztucznej inteligencji - oraz jak udowodnić tę...

Dlaczego indeksowanie multimediów bardziej nagrzewa serwer NAS niż sekwencyjna kopia zapasowa?
Dowiedz się, dlaczego operacje wejścia/wyjścia na małych plikach, kodeki, miniatury, metadane, bazy danych i wnioskowanie AI generują więcej ciepła w całym urządzeniu niż kopiowanie...

