Odtwarzanie układu OCR ma znaczenie, ponieważ poprawne znaki stają się mylące, gdy etykiety, wartości, wiersze i kolumny są zwracane w niewłaściwej kolejności.
Skaner może rozpoznać każde słowo na formularzu podatkowym, a mimo to przypisać kwotę do sąsiedniej etykiety albo spłaszczyć kolumnę tabeli zamiast odczytać ją wierszami. Kolejność czytania to pośrednia struktura łącząca widoczne współrzędne z tekstem szeregowanym. Gdy ta struktura jest nieprawidłowa, ekstrakcja, wyszukiwanie i RAG dziedziczą pewny siebie, lecz przestawiony dokument.
Dokładność znaków nie zachowuje relacji w dokumencie
OCR zwykle rozpoczyna się od wykrywania regionów, wierszy, słów i znaków. Te przewidywania określają, jaki tekst istnieje i gdzie się znajduje, ale nie wskazują, który blok powinien następować po innym. Eksport zwykłego tekstu musi wybrać jedną sekwencję, dlatego odtwarzanie układu staje się osobnym wnioskowaniem opartym na położeniu, grupowaniu wizualnym i konwencjach dokumentu.
Praca badawcza LayoutReader opisuje kolejność czytania jako fundament pracy z paragonami i formularzami oraz tworzy duży zbiór danych na podstawie metadanych układu dokumentów. Wyniki pokazują, dlaczego poprawa kolejności wierszy może usprawnić skądinąd sprawne silniki OCR bez zmiany ich modułu rozpoznawania znaków.
To rozróżnienie ma decydujące znaczenie w przypadku stron o uporządkowanej strukturze. Przestawiony wiersz może wyglądać niegroźnie w akapicie, podczas gdy ten sam błąd w formularzu może przypisać wartość do niewłaściwego pola, a w tabeli przenieść każdą komórkę do nieprawidłowego rekordu.
Kolejność czytania odtwarza wiersze, kolumny i pary pól
Model układu traktuje bloki jako węzły i przewiduje relacje pierwszeństwa lub sąsiedztwa między nimi. Geometria dostarcza wskazówek, takich jak wyrównanie, odstępy, zawieranie i powtarzające się linie bazowe; tekst dostarcza wskazówek, takich jak nagłówki, interpunkcja i typy pól. Powstały graf jest następnie linearyzowany albo przekształcany w struktury tabelaryczne i klucz-wartość.
Badania nad relacjami kolejności wskazują, że pojedyncza permutacja może nie wyrażać każdej prawidłowej relacji na złożonej stronie. Porządkowanie parami może zachować bogatszą strukturę, gdy panele boczne, zagnieżdżone regiony lub elementy wielokolumnowe tworzą więcej niż jedną wiarygodną ścieżkę czytania.
W przypadku formularzy użytecznym wynikiem często nie jest jeden długi ciąg znaków, lecz relacje, takie jak etykieta–wartość i pole wyboru–pytanie. W tabelach podczas szeregowania muszą zostać zachowane przynależność do wierszy i kolumn. Kolejność czytania wspiera więc odtwarzanie struktury, a nie tylko sprawia, że wyodrębniony tekst jest przyjemniejszy w odbiorze.
Gdzie odtwarzanie układu nadal prowadzi do wiarygodnych błędów
Obrócone skany, scalone komórki, odręczne pismo, pływające adnotacje, powtarzające się nagłówki i tabele bez obramowania mogą pokonać reguły wizualne wyuczone na czystszych stronach. Model może wygenerować płynną sekwencję, która niezauważalnie przechodzi między kolumnami, zwłaszcza gdy sąsiednie pola zawierają zgodne ze sobą daty, waluty lub nazwiska.
Modelowanie tekstu i układu wspólnie analizuje tekst, położenie dwuwymiarowe i cechy wizualne na potrzeby rozumienia dokumentów. To połączenie wyjaśnia, dlaczego same współrzędne są niewystarczające, ale oznacza również, że błędy wykrywania lub OCR mogą zanieczyścić późniejsze przewidywanie struktury.
Granica zawodności pojawia się w każdym dokumencie, w którym wiarygodnych pozostaje kilka uporządkowań lub w którym niewłaściwe powiązanie zmienia rekord. W takim przypadku należy zachować obwiednie i obrazy stron, ujawnić niepewność oraz wymagać weryfikacji, zamiast traktować uszeregowany tekst jako dane kanoniczne.
Przeprowadź test odtwarzania komórek i pól
Wybierz dziesięć reprezentatywnych stron zawierających tekst wielokolumnowy, scalone komórki, powtarzające się nagłówki, pola wyboru oraz pary etykieta–wartość. Utwórz niewielki zbiór wzorcowy, który zapisuje zamierzoną kolejność czytania oraz każde powiązanie wiersza, kolumny i formularza. Oceniaj ustrukturyzowany wynik, a nie tylko współczynnik błędów znaków.
Indeksuj zarówno odtworzony tekst, jak i jego współrzędne źródłowe, zgodnie z zasadami pracy z dowodami opisanymi dla wyszukiwania w ustrukturyzowanych dokumentach. Wyszukuj wartości występujące na stronie więcej niż raz i sprawdzaj, czy każda odpowiedź wskazuje właściwą etykietę, wiersz, kolumnę i region strony.
Uznaj test za zaliczony tylko wtedy, gdy system zachowuje relacje ze zbioru wzorcowego, a niejednoznaczne układy są oznaczane. Wysoki wynik OCR nie rekompensuje zamienionych pól; jeśli błędy skupiają się wokół konkretnego szablonu, skieruj ten szablon do wyspecjalizowanego parsera lub do weryfikacji przez człowieka.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Kalibracja oceny prywatnego wyszukiwania: jak surowe podobieństwo staje się użytecznym wskaźnikiem pewności
Dowiedz się, dlaczego podobieństwo cosinusowe nie jest miarą pewności, jak oznaczone zapytania służą do kalibracji wyników oraz jak monitorować progi, gdy zmienia się prywatny...

Lokalność NUMA w lokalnej sztucznej inteligencji: dlaczego rozmieszczenie pamięci zmienia tempo zasilania akceleratora
Dowiedz się, jak topologia CPU, pamięci RAM i PCIe wpływa na zasilanie akceleratora danymi, dlaczego automatyczne rozmieszczanie może się różnić oraz jak bezpiecznie testować...

Mapowanie plików modeli w pamięci: jak współdzielone strony zmniejszają duplikowanie pamięci RAM
Dowiedz się, jak mapowane strony modelu są stronicowane i współdzielone, dlaczego RSS może wprowadzać w błąd oraz które pamięci podręczne i bufory nadal zajmują...

