Dlaczego potoki OCR pomijają relacje między tabelami w zeskanowanych dokumentach domowych?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Potoki OCR pomijają relacje w tabelach, ponieważ rozpoznawanie znaków nie odtwarza automatycznie wierszy, kolumn, nagłówków, komórek obejmujących wiele pól ani kolejności odczytu.

Zeskanowany rachunek za media, paragon, arkusz inwentaryzacyjny, wyciąg medyczny lub harmonogram urządzeń może zawierać doskonale czytelne słowa, a mimo to po OCR wygenerować płaski strumień tekstu. Brakuje informacji strukturalnych: która wartość należy do którego nagłówka, które komórki znajdują się w jednym wierszu, czy jedna etykieta obejmuje kilka kolumn oraz jak powtarzające się sekcje są kontynuowane na stronie. OCR rozwiązuje problem wizualnego rozpoznawania tekstu, natomiast rozumienie tabel wymaga również wykrywania układu, segmentacji komórek, dopasowania współrzędnych i logicznej rekonstrukcji.

OCR konwertuje obszary obrazu na tekst, a nie na schemat tabeli

Rozpoznawanie znaków identyfikuje litery, cyfry i słowa na podstawie pikseli obrazu. Wynik w postaci zwykłego tekstu może zachować słowa, jednocześnie usuwając ich pierwotne współrzędne.

Google opisuje tekst do odczytu maszynowego jako podstawowy wynik OCR.

Tabela wymaga dodatkowych obiektów: komórek, grup wierszy, grup kolumn, nagłówków, zakresów oraz powiązań między nimi. Relacje te nie są znakami i nie można ich odtworzyć wyłącznie na podstawie poprawności pisowni.

Spłaszczenie wyniku OCR usuwa informacje przestrzenne

Dwie wartości mogą być oddzielone odstępem, ponieważ należą do różnych kolumn, jedna komórka jest pusta albo skan zawiera wizualne marginesy.

Microsoft Research zauważa, że swobodny tekst OCR nie zawiera jawnej struktury tabeli i wymaga dodatkowego wnioskowania w celu odtworzenia wierszy, kolumn i nagłówków.

Po usunięciu współrzędnych potok musi wnioskować o strukturze na podstawie separatorów, powtarzających się wzorców, typów wartości i spójności semantycznej. Niejednoznaczne układy mogą umożliwiać kilka prawdopodobnych rekonstrukcji.

Jeśli później będzie wymagana ekstrakcja tabeli, należy zachować obwiednie, numery stron, identyfikatory wierszy i wartości pewności wraz z rozpoznanym tekstem.

Wiersze i kolumny zależą od wyrównania wizualnego

Tabele bez widocznych linii obramowania opierają się na stałych odstępach i wyrównaniu. Przekrzywienie, perspektywa, rozmycie lub nierówne skanowanie mogą przesunąć komórki na tyle, że proste heurystyki wierszy i kolumn przestaną działać.

Badania nad rozpoznawaniem tabel wykorzystują modelowanie współrzędnych do odtwarzania logicznej i fizycznej struktury tabel na podstawie obrazów dokumentów.

Poprawny ciąg OCR umieszczony w niewłaściwym wierszu nadal oznacza błędną tabelę. Dokładność relacji należy mierzyć oddzielnie od dokładności rozpoznawania znaków.

-15% OFF

Nagłówki i komórki obejmujące wiele pól tworzą relacje hierarchiczne

Górny nagłówek może obejmować kilka podkolumn, a etykieta z lewej strony może opisywać wiele kolejnych wierszy. Puste komórki mogą oznaczać kontynuację, a nie brak danych.

Pix2Struct jest trenowany na podstawie analizie osadzonej wizualnie, ponieważ znaczenie dokumentu zależy zarówno od układu, jak i od rozpoznanych tokenów.

Płaski tekst często powtarza nagłówek tylko raz, a następnie wyświetla wiele wartości bez trwałego powiązania z tym nagłówkiem. Scalane komórki i wielopoziomowe nagłówki wymagają hierarchicznej reprezentacji tabeli, a nie prostego podziału na wiersze.

Zakresy wierszy i kolumn w stylu HTML, graf komórek lub jawne identyfikatory nagłówków nadrzędnych mogą zachować te relacje po ekstrakcji.

Kolejność odczytu może przeplatać komórki tabeli z inną treścią strony

Strona może zawierać tytuł, przypisy, dwie kolumny, etykiety obok tabeli oraz tekst kontynuowany poniżej niej. Ogólna logika kolejności odczytu może wstawiać te obszary między wiersze tabeli.

IBM wyjaśnia, że OCR jest jednym z etapów ekstrakcji danych z dokumentów, a nie kompletną reprezentacją relacji układu.

Wykrywanie tabel powinno wyodrębnić obszar tabeli przed uporządkowaniem wierszy, natomiast przypisy i podpisy powinny pozostać powiązane za pomocą oddzielnych metadanych.

Tabele wielostronicowe wymagają również logiki kontynuacji, aby powtarzające się nagłówki nie były indeksowane jako zwykłe wiersze danych.

Modele tabel działające od początku do końca nadal wymagają walidacji relacji

Nowoczesne systemy mogą bezpośrednio na podstawie obrazów przewidywać obszary tabel, wiersze, kolumny i sąsiedztwo komórek, ale złożone układy, skany niskiej jakości i nieznane style dokumentów nadal stanowią wyzwanie.

Table Transformer wprowadził rozpoznawanie struktury jako oddzielne zadanie wykraczające poza standardowy OCR.

proces wyszukiwania dokumentów w ZimaSpace zależy od zachowania istotnych danych źródłowych przed podziałem na fragmenty i indeksowaniem; spłaszczona tabela nie pozwoli później wygenerować wiarygodnych cytowań na poziomie wierszy.

Sprawdź tekst komórek, przynależność do wierszy i kolumn, powiązanie z nagłówkami, zakresy, kolejność odczytu oraz współrzędne źródłowe. Potok działa poprawnie dopiero wtedy, gdy wyszukaną wartość można prześledzić do właściwej relacji w tabeli.

FAQ

Czy wysoka dokładność rozpoznawania znaków OCR może mimo wszystko prowadzić do błędnej tabeli?

Tak. Każde słowo może zostać rozpoznane poprawnie, a mimo to wartości mogą zostać przypisane do niewłaściwego wiersza, kolumny, nagłówka lub sekcji kontynuacji.

Czy zeskanowane tabele należy bezpośrednio konwertować na zwykły tekst na potrzeby RAG?

Tylko wtedy, gdy struktura nie ma znaczenia. W przypadku wyszukiwania informacji zachowaj uporządkowaną reprezentację tabeli i współrzędne źródłowe wraz z dowolnym tekstowym przedstawieniem.

Czy widoczne linie siatki gwarantują poprawną ekstrakcję?

Nie. Linie ułatwiają segmentację, ale scalane komórki, uszkodzone skany, zagnieżdżone nagłówki i błędy wyrównania OCR nadal mogą prowadzić do nieprawidłowych relacji.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.