Potoki OCR pomijają relacje w tabelach, ponieważ rozpoznawanie znaków nie odtwarza automatycznie wierszy, kolumn, nagłówków, komórek obejmujących wiele pól ani kolejności odczytu.
Zeskanowany rachunek za media, paragon, arkusz inwentaryzacyjny, wyciąg medyczny lub harmonogram urządzeń może zawierać doskonale czytelne słowa, a mimo to po OCR wygenerować płaski strumień tekstu. Brakuje informacji strukturalnych: która wartość należy do którego nagłówka, które komórki znajdują się w jednym wierszu, czy jedna etykieta obejmuje kilka kolumn oraz jak powtarzające się sekcje są kontynuowane na stronie. OCR rozwiązuje problem wizualnego rozpoznawania tekstu, natomiast rozumienie tabel wymaga również wykrywania układu, segmentacji komórek, dopasowania współrzędnych i logicznej rekonstrukcji.
OCR konwertuje obszary obrazu na tekst, a nie na schemat tabeli
Rozpoznawanie znaków identyfikuje litery, cyfry i słowa na podstawie pikseli obrazu. Wynik w postaci zwykłego tekstu może zachować słowa, jednocześnie usuwając ich pierwotne współrzędne.
Google opisuje tekst do odczytu maszynowego jako podstawowy wynik OCR.
Tabela wymaga dodatkowych obiektów: komórek, grup wierszy, grup kolumn, nagłówków, zakresów oraz powiązań między nimi. Relacje te nie są znakami i nie można ich odtworzyć wyłącznie na podstawie poprawności pisowni.
Spłaszczenie wyniku OCR usuwa informacje przestrzenne
Dwie wartości mogą być oddzielone odstępem, ponieważ należą do różnych kolumn, jedna komórka jest pusta albo skan zawiera wizualne marginesy.
Microsoft Research zauważa, że swobodny tekst OCR nie zawiera jawnej struktury tabeli i wymaga dodatkowego wnioskowania w celu odtworzenia wierszy, kolumn i nagłówków.
Po usunięciu współrzędnych potok musi wnioskować o strukturze na podstawie separatorów, powtarzających się wzorców, typów wartości i spójności semantycznej. Niejednoznaczne układy mogą umożliwiać kilka prawdopodobnych rekonstrukcji.
Jeśli później będzie wymagana ekstrakcja tabeli, należy zachować obwiednie, numery stron, identyfikatory wierszy i wartości pewności wraz z rozpoznanym tekstem.
Wiersze i kolumny zależą od wyrównania wizualnego
Tabele bez widocznych linii obramowania opierają się na stałych odstępach i wyrównaniu. Przekrzywienie, perspektywa, rozmycie lub nierówne skanowanie mogą przesunąć komórki na tyle, że proste heurystyki wierszy i kolumn przestaną działać.
Badania nad rozpoznawaniem tabel wykorzystują modelowanie współrzędnych do odtwarzania logicznej i fizycznej struktury tabel na podstawie obrazów dokumentów.
Poprawny ciąg OCR umieszczony w niewłaściwym wierszu nadal oznacza błędną tabelę. Dokładność relacji należy mierzyć oddzielnie od dokładności rozpoznawania znaków.
Nagłówki i komórki obejmujące wiele pól tworzą relacje hierarchiczne
Górny nagłówek może obejmować kilka podkolumn, a etykieta z lewej strony może opisywać wiele kolejnych wierszy. Puste komórki mogą oznaczać kontynuację, a nie brak danych.
Pix2Struct jest trenowany na podstawie analizie osadzonej wizualnie, ponieważ znaczenie dokumentu zależy zarówno od układu, jak i od rozpoznanych tokenów.
Płaski tekst często powtarza nagłówek tylko raz, a następnie wyświetla wiele wartości bez trwałego powiązania z tym nagłówkiem. Scalane komórki i wielopoziomowe nagłówki wymagają hierarchicznej reprezentacji tabeli, a nie prostego podziału na wiersze.
Zakresy wierszy i kolumn w stylu HTML, graf komórek lub jawne identyfikatory nagłówków nadrzędnych mogą zachować te relacje po ekstrakcji.
Kolejność odczytu może przeplatać komórki tabeli z inną treścią strony
Strona może zawierać tytuł, przypisy, dwie kolumny, etykiety obok tabeli oraz tekst kontynuowany poniżej niej. Ogólna logika kolejności odczytu może wstawiać te obszary między wiersze tabeli.
IBM wyjaśnia, że OCR jest jednym z etapów ekstrakcji danych z dokumentów, a nie kompletną reprezentacją relacji układu.
Wykrywanie tabel powinno wyodrębnić obszar tabeli przed uporządkowaniem wierszy, natomiast przypisy i podpisy powinny pozostać powiązane za pomocą oddzielnych metadanych.
Tabele wielostronicowe wymagają również logiki kontynuacji, aby powtarzające się nagłówki nie były indeksowane jako zwykłe wiersze danych.
Modele tabel działające od początku do końca nadal wymagają walidacji relacji
Nowoczesne systemy mogą bezpośrednio na podstawie obrazów przewidywać obszary tabel, wiersze, kolumny i sąsiedztwo komórek, ale złożone układy, skany niskiej jakości i nieznane style dokumentów nadal stanowią wyzwanie.
Table Transformer wprowadził rozpoznawanie struktury jako oddzielne zadanie wykraczające poza standardowy OCR.
proces wyszukiwania dokumentów w ZimaSpace zależy od zachowania istotnych danych źródłowych przed podziałem na fragmenty i indeksowaniem; spłaszczona tabela nie pozwoli później wygenerować wiarygodnych cytowań na poziomie wierszy.
Sprawdź tekst komórek, przynależność do wierszy i kolumn, powiązanie z nagłówkami, zakresy, kolejność odczytu oraz współrzędne źródłowe. Potok działa poprawnie dopiero wtedy, gdy wyszukaną wartość można prześledzić do właściwej relacji w tabeli.
FAQ
Czy wysoka dokładność rozpoznawania znaków OCR może mimo wszystko prowadzić do błędnej tabeli?
Tak. Każde słowo może zostać rozpoznane poprawnie, a mimo to wartości mogą zostać przypisane do niewłaściwego wiersza, kolumny, nagłówka lub sekcji kontynuacji.
Czy zeskanowane tabele należy bezpośrednio konwertować na zwykły tekst na potrzeby RAG?
Tylko wtedy, gdy struktura nie ma znaczenia. W przypadku wyszukiwania informacji zachowaj uporządkowaną reprezentację tabeli i współrzędne źródłowe wraz z dowolnym tekstowym przedstawieniem.
Czy widoczne linie siatki gwarantują poprawną ekstrakcję?
Nie. Linie ułatwiają segmentację, ale scalane komórki, uszkodzone skany, zagnieżdżone nagłówki i błędy wyrównania OCR nadal mogą prowadzić do nieprawidłowych relacji.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak tajny broker przekazuje agentowi AI dane uwierzytelniające bez ujawniania ich w promptach?
Śledź tożsamość obciążenia, zasady, wydawanie tokenów, wstrzykiwanie żądań, redakcję, wygasanie i unieważnianie w ramach bezsekretnej architektury domowego agenta AI.

Jak piaskownica narzędzi ogranicza skutki uboczne działania agenta AI?
Zobacz, jak izolacja, bramki uprawnień, ulotny stan, kontrola ruchu wychodzącego, limity i dzienniki audytowe ograniczają skutki uboczne agentów AI bez dowodzenia, że działania są...

Jak dekodowanie z ograniczeniami generuje JSON zgodny ze schematem?
Zrozum kompilację schematu, maskowanie tokenów, stan parsera, obsługiwane podzbiory, opóźnienia, obcinanie oraz to, dlaczego poprawność strukturalna nie gwarantuje prawidłowych wartości.

