Osadzenia dokumentów zmieniają się po aktualizacji języka OCR, ponieważ nowy rozpoznawacz modyfikuje tekst, granice tokenów lub układ przekazywany do kodera.
Zeskanowana faktura może wyglądać identycznie, podczas gdy wyodrębniony z niej tekst zmienia się między kolejnymi uruchomieniami OCR. Lepszy model językowy może poprawić akcenty i słowa, ale może też inaczej dzielić złożenia, zmieniać kolejność kolumn lub rozpoznawać cyfry w innym piśmie. W rezultacie hasze fragmentów, sekwencje tokenów, pozycje wektorów i najbliżsi sąsiedzi zmieniają się znacząco na dalszych etapach.
Pakiet językowy zmienia rozpoznaną sekwencję symboli
OCR łączy informacje wizualne z zestawem znaków, leksykonem i modelem sekwencyjnym właściwymi dla danego języka. Aktualizacja tych komponentów może zastępować mylone glify, zmieniać znaki diakrytyczne, łączyć lub dzielić słowa oraz wybierać inny alfabet dla tego samego niejednoznacznego fragmentu.
Framework wielojęzycznego trenowania OCR pokazuje, że trenowanie uwzględniające język zmienia kompletność i odporność OCR dla małego, rozmytego oraz przestrzennie rozproszonego tekstu. Takie ulepszenia z konieczności modyfikują ciągi znaków wykorzystywane przez kolejne etapy wyszukiwania. Różnica ta pozostaje widoczna także podczas późniejszych testów domowych.
Nawet poprawki zmieniają osadzenia, ponieważ kodery inaczej tokenizują nowy ciąg znaków. Jedna poprawiona kropka produktu może mieć większe znaczenie niż kilka zmian interpunkcyjnych, gdy zapytanie zależy od tego identyfikatora, dlatego odległość wektorowa nie przekłada się bezpośrednio na procent błędów znakowych.
Układ i dzielenie na fragmenty wzmacniają niewielkie różnice OCR
Wynik OCR jest zwykle przekształcany w kolejność czytania, akapity, tabele i fragmenty przed utworzeniem osadzeń. Zmieniony podział wiersza lub przypisanie kolumny może przenieść zdania między granicami fragmentów, zastępując znacznie większą część kodowanego kontekstu, niż sugerują same zmienione znaki.
Badania nad przestrzennymi relacjami OCR wskazują, że jednowymiarowa kolejność czytania może zniekształcać relacje przestrzenne między słowami rozpoznanymi przez OCR. Wyjaśnia to, dlaczego zaktualizowane przetwarzanie układu lub języka może reorganizować otoczenie semantyczne, nawet gdy obraz strony pozostaje niezmieniony.
Dzielenie według liczby tokenów wprowadza dodatkową nieciągłość. Jeśli poprawione słowa zajmują inną liczbę tokenów, późniejsze granice przesuwają się, a każdy kolejny wektor może zawierać inną kombinację zdań, dopóki stabilna granica sekcji nie zresetuje tego procesu.
Lepszy wynik OCR nadal może zmniejszyć stabilność wyszukiwania
Ulepszony tekst może przesunąć dokument w stronę właściwego otoczenia semantycznego, ale indeks zawierający mieszane, stare i nowe wektory OCR staje się wewnętrznie niespójny. Zduplikowane strony mogą uzyskiwać różne pozycje wyłącznie dlatego, że przetworzono je za pomocą różnych wersji potoku.
Badanie dotyczące hybrydowego wyszukiwania uwzględniającego OCR ulepsza zaszumiony tekst OCR przed wyszukiwaniem rzadkim i gęstym oraz wykazuje poprawę wyników bez zmiany architektury wyszukiwania. Pokazuje to, że jakość tekstu na wcześniejszym etapie wpływa zarówno na dopasowanie leksykalne, jak i na reprezentację wektorową na dalszym etapie.
Granica błędu polega na przypisywaniu każdej zmiany wektora pakietowi językowemu. Wektory mogą również zmieniać wersje parsera, normalizacja, model osadzania, rozmiar fragmentu, jądra obliczeń zmiennoprzecinkowych oraz kwantyzacja indeksu. Zamroź te etapy i najpierw porównaj wyodrębniony tekst, zanim uznasz OCR za przyczynę.
Wersjonuj i odtwarzaj potok od OCR do osadzeń
Wybierz strony zawierające akcenty, mieszane alfabety, tabele, pismo odręczne, kody produktów oraz czysty tekst jednojęzyczny. Uruchom stare i nowe pakiety językowe na identycznych obrazach, zamrażając parser, normalizator, mechanizm dzielenia na fragmenty, model osadzania, precyzję i ustawienia indeksu. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja przejmie dalsze działania.
Porównaj zmiany znaków i układu z niespójnością OCR, a następnie zarejestruj kolejność czytania, granice fragmentów, liczbę tokenów, przesunięcie cosinusowe, pokrycie najbliższych sąsiadów, czułość wyszukiwania oraz poprawność cytowań. Oddziel ulepszenia od samych różnic między wektorami. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Przebuduj indeks kolekcji w sposób spójny tylko wtedy, gdy nowa wersja OCR poprawia wyniki wyszukiwania lub jakość dowodów na danych odłożonych do testów. Jeśli jakość niektórych języków spada, zachowaj wersjonowane wyniki lub kieruj strony według wykrytego języka; nigdy nie mieszaj nieoznaczonych generacji OCR i nie nazywaj zmian w rankingu dryfem modelu.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak tajny broker przekazuje agentowi AI dane uwierzytelniające bez ujawniania ich w promptach?
Śledź tożsamość obciążenia, zasady, wydawanie tokenów, wstrzykiwanie żądań, redakcję, wygasanie i unieważnianie w ramach bezsekretnej architektury domowego agenta AI.

Jak piaskownica narzędzi ogranicza skutki uboczne działania agenta AI?
Zobacz, jak izolacja, bramki uprawnień, ulotny stan, kontrola ruchu wychodzącego, limity i dzienniki audytowe ograniczają skutki uboczne agentów AI bez dowodzenia, że działania są...

Jak dekodowanie z ograniczeniami generuje JSON zgodny ze schematem?
Zrozum kompilację schematu, maskowanie tokenów, stan parsera, obsługiwane podzbiory, opóźnienia, obcinanie oraz to, dlaczego poprawność strukturalna nie gwarantuje prawidłowych wartości.

