Jakie funkcje umożliwiają multimodalne wyszukiwanie wśród zdjęć, zrzutów ekranu i plików PDF?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Wyszukiwanie multimodalne działa wtedy, gdy każdy plik staje się porównywalnym źródłem dowodów, bez pomijania charakterystycznych dla danego formatu sygnałów wizualnych, tekstowych, przestrzennych i dotyczących pochodzenia.

Archiwum rodzinne może zawierać sfotografowany paragon, zrzut ekranu z potwierdzeniem płatności oraz wyciąg w formacie PDF opisujący ten sam zakup. OCR znajduje słowa, ale może pominąć logotypy, układ, obiekty oraz relację między etykietą a jej wartością. Użyteczne wyszukiwanie między formatami łączy ekstrakcję właściwą dla danej modalności ze wspólnymi osadzeniami, indeksowaniem na poziomie regionów, fuzją metadanych oraz rozwiązywalnymi odnośnikami prowadzącymi z powrotem do oryginalnego zasobu.

Przetwarzanie uwzględniające modalność zachowuje różne rodzaje dowodów

Zdjęcia wymagają przetwarzania orientacji, obiektów, scen i OCR; zrzuty ekranu kładą nacisk na tekst interfejsu i ikony; pliki PDF wymagają renderowania stron oraz natywnej ekstrakcji tekstu i układu. Traktowanie wszystkich trzech formatów jak zwykłego tekstu usuwa właśnie te sygnały, które są potrzebne, gdy treść jest niekompletna.

wspólna przestrzeń obrazu i tekstu uczy się wspólnej przestrzeni na podstawie par obrazów i tekstu, dzięki czemu zapytanie tekstowe może odnajdywać treści wizualne bez dokładnego podpisu. Ta sama zasada wspiera wyszukiwanie między formatami, ale systemy domowe nadal potrzebują OCR i metadanych do dokładnego rozpoznawania nazw, dat i kodów.

Każdy element pochodny powinien zachowywać identyfikator zasobu, współrzędne strony lub regionu, wersję parsera, czas przechwycenia oraz ścieżkę źródłową. Te pola pozwalają interfejsowi wyróżnić dopasowany obszar i zapobiegają temu, by osadzenie miniatury stało się nieśledzalnym źródłem odpowiedzi.

Regiony i strony potrzebują własnych jednostek wyszukiwania

Jeden wektor całego obrazu może rozmywać kilka niezwiązanych ze sobą elementów: zrzut ekranu może zawierać czat, pasek stanu i zdjęcie produktu, a strona PDF może zawierać diagram obok tabeli. Wycięcia regionów i jednostki na poziomie stron zachowują lokalne znaczenie, dzięki czemu można je przeszukiwać.

Metoda wizualnego wyszukiwania dokumentów przedstawia strony dokumentów wizualnie i wykorzystuje późną interakcję do dopasowywania tokenów zapytania do fragmentów stron. Jej konstrukcja pokazuje, jak można przeszukiwać bogate układowo pliki PDF bez redukowania każdej strony do jednego globalnego wektora.

Indeksowane jednostki powinny nakładać się na siebie tylko wtedy, gdy wymaga tego ciągłość, a następnie dziedziczyć uprawnienia i informacje o pochodzeniu od elementu nadrzędnego. Nadmierne kadrowanie tworzy zduplikowane wyniki, natomiast zbyt ogólne strony obniżają precyzję; warstwa deduplikacji może po wyszukiwaniu grupować regiony pochodzące z tego samego zasobu.

Fuzja i ponowne szeregowanie uzgadniają nieporównywalne sygnały

BM25 dla tekstu, osadzenia OCR, osadzenia wizualne, nazwy plików, znaczniki czasu, twarze i kontekst folderów generują wyniki w różnych skalach. Fuzja rankingów łączy niezależne listy kandydatów, a multimodalny model ponownego szeregowania może analizować najsilniejszych kandydatów w bogatszym kontekście.

cel dopasowania obrazu i tekstu pokazuje, że dopasowanie obrazu i tekstu zależy nie tylko od architektury modelu, lecz także od funkcji celu treningu i skali danych. Pomaga to wyjaśnić, dlaczego dwa modele wspólnych osadzeń mogą różnie porządkować zrzuty ekranu i fotografie.

Granicą zawodności jest nieuzasadniona pewność w wyszukiwaniu między modalnościami. Wizualnie podobny logotyp nie może potwierdzić sumy na fakturze, a tekst OCR nie może zidentyfikować obiektu nieobecnego na obrazie. Wyniki powinny wskazywać, która modalność zapewniła dopasowanie, a przy słabej kalibracji wyników należy przechodzić do osobnych grup rezultatów.

Zbuduj macierz wyszukiwania między formatami

Wybierz trzydzieści rzeczywistych pojęć reprezentowanych przez zdjęcia, zrzuty ekranu, pliki PDF utworzone cyfrowo i skanowane pliki PDF. Przygotuj zapytania tekstowe, wizualne, dotyczące nazw plików, dat oraz zapytania mieszane, a następnie oznacz każdy akceptowalny zasób i dokładną stronę lub region zawierający dowody.

Wykorzystaj rozróżnienie modalności opisane w artykule wyszukiwanie zrzutów ekranu i zdjęć, aby raportować Recall@10 i precyzję osobno dla zrzutów ekranu i fotografii. Powtórz testy wyłącznie z OCR, wyłącznie z osadzeniami wizualnymi, wyłącznie z metadanymi, z wyszukiwaniem po fuzji oraz z multimodalnym ponownym szeregowaniem, rejestrując przy tym opóźnienie i odsetek zduplikowanych wyników.

Test można zaliczyć tylko wtedy, gdy każda ważna klasa zapytań zwraca możliwe do sprawdzenia źródłowe regiony, a filtry uprawnień pozostają nienaruszone. Jeśli fuzja zwiększa średni poziom odnajdywania, ale ukrywa dopasowania dokładnych kodów, zachowaj osobny tor leksykalny zamiast zmuszać każdy format do korzystania z jednego wyniku.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.