Dlaczego wyniki wyszukiwania multimodalnego różnią się w przypadku zrzutów ekranu i fotografii?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Wyszukiwanie multimodalne różni się od innych metod, ponieważ zrzuty ekranu kodują tekst i układ interfejsu, podczas gdy fotografie w większym stopniu opierają się na obiektach, scenach, punkcie widzenia i oświetleniu.

Wyszukiwanie hasła „router error” może zwrócić zrzut ekranu, ponieważ OCR rozpoznaje tę frazę, natomiast zapytanie „router behind television” lepiej pasuje do fotografii, na której piksele pokazują obiekty i kontekst przestrzenny. Oba wyniki są obrazami, ale przydatne informacje znajdują się w różnych kanałach. Pojedyncze osadzenie może nierównomiernie równoważyć te kanały w zależności od typu zapytania i przycięcia w tym samym lokalnym indeksie.

Zrzuty ekranu koncentrują znaczenie w tekście i układzie

Zrzuty ekranu zawierają wyraźne znaki, ikony, panele i powtarzalną geometrię interfejsu. Ich obiektem semantycznym może być komunikat o błędzie lub przebieg pracy, a nie fizyczny przedmiot. OCR i analiza układu mogą tworzyć bardzo charakterystyczne tokeny, które zdominują ogólne osadzenie wizualne.

Badanie dotyczące rozumienia zrzutów ekranu traktuje zrzuty ekranu jako odrębny problem, ponieważ tekst, układ i komponenty interfejsu wspólnie niosą znaczenie. Rozpoznawanie wyłącznie naturalnych obrazów pomija znaczną część tej struktury.

Przycięcie zrzutu ekranu może usunąć nazwę aplikacji lub kontekst nawigacji, pozostawiając nienaruszone centralne okno dialogowe. Widoczne słowa nadal pasują, ale system może już nie wiedzieć, który produkt lub etap je wygenerował. Układ jest więc informacją, a nie ozdobą.

Fotografie w większym stopniu zależą od punktu widzenia i statystyk sceny

Fotografie zawierają perspektywę, oświetlenie, zasłonięcia, teksturę i tło. Enkodery wizualne trenowane na parach obraz–opis często mapują te wzorce na ogólne pojęcia. OCR może dodać etykiety z napisów lub urządzeń, ale osadzenie sceny zwykle dostarcza relacji, które nie są zapisane w pikselach.

Prace nad reprezentacjami obraz–tekst pokazują wspólne reprezentacje wyuczone na dużych zbiorach par obraz–tekst. Podejście to przenosi się na zadania związane z naturalnymi obrazami, jednak wyniki nadal odzwierciedlają rozkład danych użyty podczas treningu.

To samo zapytanie może zatem trafić do dwóch ścieżek wyszukiwania: dosłownego dopasowania tekstu w przypadku zrzutów ekranu i semantycznego podobieństwa wizualnego w przypadku fotografii. Wagi fuzji decydują o tym, która ścieżka zwycięży. Zmiana wyników nie musi oznaczać, że jedna z modalności została źle zinterpretowana; może odzwierciedlać różną siłę dowodów.

Gdzie podział na zrzuty ekranu i fotografie przestaje działać

To rozróżnienie zawodzi w przypadku fotografii ekranów, skanowanych plakatów, memów i zrzutów ekranu zawierających duże fotografie. Te hybrydy niosą zarówno sygnały tekstowe, jak i charakterystyczne dla naturalnych obrazów. Sztywna klasyfikacja może odrzucić kanał, który ma największe znaczenie dla zapytania użytkownika.

Badania nad zmianą domeny wizualnej wskazują na przesunięcie domeny, gdy obrazy testowe różnią się od danych treningowych. Obrazy interfejsów i obrazy z aparatu mogą tworzyć dokładnie taką lukę w rozkładzie danych.

Mechanizm ten przestaje mieć zastosowanie również wtedy, gdy wyniki różnią się dlatego, że zrzuty ekranu i fotografie znajdują się w innych folderach, zakresach uprawnień lub harmonogramach indeksowania. Typ treści należy odseparować od metadanych i aktualności indeksu. Większa liczba cech multimodalnych nie poprawia automatycznie rankingu, jeśli fuzja jest źle skalibrowana.

-15% OFF

Oceniaj osobno tekst, obraz i fuzję

Twórz powiązane zapytania dotyczące widocznego tekstu, tożsamości obiektu, relacji przestrzennej, kontekstu aplikacji i daty. Dla każdego z nich oznacz odpowiednie zrzuty ekranu, fotografie i hybrydy. Uruchamiaj wyszukiwanie wyłącznie tekstowe, wyłącznie obrazowe oraz połączone na tym samym zindeksowanym zbiorze, rejestrując kompletność odzyskiwania kandydatów i końcową pozycję według typu nośnika.

Przechowuj zasoby ewaluacyjne razem z artefaktami indeksu wyszukiwania, aby można było lokalnie sprawdzać tekst OCR, osadzenia i uprawnienia. Podczas porównania zamroź migawkę indeksu.

Jeśli wyszukiwanie wyłącznie tekstowe wygrywa w przypadku zapytań dotyczących zrzutów ekranu, popraw ważenie OCR i układu. Jeśli wyszukiwanie wyłącznie obrazowe lepiej rozpoznaje relacje na fotografiach, zachowaj cechy sceny podczas fuzji. Jeśli hybrydy zawodzą w obu przypadkach, kieruj je przez oba kanały. Jeśli pozycje zmieniają się przy identycznych reprezentacjach, sprawdź zamiast tego filtry metadanych lub aktualność indeksu.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.