Wyszukiwanie multimodalne różni się od innych metod, ponieważ zrzuty ekranu kodują tekst i układ interfejsu, podczas gdy fotografie w większym stopniu opierają się na obiektach, scenach, punkcie widzenia i oświetleniu.
Wyszukiwanie hasła „router error” może zwrócić zrzut ekranu, ponieważ OCR rozpoznaje tę frazę, natomiast zapytanie „router behind television” lepiej pasuje do fotografii, na której piksele pokazują obiekty i kontekst przestrzenny. Oba wyniki są obrazami, ale przydatne informacje znajdują się w różnych kanałach. Pojedyncze osadzenie może nierównomiernie równoważyć te kanały w zależności od typu zapytania i przycięcia w tym samym lokalnym indeksie.
Zrzuty ekranu koncentrują znaczenie w tekście i układzie
Zrzuty ekranu zawierają wyraźne znaki, ikony, panele i powtarzalną geometrię interfejsu. Ich obiektem semantycznym może być komunikat o błędzie lub przebieg pracy, a nie fizyczny przedmiot. OCR i analiza układu mogą tworzyć bardzo charakterystyczne tokeny, które zdominują ogólne osadzenie wizualne.
Badanie dotyczące rozumienia zrzutów ekranu traktuje zrzuty ekranu jako odrębny problem, ponieważ tekst, układ i komponenty interfejsu wspólnie niosą znaczenie. Rozpoznawanie wyłącznie naturalnych obrazów pomija znaczną część tej struktury.
Przycięcie zrzutu ekranu może usunąć nazwę aplikacji lub kontekst nawigacji, pozostawiając nienaruszone centralne okno dialogowe. Widoczne słowa nadal pasują, ale system może już nie wiedzieć, który produkt lub etap je wygenerował. Układ jest więc informacją, a nie ozdobą.
Fotografie w większym stopniu zależą od punktu widzenia i statystyk sceny
Fotografie zawierają perspektywę, oświetlenie, zasłonięcia, teksturę i tło. Enkodery wizualne trenowane na parach obraz–opis często mapują te wzorce na ogólne pojęcia. OCR może dodać etykiety z napisów lub urządzeń, ale osadzenie sceny zwykle dostarcza relacji, które nie są zapisane w pikselach.
Prace nad reprezentacjami obraz–tekst pokazują wspólne reprezentacje wyuczone na dużych zbiorach par obraz–tekst. Podejście to przenosi się na zadania związane z naturalnymi obrazami, jednak wyniki nadal odzwierciedlają rozkład danych użyty podczas treningu.
To samo zapytanie może zatem trafić do dwóch ścieżek wyszukiwania: dosłownego dopasowania tekstu w przypadku zrzutów ekranu i semantycznego podobieństwa wizualnego w przypadku fotografii. Wagi fuzji decydują o tym, która ścieżka zwycięży. Zmiana wyników nie musi oznaczać, że jedna z modalności została źle zinterpretowana; może odzwierciedlać różną siłę dowodów.
Gdzie podział na zrzuty ekranu i fotografie przestaje działać
To rozróżnienie zawodzi w przypadku fotografii ekranów, skanowanych plakatów, memów i zrzutów ekranu zawierających duże fotografie. Te hybrydy niosą zarówno sygnały tekstowe, jak i charakterystyczne dla naturalnych obrazów. Sztywna klasyfikacja może odrzucić kanał, który ma największe znaczenie dla zapytania użytkownika.
Badania nad zmianą domeny wizualnej wskazują na przesunięcie domeny, gdy obrazy testowe różnią się od danych treningowych. Obrazy interfejsów i obrazy z aparatu mogą tworzyć dokładnie taką lukę w rozkładzie danych.
Mechanizm ten przestaje mieć zastosowanie również wtedy, gdy wyniki różnią się dlatego, że zrzuty ekranu i fotografie znajdują się w innych folderach, zakresach uprawnień lub harmonogramach indeksowania. Typ treści należy odseparować od metadanych i aktualności indeksu. Większa liczba cech multimodalnych nie poprawia automatycznie rankingu, jeśli fuzja jest źle skalibrowana.
Oceniaj osobno tekst, obraz i fuzję
Twórz powiązane zapytania dotyczące widocznego tekstu, tożsamości obiektu, relacji przestrzennej, kontekstu aplikacji i daty. Dla każdego z nich oznacz odpowiednie zrzuty ekranu, fotografie i hybrydy. Uruchamiaj wyszukiwanie wyłącznie tekstowe, wyłącznie obrazowe oraz połączone na tym samym zindeksowanym zbiorze, rejestrując kompletność odzyskiwania kandydatów i końcową pozycję według typu nośnika.
Przechowuj zasoby ewaluacyjne razem z artefaktami indeksu wyszukiwania, aby można było lokalnie sprawdzać tekst OCR, osadzenia i uprawnienia. Podczas porównania zamroź migawkę indeksu.
Jeśli wyszukiwanie wyłącznie tekstowe wygrywa w przypadku zapytań dotyczących zrzutów ekranu, popraw ważenie OCR i układu. Jeśli wyszukiwanie wyłącznie obrazowe lepiej rozpoznaje relacje na fotografiach, zachowaj cechy sceny podczas fuzji. Jeśli hybrydy zawodzą w obu przypadkach, kieruj je przez oba kanały. Jeśli pozycje zmieniają się przy identycznych reprezentacjach, sprawdź zamiast tego filtry metadanych lub aktualność indeksu.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego ciepło generowane przez lokalną sztuczną inteligencję odczuwa się inaczej na otwartej półce niż w zamkniętej szafce?
Śledź wytwarzanie ciepła, wymianę powietrza i recyrkulację w przypadku instalacji otwartych i zamkniętych, a następnie zmierz zmienne, które je od siebie odróżniają.

Dlaczego serwer domowy wydaje się cichszy w nocy, nawet przy tej samej prędkości wentylatora?
Zrozum, dlaczego niezmieniona prędkość wentylatora nie gwarantuje niezmiennej głośności odbieranej przez człowieka oraz jak odróżnić maskowanie, warunki panujące w pomieszczeniu i rzeczywistą zmianę akustyczną.

Dlaczego zdeduplikowane kopie zapasowe wyglądają na mniejsze niż zajmowane miejsce po przywróceniu?
Dowiedz się, jak deduplikacja zmienia liczbę przechowywanych bajtów, ale nie zmienia przywróconego znaczenia, dlaczego pliki rzadkie i skompresowane komplikują obliczanie sum oraz jak dobrać...

