Wyszukiwanie wizualne może pomijać małe obiekty po ponownym wygenerowaniu miniatur, gdy nowa ścieżka wstępnego przetwarzania usuwa piksele lub kontekst wcześniej zakodowany w reprezentacji wektorowej.
Rodzinne zdjęcie może zawierać rower, etykietę, zwierzę lub narzędzie zajmujące tylko niewielki obszar oryginalnego obrazu. Jeśli usługa fotograficzna ponownie generuje podglądy przy użyciu innego kadrowania, sposobu obsługi orientacji, rozdzielczości lub ustawień kompresji, model wizyjny otrzymuje inne dane wejściowe, mimo że oryginalny plik pozostaje niezmieniony. Skuteczny rozmiar obiektu i otaczający go kontekst decydują o tym, czy szczegół ten zachowa się w reprezentacji wektorowej.
Geometria miniatur określa, ile pikseli obiektu zostanie zachowanych
Enkodery wizyjne zwykle zmieniają rozmiar danych wejściowych do ustalonego kwadratowego lub prostokątnego tensora. Mały obiekt zajmujący w oryginale 30 pikseli może zmniejszyć się poniżej użytecznej skali cech, a centralne kadrowanie może całkowicie usunąć obiekt znajdujący się przy krawędzi.
dzielenie obrazu na fragmenty na potrzeby wnioskowania o małych obiektach dzieli duże obrazy na nakładające się regiony przed detekcją, dzięki czemu małe obiekty zachowują więcej pikseli na wejściu modelu. Odnotowane wzrosty skuteczności pokazują, że zmniejszanie całej klatki może usuwać użyteczne szczegóły, nawet gdy oryginalna rozdzielczość jest wysoka.
Zasady dopasowania, wypełnienia i centralnego kadrowania nie są równoważne. Dopasowanie zachowuje całą klatkę z marginesami, wypełnienie może przycinać krawędzie, a obsługa orientacji może obracać obraz przed kadrowaniem lub po nim. Ponowne generowanie zmienia wyniki wyszukiwania, gdy którakolwiek z tych operacji różni się od tej użytej przy tworzeniu poprzedniej reprezentacji wektorowej.
Cechy wieloskalowe nie mogą odzyskać odrzuconych pikseli
Nowoczesne systemy wizyjne łączą szczegółowe mapy przestrzenne z głębszymi cechami semantycznymi, co pomaga rozpoznawać obiekty w kilku skalach. Reprezentacja nadal zaczyna się od miniatury przekazanej do enkodera; informacje usunięte podczas zmiany rozmiaru lub kompresji nie są dostępne dla późniejszych warstw.
wieloskalowe piramidy cech tworzą piramidę cech odgórnych z połączeniami bocznymi, dzięki czemu silne semantycznie cechy są dostępne w wielu rozdzielczościach. Mechanizm ten wyjaśnia, dlaczego rozpoznawanie małych obiektów korzysta ze szczegółowych map przestrzennych zamiast jednej zgrubnej reprezentacji.
Globalna reprezentacja wektorowa obrazu może koncentrować się na dominującej scenie i ignorować niewielki przedmiot, nawet jeśli detektor potrafi go znaleźć. Potoki wyszukiwania wymagające wysokiej skuteczności na poziomie obiektów mogą potrzebować kafelków, reprezentacji regionów lub podpisów wykrytych obiektów oprócz pojedynczego wektora całej miniatury.
Kompresja i normalizacja zmieniają podobieństwa graniczne
Kwantyzacja JPEG, wyostrzanie, konwersja kolorów, kompozycja alfa i filtry ponownego próbkowania zmieniają lokalne krawędzie oraz teksturę. Duże obiekty pozostają stabilne semantycznie, ale mały obiekt znajdujący się blisko progu rozpoznania przez model może zmienić się na tyle, by spaść poniżej progu wyszukiwania.
skupione regiony o wysokiej rozdzielczości kierują przetwarzanie w wysokiej rozdzielczości na obiecujące regiony z małymi obiektami, zamiast stosować kosztowną piramidę obrazu wszędzie. Konstrukcja od zgrubnego do szczegółowego pokazuje, że przydzielenie pikseli odpowiedniemu regionowi może zachować dokładność przy mniejszym łącznym koszcie przetwarzania.
Granica błędu polega na założeniu, że każda zmiana wyniku jest wadą miniatury. Nowy model tworzenia reprezentacji wektorowych, zmieniony enkoder zapytania, ponowne utworzenie indeksu lub rywalizacja w rankingu top-k również mogą zmienić kolejność wyników. Przed przypisaniem przyczyny porównaj stare i nowe miniatury za pomocą tego samego zamrożonego modelu i indeksu.
Przeprowadź test wyszukiwania oryginału i miniatury
Wybierz pięćdziesiąt zdjęć zawierających małe obiekty umieszczone na środku, przy krawędziach, w ciemnych obszarach i na zagraconych tłach. Zapisz poprzednie miniatury, wygeneruj je ponownie i zanotuj wymiary, pola kadrowania, orientację, kodek, jakość, profil kolorów oraz skróty plików dla obu wersji.
Użyj metody przetwarzania regionów opisanej w przetwarzaniu uwzględniającym regiony, aby porównać reprezentacje wektorowe oryginalnego obrazu, starej miniatury, nowej miniatury i kafelków przy użyciu tych samych zapytań i indeksu. Śledź liczbę pikseli obiektu, skuteczność top-k, zmiany pozycji w rankingu oraz pominięcia według lokalizacji i rozmiaru obiektu.
Zachowaj ponownie wygenerowane miniatury tylko wtedy, gdy osiągają wymagany poziom skuteczności wyszukiwania małych obiektów przy zakładanym koszcie przechowywania i obliczeń. Jeśli globalne podglądy nadal są niewystarczające, dodaj reprezentacje wektorowe regionów dla wybranych zdjęć, zamiast twierdzić, że wyższa rozdzielczość miniatur gwarantuje wyszukiwanie obiektów.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego pobór mocy GPU gwałtownie wzrasta na początku lokalnego żądania wnioskowania?
Zobacz, jak zwiększanie taktowania GPU, wstępne przetwarzanie modelu, inicjalizacja jądra, przydzielanie pamięci i odstępy między próbkowaniami powodują skoki poboru mocy na początku wnioskowania.

Dlaczego ranking wyszukiwania wektorowego zmienia się, gdy jednocześnie przeszukiwanych jest wiele segmentów indeksu?
Dowiedz się, jak limity kandydatów dla poszczególnych segmentów, przybliżone grafy, kalibracja wyników, aktualizacje i konsolidacja zmieniają ranking prywatnego wyszukiwania wektorowego.

Dlaczego grupy duplikatów zdjęć dzielą się po edycji metadanych?
Zobacz, jak dokładne skróty, skróty percepcyjne, orientacja EXIF, znaczniki czasu, wartości progowe i wersje potoku powodują podział prywatnych grup duplikatów zdjęć.

