Dlaczego wyszukiwanie wizualne pomija małe obiekty po ponownym wygenerowaniu miniatur zdjęć?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Wyszukiwanie wizualne może pomijać małe obiekty po ponownym wygenerowaniu miniatur, gdy nowa ścieżka wstępnego przetwarzania usuwa piksele lub kontekst wcześniej zakodowany w reprezentacji wektorowej.

Rodzinne zdjęcie może zawierać rower, etykietę, zwierzę lub narzędzie zajmujące tylko niewielki obszar oryginalnego obrazu. Jeśli usługa fotograficzna ponownie generuje podglądy przy użyciu innego kadrowania, sposobu obsługi orientacji, rozdzielczości lub ustawień kompresji, model wizyjny otrzymuje inne dane wejściowe, mimo że oryginalny plik pozostaje niezmieniony. Skuteczny rozmiar obiektu i otaczający go kontekst decydują o tym, czy szczegół ten zachowa się w reprezentacji wektorowej.

Geometria miniatur określa, ile pikseli obiektu zostanie zachowanych

Enkodery wizyjne zwykle zmieniają rozmiar danych wejściowych do ustalonego kwadratowego lub prostokątnego tensora. Mały obiekt zajmujący w oryginale 30 pikseli może zmniejszyć się poniżej użytecznej skali cech, a centralne kadrowanie może całkowicie usunąć obiekt znajdujący się przy krawędzi.

dzielenie obrazu na fragmenty na potrzeby wnioskowania o małych obiektach dzieli duże obrazy na nakładające się regiony przed detekcją, dzięki czemu małe obiekty zachowują więcej pikseli na wejściu modelu. Odnotowane wzrosty skuteczności pokazują, że zmniejszanie całej klatki może usuwać użyteczne szczegóły, nawet gdy oryginalna rozdzielczość jest wysoka.

Zasady dopasowania, wypełnienia i centralnego kadrowania nie są równoważne. Dopasowanie zachowuje całą klatkę z marginesami, wypełnienie może przycinać krawędzie, a obsługa orientacji może obracać obraz przed kadrowaniem lub po nim. Ponowne generowanie zmienia wyniki wyszukiwania, gdy którakolwiek z tych operacji różni się od tej użytej przy tworzeniu poprzedniej reprezentacji wektorowej.

Cechy wieloskalowe nie mogą odzyskać odrzuconych pikseli

Nowoczesne systemy wizyjne łączą szczegółowe mapy przestrzenne z głębszymi cechami semantycznymi, co pomaga rozpoznawać obiekty w kilku skalach. Reprezentacja nadal zaczyna się od miniatury przekazanej do enkodera; informacje usunięte podczas zmiany rozmiaru lub kompresji nie są dostępne dla późniejszych warstw.

wieloskalowe piramidy cech tworzą piramidę cech odgórnych z połączeniami bocznymi, dzięki czemu silne semantycznie cechy są dostępne w wielu rozdzielczościach. Mechanizm ten wyjaśnia, dlaczego rozpoznawanie małych obiektów korzysta ze szczegółowych map przestrzennych zamiast jednej zgrubnej reprezentacji.

Globalna reprezentacja wektorowa obrazu może koncentrować się na dominującej scenie i ignorować niewielki przedmiot, nawet jeśli detektor potrafi go znaleźć. Potoki wyszukiwania wymagające wysokiej skuteczności na poziomie obiektów mogą potrzebować kafelków, reprezentacji regionów lub podpisów wykrytych obiektów oprócz pojedynczego wektora całej miniatury.

Kompresja i normalizacja zmieniają podobieństwa graniczne

Kwantyzacja JPEG, wyostrzanie, konwersja kolorów, kompozycja alfa i filtry ponownego próbkowania zmieniają lokalne krawędzie oraz teksturę. Duże obiekty pozostają stabilne semantycznie, ale mały obiekt znajdujący się blisko progu rozpoznania przez model może zmienić się na tyle, by spaść poniżej progu wyszukiwania.

skupione regiony o wysokiej rozdzielczości kierują przetwarzanie w wysokiej rozdzielczości na obiecujące regiony z małymi obiektami, zamiast stosować kosztowną piramidę obrazu wszędzie. Konstrukcja od zgrubnego do szczegółowego pokazuje, że przydzielenie pikseli odpowiedniemu regionowi może zachować dokładność przy mniejszym łącznym koszcie przetwarzania.

Granica błędu polega na założeniu, że każda zmiana wyniku jest wadą miniatury. Nowy model tworzenia reprezentacji wektorowych, zmieniony enkoder zapytania, ponowne utworzenie indeksu lub rywalizacja w rankingu top-k również mogą zmienić kolejność wyników. Przed przypisaniem przyczyny porównaj stare i nowe miniatury za pomocą tego samego zamrożonego modelu i indeksu.

Przeprowadź test wyszukiwania oryginału i miniatury

Wybierz pięćdziesiąt zdjęć zawierających małe obiekty umieszczone na środku, przy krawędziach, w ciemnych obszarach i na zagraconych tłach. Zapisz poprzednie miniatury, wygeneruj je ponownie i zanotuj wymiary, pola kadrowania, orientację, kodek, jakość, profil kolorów oraz skróty plików dla obu wersji.

Użyj metody przetwarzania regionów opisanej w przetwarzaniu uwzględniającym regiony, aby porównać reprezentacje wektorowe oryginalnego obrazu, starej miniatury, nowej miniatury i kafelków przy użyciu tych samych zapytań i indeksu. Śledź liczbę pikseli obiektu, skuteczność top-k, zmiany pozycji w rankingu oraz pominięcia według lokalizacji i rozmiaru obiektu.

Zachowaj ponownie wygenerowane miniatury tylko wtedy, gdy osiągają wymagany poziom skuteczności wyszukiwania małych obiektów przy zakładanym koszcie przechowywania i obliczeń. Jeśli globalne podglądy nadal są niewystarczające, dodaj reprezentacje wektorowe regionów dla wybranych zdjęć, zamiast twierdzić, że wyższa rozdzielczość miniatur gwarantuje wyszukiwanie obiektów.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.