Dlaczego wyniki wyszukiwania zdjęć przez AI wyglądają inaczej na telefonie niż na komputerze stacjonarnym?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Wyszukiwanie zdjęć za pomocą AI często działa inaczej na różnych urządzeniach, ponieważ ranking, aktualność indeksu, ograniczenia widoku i kontekst interakcji wpływają na to, co pojawia się jako pierwsze.

Wyszukiwanie na telefonie może wyświetlić pięć dużych portretów i zachęcać do stuknięcia, podczas gdy te same słowa na komputerze pokażą dziesiątki mniejszych miniatur, filtry i daty. Biblioteka może być identyczna. Zmienia się jednak kontekst zapytania wysyłanego przez każdego klienta, aktualnie dostępny indeks wyszukiwania, część uporządkowanej listy widoczna bez przewijania oraz sygnały interfejsu kształtujące kolejne doprecyzowanie.

Ekran zmienia część rankingu, której doświadczasz

Wyszukiwanie zwraca uporządkowaną listę kandydatów, ale użytkownicy widzą tylko jej widoczny fragment. Telefon może wyświetlać jedną kolumnę lub kilka dużych kafelków, dlatego trzy pierwsze wyniki dominują w odbiorze. Komputer może jednocześnie pokazać wiele wierszy, znaczniki czasu i filtry boczne. Nawet identyczny ranking będzie więc wydawał się węższy, bardziej osobisty lub mniej kompletny na mniejszym ekranie.

Google Photos umożliwia wyszukiwanie osób, miejsc, obiektów i zapytań w języku naturalnym, a dostępność funkcji może zależeć od ustawień konta, języka i regionu. Aktualny przegląd wyszukiwania zdjęć rozróżnia także edycję z poziomu aplikacji i doświadczenia mobilne od szerszego dostępu na komputerze. Możliwości interfejsu wpływają na to, które kryteria są widoczne i jakie doprecyzowania zapytań odkrywają użytkownicy.

Łańcuch przyczynowy jest prosty: widok określa dostępne dowody, dostępne dowody zmieniają ocenę trafności przez użytkownika, a ta ocena wpływa na kolejne stuknięcie lub zapytanie. Jest to najpierw efekt prezentacji, a dopiero później efekt modelu. Porównywanie wyłącznie pierwszego ekranu może wyolbrzymić różnicę w rankingu, która znika po przewinięciu lub przełączeniu obu klientów na ten sam porządek sortowania.

Aktualność indeksu może się różnić, nawet gdy pliki są zsynchronizowane

To, że zdjęcie stało się widoczne, nie oznacza, że każda funkcja AI je przetworzyła. Przesyłanie, generowanie miniatur, wyodrębnianie metadanych, rozpoznawanie twarzy, tworzenie reprezentacji obiektów, OCR i indeksowanie wyszukiwania mogą działać jako osobne zadania. Telefon może też przechowywać elementy dostępne tylko lokalnie, które nie dotarły jeszcze na serwer, podczas gdy komputer widzi wyłącznie ukończone zasoby serwerowe.

Immich wyjaśnia, że inteligentne wyszukiwanie korzysta z reprezentacji CLIP tworzonych przez usługę uczenia maszynowego. Jeśli nowe zasoby są widoczne, zanim te zadania się zakończą, zwykłe wyszukiwanie według daty lub nazwy pliku może je znaleźć, podczas gdy wyszukiwanie semantyczne nie. Dodatkowe opóźnienie może powodować nieaktualna pamięć podręczna klienta, nawet po przygotowaniu indeksu serwera.

Powstaje wtedy charakterystyczny wzorzec: najnowsze zdjęcia różnią się między urządzeniami, podczas gdy starsze wyniki są zgodne. Model może działać prawidłowo; oba klienty mogą odpytywać różne generacje indeksu lub różne zestawy zasobów. Biblioteka hostowana samodzielnie zyskuje na udostępnianiu stanu zadań i wersji indeksu, aby „przesłane”, „zarchiwizowane” i „wyszukiwalne według znaczenia” były traktowane jako odrębne stany.

Modele działające na urządzeniu mogą dodać drugą warstwę semantyczną

Niektóre aplikacje do zdjęć wykonują rozpoznawanie na urządzeniu ze względu na prywatność, szybkość działania lub funkcje zależne od lokalnego sprzętu. Telefon może dostarczać sygnały dotyczące osób, scen, punktów orientacyjnych lub tekstu, niedostępne dla klienta internetowego, podczas gdy biblioteka hostowana na serwerze korzysta z jednego współdzielonego modelu reprezentacji. Różne wersje modeli, języki lub ścieżki sprzętowe mogą przyporządkować ten sam obraz i zapytanie do nieco innych sąsiedztw semantycznych.

Apple opisało analizę scen na urządzeniu używaną do prywatnego organizowania i selekcjonowania zdjęć. Ten projekt pokazuje, dlaczego „to samo konto” nie zawsze oznacza „tę samą ścieżkę wnioskowania”. Jedno urządzenie może przechowywać pochodne etykiety lub reprezentacje, które nie są przesyłane jako ogólne metadane serwerowe, a inny klient nie może ustalać rankingu na podstawie sygnałów, których nie otrzymuje.

Mechanizm ten przestaje wyjaśniać różnicę, gdy telefon i komputer są cienkimi klientami tego samego interfejsu API serwera i używają tych samych parametrów zapytania. W takiej sytuacji najpierw sprawdź paginację, kolejność sortowania, ukryte filtry, odpowiedzi z pamięci podręcznej i grupowanie wyświetlania. Wydajniejszy sprzęt telefonu nie oznacza automatycznie lepszego modelu wyszukiwania; ma znaczenie tylko wtedy, gdy aplikacja rzeczywiście korzysta z odrębnej lokalnej ścieżki wnioskowania.

Porównuj urządzenia według kontrolowanego protokołu wyszukiwania

Wybierz dziesięć stałych zapytań obejmujących osobę, miejsce, obiekt, fragment tekstu, wydarzenie i opis abstrakcyjny. Upewnij się, że oba klienty korzystają z tego samego konta, biblioteki, języka, filtrów, trybu sortowania i zakresu czasu. Poczekaj na zakończenie zadań serwera, a następnie zapisz identyfikatory dziesięciu najważniejszych zasobów zamiast oceniać zrzuty ekranu. Powtórz test po wyczyszczeniu pamięci podręcznej klienta.

Wspólne wyjaśnienie wyszukiwania semantycznego na serwerze NAS pomaga oddzielić podobieństwo reprezentacji od nazw plików i folderów. Na potrzeby testu oblicz zgodność pierwszych dziesięciu wyników, odnotuj zmiany kolejności i zapisz zasoby obecne tylko u jednego klienta. Następnie porównaj surową odpowiedź API, jeśli jest dostępna, z tym, co renderuje każdy interfejs.

Jeśli identyfikatory zasobów i ich kolejność są zgodne, różnica dotyczy prezentacji. Jeśli starsze zapytania dają zgodne wyniki, ale najnowsze zdjęcia nie, najbardziej prawdopodobnym wyjaśnieniem jest aktualność indeksu. Jeśli rankingi nadal się różnią przy zsynchronizowanym stanie i identycznych parametrach, klienci prawdopodobnie stosują różne sygnały ponownego porządkowania lub modele. Ten protokół zamienia stwierdzenie „działa inaczej” na cztery mierzalne warstwy: korpus, indeks, ranking i renderowanie.

Zaobserwowana różnica Najbardziej prawdopodobna warstwa Kontrola
Te same identyfikatory, inne wrażenie Renderowanie Porównaj identyfikatory dziesięciu pierwszych wyników
Brak najnowszych zdjęć Aktualność indeksu Poczekaj na zakończenie zadań przetwarzania
Różnią się tylko zasoby dostępne wyłącznie w telefonie Synchronizacja korpusu Potwierdź zakończenie tworzenia kopii zapasowej
Stała różnica w kolejności Kontekst rankingu Dopasuj parametry zapytania

Najczęściej zadawane pytania

Czy mniejszy ekran zwraca mniej wyników?

Niekoniecznie. Serwer może zwracać tę samą liczbę wyników na stronie, podczas gdy interfejs wyświetla mniej elementów przed przewinięciem. Paginacja i leniwe ładowanie mogą jednak wpływać na moment pobierania kolejnych kandydatów.

Czy jakość miniatur może zmienić wyniki wyszukiwania AI?

Tylko jeśli potok wyszukiwania tworzy reprezentacje z miniatur lub innego pochodnego obrazu na jednej ze ścieżek. Jeśli oba klienty odpytują wspólne reprezentacje serwera, rozdzielczość miniatur wpływa bardziej na oglądanie niż na ranking.

Dlaczego wyniki dotyczące osób różnią się najbardziej?

Grupowanie twarzy często zależy od etykiet użytkownika, dostępności regionalnej, przetwarzania lokalnego i ustawień prywatności. Sygnały te mogą różnić się między klientami bardziej niż podstawowe metadane dotyczące daty lub lokalizacji.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.