Wyszukiwanie zdjęć za pomocą AI często działa inaczej na różnych urządzeniach, ponieważ ranking, aktualność indeksu, ograniczenia widoku i kontekst interakcji wpływają na to, co pojawia się jako pierwsze.
Wyszukiwanie na telefonie może wyświetlić pięć dużych portretów i zachęcać do stuknięcia, podczas gdy te same słowa na komputerze pokażą dziesiątki mniejszych miniatur, filtry i daty. Biblioteka może być identyczna. Zmienia się jednak kontekst zapytania wysyłanego przez każdego klienta, aktualnie dostępny indeks wyszukiwania, część uporządkowanej listy widoczna bez przewijania oraz sygnały interfejsu kształtujące kolejne doprecyzowanie.
Ekran zmienia część rankingu, której doświadczasz
Wyszukiwanie zwraca uporządkowaną listę kandydatów, ale użytkownicy widzą tylko jej widoczny fragment. Telefon może wyświetlać jedną kolumnę lub kilka dużych kafelków, dlatego trzy pierwsze wyniki dominują w odbiorze. Komputer może jednocześnie pokazać wiele wierszy, znaczniki czasu i filtry boczne. Nawet identyczny ranking będzie więc wydawał się węższy, bardziej osobisty lub mniej kompletny na mniejszym ekranie.
Google Photos umożliwia wyszukiwanie osób, miejsc, obiektów i zapytań w języku naturalnym, a dostępność funkcji może zależeć od ustawień konta, języka i regionu. Aktualny przegląd wyszukiwania zdjęć rozróżnia także edycję z poziomu aplikacji i doświadczenia mobilne od szerszego dostępu na komputerze. Możliwości interfejsu wpływają na to, które kryteria są widoczne i jakie doprecyzowania zapytań odkrywają użytkownicy.
Łańcuch przyczynowy jest prosty: widok określa dostępne dowody, dostępne dowody zmieniają ocenę trafności przez użytkownika, a ta ocena wpływa na kolejne stuknięcie lub zapytanie. Jest to najpierw efekt prezentacji, a dopiero później efekt modelu. Porównywanie wyłącznie pierwszego ekranu może wyolbrzymić różnicę w rankingu, która znika po przewinięciu lub przełączeniu obu klientów na ten sam porządek sortowania.
Aktualność indeksu może się różnić, nawet gdy pliki są zsynchronizowane
To, że zdjęcie stało się widoczne, nie oznacza, że każda funkcja AI je przetworzyła. Przesyłanie, generowanie miniatur, wyodrębnianie metadanych, rozpoznawanie twarzy, tworzenie reprezentacji obiektów, OCR i indeksowanie wyszukiwania mogą działać jako osobne zadania. Telefon może też przechowywać elementy dostępne tylko lokalnie, które nie dotarły jeszcze na serwer, podczas gdy komputer widzi wyłącznie ukończone zasoby serwerowe.
Immich wyjaśnia, że inteligentne wyszukiwanie korzysta z reprezentacji CLIP tworzonych przez usługę uczenia maszynowego. Jeśli nowe zasoby są widoczne, zanim te zadania się zakończą, zwykłe wyszukiwanie według daty lub nazwy pliku może je znaleźć, podczas gdy wyszukiwanie semantyczne nie. Dodatkowe opóźnienie może powodować nieaktualna pamięć podręczna klienta, nawet po przygotowaniu indeksu serwera.
Powstaje wtedy charakterystyczny wzorzec: najnowsze zdjęcia różnią się między urządzeniami, podczas gdy starsze wyniki są zgodne. Model może działać prawidłowo; oba klienty mogą odpytywać różne generacje indeksu lub różne zestawy zasobów. Biblioteka hostowana samodzielnie zyskuje na udostępnianiu stanu zadań i wersji indeksu, aby „przesłane”, „zarchiwizowane” i „wyszukiwalne według znaczenia” były traktowane jako odrębne stany.
Modele działające na urządzeniu mogą dodać drugą warstwę semantyczną
Niektóre aplikacje do zdjęć wykonują rozpoznawanie na urządzeniu ze względu na prywatność, szybkość działania lub funkcje zależne od lokalnego sprzętu. Telefon może dostarczać sygnały dotyczące osób, scen, punktów orientacyjnych lub tekstu, niedostępne dla klienta internetowego, podczas gdy biblioteka hostowana na serwerze korzysta z jednego współdzielonego modelu reprezentacji. Różne wersje modeli, języki lub ścieżki sprzętowe mogą przyporządkować ten sam obraz i zapytanie do nieco innych sąsiedztw semantycznych.
Apple opisało analizę scen na urządzeniu używaną do prywatnego organizowania i selekcjonowania zdjęć. Ten projekt pokazuje, dlaczego „to samo konto” nie zawsze oznacza „tę samą ścieżkę wnioskowania”. Jedno urządzenie może przechowywać pochodne etykiety lub reprezentacje, które nie są przesyłane jako ogólne metadane serwerowe, a inny klient nie może ustalać rankingu na podstawie sygnałów, których nie otrzymuje.
Mechanizm ten przestaje wyjaśniać różnicę, gdy telefon i komputer są cienkimi klientami tego samego interfejsu API serwera i używają tych samych parametrów zapytania. W takiej sytuacji najpierw sprawdź paginację, kolejność sortowania, ukryte filtry, odpowiedzi z pamięci podręcznej i grupowanie wyświetlania. Wydajniejszy sprzęt telefonu nie oznacza automatycznie lepszego modelu wyszukiwania; ma znaczenie tylko wtedy, gdy aplikacja rzeczywiście korzysta z odrębnej lokalnej ścieżki wnioskowania.
Porównuj urządzenia według kontrolowanego protokołu wyszukiwania
Wybierz dziesięć stałych zapytań obejmujących osobę, miejsce, obiekt, fragment tekstu, wydarzenie i opis abstrakcyjny. Upewnij się, że oba klienty korzystają z tego samego konta, biblioteki, języka, filtrów, trybu sortowania i zakresu czasu. Poczekaj na zakończenie zadań serwera, a następnie zapisz identyfikatory dziesięciu najważniejszych zasobów zamiast oceniać zrzuty ekranu. Powtórz test po wyczyszczeniu pamięci podręcznej klienta.
Wspólne wyjaśnienie wyszukiwania semantycznego na serwerze NAS pomaga oddzielić podobieństwo reprezentacji od nazw plików i folderów. Na potrzeby testu oblicz zgodność pierwszych dziesięciu wyników, odnotuj zmiany kolejności i zapisz zasoby obecne tylko u jednego klienta. Następnie porównaj surową odpowiedź API, jeśli jest dostępna, z tym, co renderuje każdy interfejs.
Jeśli identyfikatory zasobów i ich kolejność są zgodne, różnica dotyczy prezentacji. Jeśli starsze zapytania dają zgodne wyniki, ale najnowsze zdjęcia nie, najbardziej prawdopodobnym wyjaśnieniem jest aktualność indeksu. Jeśli rankingi nadal się różnią przy zsynchronizowanym stanie i identycznych parametrach, klienci prawdopodobnie stosują różne sygnały ponownego porządkowania lub modele. Ten protokół zamienia stwierdzenie „działa inaczej” na cztery mierzalne warstwy: korpus, indeks, ranking i renderowanie.
| Zaobserwowana różnica | Najbardziej prawdopodobna warstwa | Kontrola |
|---|---|---|
| Te same identyfikatory, inne wrażenie | Renderowanie | Porównaj identyfikatory dziesięciu pierwszych wyników |
| Brak najnowszych zdjęć | Aktualność indeksu | Poczekaj na zakończenie zadań przetwarzania |
| Różnią się tylko zasoby dostępne wyłącznie w telefonie | Synchronizacja korpusu | Potwierdź zakończenie tworzenia kopii zapasowej |
| Stała różnica w kolejności | Kontekst rankingu | Dopasuj parametry zapytania |
Najczęściej zadawane pytania
Czy mniejszy ekran zwraca mniej wyników?
Niekoniecznie. Serwer może zwracać tę samą liczbę wyników na stronie, podczas gdy interfejs wyświetla mniej elementów przed przewinięciem. Paginacja i leniwe ładowanie mogą jednak wpływać na moment pobierania kolejnych kandydatów.
Czy jakość miniatur może zmienić wyniki wyszukiwania AI?
Tylko jeśli potok wyszukiwania tworzy reprezentacje z miniatur lub innego pochodnego obrazu na jednej ze ścieżek. Jeśli oba klienty odpytują wspólne reprezentacje serwera, rozdzielczość miniatur wpływa bardziej na oglądanie niż na ranking.
Dlaczego wyniki dotyczące osób różnią się najbardziej?
Grupowanie twarzy często zależy od etykiet użytkownika, dostępności regionalnej, przetwarzania lokalnego i ustawień prywatności. Sygnały te mogą różnić się między klientami bardziej niż podstawowe metadane dotyczące daty lub lokalizacji.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak mierzyć jakość lokalnego wyszukiwania RAG oraz interpretować kompletność przywołań, precyzję i pokrycie cytowaniami
Zbuduj lokalny zestaw testowy RAG, oblicz podstawowe metryki wyszukiwania, zinterpretuj kompromisy między nimi i sprawdź, czy twierdzenia zawarte w odpowiedziach są poparte przytoczonymi dowodami.

Dlaczego obliczenia funkcji inteligentnego domu stają się ważniejsze wraz ze wzrostem liczby czujników przy tej samej częstotliwości próbkowania?
Śledź obliczenia dla poszczególnych czujników i między czujnikami wraz ze wzrostem liczby urządzeń, identyfikuj nieliniowe koszty fuzji danych i porównaj wydajność potoku cech, zanim...

Dlaczego koszt oceny RAG rośnie przy tej samej liczbie zapytań wraz z rozbudową biblioteki dokumentów?
Zrozum, dlaczego rozrost korpusu zwiększa nakład pracy na ocenę RAG bez zwiększania liczby zapytań użytkowników oraz jak testy warstwowe utrzymują koszty proporcjonalne do ryzyka.

