Dlaczego etykiety zdjęć generowane przez AI zmieniają się po aktualizacji modelu?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Etykiety zdjęć generowane przez AI zmieniają się po aktualizacji, ponieważ nowy model inaczej reprezentuje obrazy, porównuje etykiety i stosuje granice ufności niż poprzedni model.

Samodzielnie hostowana biblioteka zdjęć może zachować te same oryginalne pliki, podczas gdy po aktualizacji zmienią się terminy inteligentnego wyszukiwania, wykryte obiekty, grupy twarzy, sugestie duplikatów lub etykiety scen. Etykiety te są rekordami pochodnymi w bazie danych, a nie faktami zapisanymi na stałe w obrazie. Gdy zmieni się koder wizualny, koder tekstu, słownik klas, próg, potok wstępnego przetwarzania lub reguła klastrowania, system ponownie oblicza, do której kategorii należy zdjęcie.

Etykieta zdjęcia jest decyzją modelu, a nie trwałymi metadanymi

Znaczniki czasu aparatu i nazwy plików można odczytać z zapisanych danych, ale etykiety takie jak „plaża”, „pies”, „urodziny” czy „pojazd” są przewidywaniami wygenerowanymi przez konkretną wersję modelu i określoną konfigurację.

Amazon Rekognition zwraca wraz z wynikami wersję modelu wykrywania etykiet, ponieważ wersja jest częścią znaczenia przewidywania. Usługa udostępnia również aliasy, kategorie i wartości ufności, zamiast traktować pojedynczy ciąg znaków etykiety jako niezmienną właściwość.

Lokalny system zdjęć powinien zachowywać tę samą informację o pochodzeniu danych. Bez nazwy i wersji modelu, ustawień wstępnego przetwarzania oraz czasu wykonania zadania administrator nie może stwierdzić, czy zmieniona etykieta wynika z nowego modelu, innego progu czy uszkodzonego indeksu.

Nowe osadzenia tworzą inną przestrzeń podobieństwa

Systemy inteligentnego wyszukiwania zwykle przekształcają każde zdjęcie w wektor. Zapytania tekstowe i potencjalne pojęcia są mapowane do tej samej przestrzeni, a etykiety lub wyniki wyszukiwania zależą od tego, które elementy znajdują się najbliżej siebie.

Qdrant wyjaśnia, że nawet niewielkie zmiany modelu osadzeń mogą przesunąć geometrię przestrzeni wektorowej, co wymaga ponownego osadzenia danych i ponownego zindeksowania w celu zapewnienia dokładnych porównań.

Stare i nowe wektory nie są wzajemnie wymiennymi wynikami. Zdjęcie znajdujące się blisko pojęcia „ogród” w jednej przestrzeni może przesunąć się bliżej pojęcia „park” lub „podwórko” w innej, nawet jeśli oba modele przedstawiają rozsądny opis sceny.

Słowa kandydujące i prompty zmieniają zwycięską etykietę

Klasyfikacja zero-shot nie odkrywa jednej uniwersalnej etykiety niezależnie od języka. Porównuje obraz z dostarczonymi etykietami kandydującymi lub promptami tekstowymi i szereguje te alternatywy.

Proces klasyfikacji obrazów zero-shot w Hugging Face wyraźnie tworzy prompty z etykietami kandydującymi, takie jak „To jest zdjęcie …”, a następnie porównuje je z obrazem.

Aktualizacja może dodać etykiety, zmienić ich nazwy, przetłumaczyć je lub zmienić szablony promptów. Dodanie etykiety „golden retriever” może zastąpić szerszą etykietę „pies”, natomiast usunięcie wąskiej klasy może sprawić, że ten sam obraz otrzyma ogólną etykietę „zwierzę”.

Hierarchie etykiet zmieniają poziom szczegółowości

Etykiety zdjęć często tworzą relacje nadrzędna-podrzędna: pojazd, samochód, samochód sportowy; jedzenie, deser, ciasto. System może wyświetlać najwęższą klasę, klasę nadrzędną lub kilka poziomów, zależnie od modelu i interfejsu.

Badania CHiLS pokazują, że hierarchiczne zestawy etykiet mogą zmieniać klasyfikację przez generowanie podklas, a następnie mapowanie przewidywań z powrotem na kategorie nadrzędne.

Zaktualizowana ontologia może więc sprawić, że etykiety będą bardziej szczegółowe lub bardziej ogólne, bez jednoznacznego spadku dokładności. Podczas audytu należy porównywać hierarchię i reguły mapowania, a nie tylko sprawdzać, czy stary ciąg znaków nadal występuje.

Progi ufności decydują, które etykiety będą widoczne

Modele zwykle zwracają kilka kandydatów wraz z wynikami. Aplikacja decyduje, ile z nich zapisać oraz jaka minimalna wartość ufności jest wymagana, aby etykieta pojawiła się w wyszukiwaniu lub w widoku szczegółów zdjęcia.

Zmiana progu może ukryć etykiety graniczne albo ujawnić znacznie więcej słabych dopasowań. Model, którego kalibracja wyników różni się od poprzednika, może wymagać innego progu, nawet jeśli lepiej szereguje wyniki.

Podczas oceny przechowuj surowe wyniki lub wyniki dla k najlepszych kandydatów, a następnie wybieraj progi wyświetlania dla każdej wersji modelu. Ponowne użycie jednego progu liczbowego dla niezwiązanych ze sobą modeli może sprawić, że aktualizacja będzie wyglądać na niestabilną, choć rzeczywistym problemem jest kalibracja wyników.

Grupy twarzy mogą się zmienić, nawet jeśli etykiety obiektów pozostaną bez zmian

Rozpoznawanie twarzy zwykle tworzy osadzenia wykrytych twarzy i grupuje bliskie punkty w osoby. Nowy detektor może zmienić wycinek obrazu, a nowy model rozpoznawania zmienia odległości między wektorami twarzy.

DBSCAN grupuje punkty na podstawie promienia sąsiedztwa i minimalnej gęstości; parametry odległości i gęstości decydują o tym, czy twarz zostanie przypisana do osoby, utworzy inną grupę czy pozostanie elementem odstającym.

Zmiany modelu i zmiany klastrowania należy audytować osobno. Lepszy wycinek twarzy może rozdzielić wcześniej połączoną osobę, a luźniejszy próg odległości może połączyć krewnych o podobnym wyglądzie.

Częściowe ponowne przetwarzanie miesza dwie generacje etykiet

Jeśli tylko nowe zdjęcia zostaną przetworzone za pomocą zaktualizowanego modelu, biblioteka będzie jednocześnie zawierać starą i nową przestrzeń semantyczną. Wyniki wyszukiwania i etykiety mogą różnić się w zależności od tego, kiedy dany zasób trafił do systemu.

Immich zaleca administratorom ponowne przetworzenie wszystkich zasobów po zmianie modelu inteligentnego wyszukiwania i informuje, że niezgodne dane z poprzedniego modelu mogą w przeciwnym razie powodować błędy.

Użyj wersjonowanej przebudowy lub drugiego indeksu, sprawdź ukończenie procesu, a następnie atomowo przełącz wyszukiwanie. Nie usuwaj starego indeksu, dopóki nowa generacja nie będzie zawierać kompletnej liczby zasobów i nie przejdzie testów jakości wyszukiwania.

Wersjonuj przewidywania i chroń ręczne poprawki

Przechowuj etykiety generowane przez model oddzielnie od albumów tworzonych przez użytkownika, ręcznych tagów, nazwanych osób i decyzji o ukrywaniu etykiet. Automatyczna przebudowa nie powinna po cichu nadpisywać sposobu organizacji danych przez użytkownika.

Przed wdrożeniem oceń stały zestaw reprezentatywnych zdjęć. Porównaj dodane i usunięte etykiety, zmiany kolejności, fałszywe trafienia, rozdzielenia i połączenia twarzy oraz zapytania wyszukiwania istotne dla domowników.

Artykuł ZimaSpace dotyczący tego, jak zmiana rozdzielczości obrazu wpływa na obciążenie multimodalnej AI, dodaje jeszcze jedną zmienną: rozdzielczość wstępnego przetwarzania i sposób kadrowania mogą zmienić informacje wizualne dostarczane zaktualizowanemu modelowi.

FAQ

Czy zmieniona etykieta oznacza, że nowy model jest gorszy?

Nie. Może on używać innego słownika albo wybierać bardziej szczegółową klasę w relacji nadrzędna-podrzędna. Dokładność należy oceniać na podstawie reprezentatywnych zdjęć i zamierzonych zadań wyszukiwania.

Czy stare etykiety AI należy natychmiast usunąć?

Nie. Zachowaj starą generację do czasu zakończenia ponownego przetwarzania i porównania. Wersjonowane etykiety umożliwiają wycofanie zmian i analizę regresji.

Czy ręczne tagi zdjęć przetrwają aktualizacje modelu?

Tak, jeśli ręczne tagi są przechowywane oddzielnie od wygenerowanych przewidywań, a zadania przebudowy ograniczają się do pól zarządzanych przez model.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.