Varför ändras AI-fototaggar efter en modelluppgradering?

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

AI-fotoetiketter ändras efter en uppgradering eftersom den nya modellen representerar bilder, jämför etiketter och tillämpar konfidensgränser på ett annat sätt än den gamla modellen.

Ett självhostat fotobibliotek kan behålla samma originalfiler medan smarta söktermer, upptäckta objekt, ansiktsgrupper, förslag på dubbletter eller scenetiketter ändras efter en uppdatering. Dessa etiketter är härledda poster i databasen, inte fakta som skrivits permanent i bilden. När den visuella kodaren, textkodaren, klassvokabulären, tröskelvärdet, förbehandlingskedjan eller klustringsregeln ändras räknar systemet om var ett foto hör hemma.

En fotoetikett är ett modellbeslut, inte permanenta metadata

Kameratidsstämplar och filnamn kan läsas från lagrade data, men etiketter som ”strand”, ”hund”, ”födelsedag” eller ”fordon” är förutsägelser som produceras av en viss modellversion och konfiguration.

Amazon Rekognition returnerar versionen av modellen för etikettidentifiering tillsammans med resultaten, eftersom versionen är en del av förutsägelsens betydelse. Tjänsten visar även alias, kategorier och konfidensvärden i stället för att behandla en enskild etikettsträng som en oföränderlig egenskap.

Ett lokalt fotosystem bör bevara samma ursprungsinformation. Utan modellnamn, version, förbehandlingsinställningar och tidpunkt för körningen kan en administratör inte avgöra om en ändrad etikett beror på en ny modell, ett annat tröskelvärde eller ett skadat index.

Nya inbäddningar skapar ett annat likhetsutrymme

Smarta söksystem omvandlar vanligtvis varje bild till en vektor. Textfrågor och möjliga begrepp mappas till samma utrymme, och etiketter eller sökresultat beror på vilka objekt som ligger närmast.

Qdrant förklarar att även små ändringar av inbäddningsmodellen kan förskjuta vektorrummets geometri, vilket kräver att data bäddas in på nytt och indexeras om för korrekta jämförelser.

De gamla och nya vektorerna är inte jämförbara poäng. Ett foto som ligger nära ”trädgård” i ett utrymme kan flytta sig närmare ”park” eller ”bakgård” i ett annat, även när båda modellerna ger rimliga beskrivningar av scenen.

Kandidatord och promptar avgör vilket alternativ som vinner

Nollskottsklassificering upptäcker inte en universell etikett som är oberoende av språket. Den jämför en bild med angivna kandid etiketter eller textpromptar och rangordnar alternativen.

Hugging Faces arbetsflöde för nollskottsklassificering av bilder skapar uttryckligen promptar med kandid etiketter som ”Det här är ett foto av …” innan de poängsätts mot en bild.

En uppgradering kan lägga till etiketter, döpa om dem, översätta dem eller ändra promptmallarna. Om ”golden retriever” läggs till kan den ersätta den bredare etiketten ”hund”, medan samma bild kan falla tillbaka till ”djur” om en smal klass tas bort.

Etiketthierarkier ändrar detaljnivån

Fotoetiketter bildar ofta relationer mellan överordnade och underordnade klasser: fordon, bil, sportbil; mat, dessert, tårta. Systemet kan visa den smalaste klassen, den överordnade klassen eller flera nivåer, beroende på modell och gränssnitt.

CHiLS-forskningen visar att hierarkiska etikettuppsättningar kan ändra klassificeringen genom att generera underklasser och sedan mappa tillbaka förutsägelser till överordnade kategorier.

En uppgraderad ontologi kan därför göra etiketter mer specifika eller mer allmänna utan en tydlig försämring av träffsäkerheten. Vid granskning bör man jämföra hierarkin och mappningsreglerna, inte bara kontrollera om den gamla strängen fortfarande finns kvar.

Konfidensgränser avgör vilka etiketter som blir synliga

Modeller returnerar vanligtvis flera kandidater med poäng. Programmet väljer hur många som ska lagras och vilken lägsta konfidens som krävs innan en etikett visas i sökningen eller i fotots detaljvy.

Om tröskelvärdet ändras kan gränsfall döljas eller många fler svaga etiketter visas. En modell vars poängkalibrering skiljer sig från föregångarens kan behöva ett annat tröskelvärde även om dess rangordningskvalitet är bättre.

Lagra råpoäng eller topp-k-poäng under utvärderingen och välj sedan visningströsklar per modellversion. Om samma numeriska gräns återanvänds för orelaterade modeller kan uppgraderingen verka instabil, när det verkliga problemet är poängkalibreringen.

Ansiktsgrupper kan ändras även när objektetiketterna inte gör det

Ansiktsigenkänning skapar vanligtvis inbäddningar för upptäckta ansikten och klustrar närliggande punkter till personer. En ny detektor kan ändra beskärningen, medan en ny igenkänningsmodell ändrar avstånden mellan ansiktsvektorerna.

DBSCAN grupperar punkter utifrån radie för närmaste grannar och minsta täthet; avstånds- och täthetsparametrarna avgör om ett ansikte ansluter till en person, bildar en annan grupp eller förblir en avvikare.

Modelländringar och klustringsändringar bör granskas separat. En renare ansiktsbeskärning kan dela upp en person som tidigare slagits ihop, medan ett generösare avståndströskelvärde kan slå ihop släktingar som liknar varandra.

Delvis ombearbetning blandar två generationer av etiketter

Om endast nya foton bearbetas med den uppgraderade modellen innehåller biblioteket två semantiska utrymmen samtidigt. Sökresultat och etiketter kan variera beroende på när varje tillgång lades till i systemet.

Immich instruerar administratörer att bearbeta alla tillgångar på nytt efter byte av smart sökmodell och påpekar att inkompatibla data från den tidigare modellen annars kan orsaka fel.

Använd en versionshanterad ombyggnad eller ett andra index, kontrollera att körningen är slutförd och byt sedan sökningar atomiskt. Ta inte bort det gamla indexet förrän den nya generationen har fullständiga antal tillgångar och godkända tester av sökresultaten.

Versionshantera förutsägelser och skydda manuella korrigeringar

Håll modellgenererade etiketter åtskilda från användarskapade album, manuella taggar, namngivna personer och beslut om dolda etiketter. En automatisk ombyggnad ska inte i tysthet skriva över användarens organisatoriska arbete.

Utvärdera en fast uppsättning representativa foton före driftsättning. Jämför tillagda etiketter, borttagna etiketter, förändringar i rangordningen, falska positiva resultat, uppdelningar och sammanslagningar av ansikten samt sökfrågor som är viktiga för hushållet.

ZimaSpaces artikel om varför ändrad bildupplösning påverkar belastningen vid multimodal AI tillför ytterligare en variabel: upplösningen vid förbehandlingen och beskärningsstrategin kan ändra det visuella underlag som skickas till den uppgraderade modellen.

Vanliga frågor

Betyder en ändrad etikett att den nya modellen är sämre?

Nej. Den kan använda en annan vokabulär eller välja en mer specifik klass i en överordnad–underordnad hierarki. Träffsäkerheten måste utvärderas mot representativa foton och de avsedda sökuppgifterna.

Bör gamla AI-etiketter raderas direkt?

Nej. Behåll den gamla generationen tills ombearbetningen och jämförelsen är klara. Versionshanterade etiketter möjliggör återställning och regressionsanalys.

Kan manuella fotoetiketter överleva modelluppgraderingar?

Ja, när manuella etiketter lagras separat från genererade förutsägelser och ombyggnadskörningar begränsas till modellens egna fält.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.