Waarom veranderen AI-fotolabels na een modelupgrade?

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

AI-fotolabels veranderen na een upgrade omdat het nieuwe model afbeeldingen anders weergeeft, labels anders vergelijkt en andere betrouwbaarheidsgrenzen toepast dan het oude model.

Een zelfgehoste fotobibliotheek kan dezelfde originele bestanden behouden, terwijl termen voor slim zoeken, gedetecteerde objecten, gezichtsgroepen, suggesties voor duplicaten of scรจnelabels na een update veranderen. Deze labels zijn afgeleide records in de database, geen permanent in de afbeelding opgeslagen feiten. Wanneer de visuele encoder, tekstencoder, klassenwoordenschat, drempelwaarde, voorverwerkingspijplijn of clusteringregel verandert, berekent het systeem opnieuw waar een foto thuishoort.

Een fotolabel is een modelbeslissing, geen permanente metadata

Cameradatums en bestandsnamen kunnen uit opgeslagen gegevens worden gelezen, maar labels zoals โ€˜strandโ€™, โ€˜hondโ€™, โ€˜verjaardagโ€™ of โ€˜voertuigโ€™ zijn voorspellingen die door een specifieke modelversie en configuratie worden geproduceerd.

Amazon Rekognition retourneert de modelversie voor labeldetectie samen met de resultaten, omdat de versie deel uitmaakt van de betekenis van de voorspelling. De dienst biedt ook aliassen, categorieรซn en betrouwbaarheidswaarden, in plaats van รฉรฉn labeltekst als een onveranderlijke eigenschap te behandelen.

Een lokaal fotosysteem moet dezelfde herkomstgegevens bewaren. Zonder modelnaam, versie, voorverwerkingsinstellingen en tijdstip van de taak kan een beheerder niet vaststellen of een gewijzigd label het gevolg is van een nieuw model, een andere drempelwaarde of een beschadigde index.

Nieuwe embeddings creรซren een andere similariteitsruimte

Systemen voor slim zoeken zetten elke afbeelding meestal om in een vector. Tekstqueryโ€™s en kandidaatconcepten worden naar dezelfde ruimte gemapt, en labels of zoekresultaten zijn afhankelijk van welke items het dichtst bij elkaar liggen.

Qdrant legt uit dat zelfs kleine wijzigingen in het embeddingmodel de geometrie van de vectorruimte kunnen verschuiven, waardoor gegevens opnieuw van embeddings moeten worden voorzien en opnieuw moeten worden geรฏndexeerd voor nauwkeurige vergelijkingen.

De oude en nieuwe vectoren zijn geen uitwisselbare scores. Een foto die in de ene ruimte dicht bij โ€˜tuinโ€™ ligt, kan in een andere ruimte dichter bij โ€˜parkโ€™ of โ€˜achtertuinโ€™ komen te liggen, ook als beide modellen redelijke beschrijvingen van de scรจne geven.

Kandidaatwoorden en prompts bepalen de winnaar

Zero-shotclassificatie ontdekt niet รฉรฉn universeel label dat onafhankelijk van taal is. Het vergelijkt een afbeelding met aangeleverde kandidaatlabels of tekstuele prompts en rangschikt die alternatieven.

De zero-shotworkflow voor beeldclassificatie van Hugging Face maakt expliciet prompts voor kandidaatlabels zoals โ€˜Dit is een foto van โ€ฆโ€™ voordat deze met een afbeelding worden vergeleken.

Een upgrade kan labels toevoegen, hernoemen of vertalen, of promptsjablonen wijzigen. Door โ€˜golden retrieverโ€™ toe te voegen kan het bredere label โ€˜hondโ€™ worden vervangen, terwijl het verwijderen van een specifieke klasse ervoor kan zorgen dat dezelfde afbeelding terugvalt op โ€˜dierโ€™.

Labelhiรซrarchieรซn veranderen de mate van detail

Fotolabels vormen vaak ouder-kindrelaties: voertuig, auto, sportwagen; voedsel, dessert, taart. Afhankelijk van het model en de interface kan het systeem de meest specifieke klasse, de bovenliggende klasse of meerdere niveaus weergeven.

Het CHiLS-onderzoek laat zien dat hiรซrarchische labelsets de classificatie kunnen veranderen door subklassen te genereren en voorspellingen vervolgens terug te mappen naar bovenliggende categorieรซn.

Een geรผpgradede ontologie kan labels daardoor specifieker of algemener maken zonder dat de nauwkeurigheid eenvoudigweg afneemt. Bij een audit moeten de hiรซrarchie en toewijzingsregels worden vergeleken, niet alleen of de oude tekst nog voorkomt.

Betrouwbaarheidsdrempels bepalen welke labels zichtbaar worden

Modellen retourneren meestal meerdere kandidaten met scores. De toepassing bepaalt hoeveel daarvan worden opgeslagen en welke minimale betrouwbaarheid vereist is voordat een label in zoekresultaten of in de fotodetailweergave verschijnt.

Door een drempelwaarde te wijzigen kunnen twijfelachtige labels worden verborgen of juist veel meer zwakke labels zichtbaar worden. Een model waarvan de scores anders zijn gekalibreerd dan die van zijn voorganger, kan een andere drempelwaarde nodig hebben, zelfs als de kwaliteit van de rangschikking beter is.

Sla tijdens de evaluatie de onbewerkte scores of de top-k-scores op en kies vervolgens per modelversie de drempelwaarden voor weergave. Het hergebruiken van รฉรฉn numerieke grens voor niet-verwante modellen kan de upgrade instabiel laten lijken, terwijl het echte probleem de kalibratie van de scores is.

Gezichtsgroepen kunnen veranderen, zelfs als objectlabels gelijk blijven

Gezichtsherkenning maakt normaal gesproken embeddings voor gedetecteerde gezichten en clustert nabijgelegen punten tot personen. Een nieuwe detector kan de uitsnede veranderen, terwijl een nieuw herkenningsmodel de afstanden tussen gezichtsvectoren wijzigt.

DBSCAN groepeert punten op basis van de straal van de omgeving en de minimale dichtheid; de afstand- en dichtheidsparameters bepalen of een gezicht bij een persoon wordt gevoegd, een andere groep vormt of een uitschieter blijft.

Modelwijzigingen en clusteringwijzigingen moeten afzonderlijk worden gecontroleerd. Een schonere gezichtsuitsnede kan een eerder samengevoegde persoon opsplitsen, terwijl een soepelere afstandsdrempel familieleden die op elkaar lijken kan samenvoegen.

Gedeeltelijke herverwerking mengt twee generaties labels

Als alleen nieuwe fotoโ€™s met het geรผpgradede model worden verwerkt, bevat de bibliotheek tegelijkertijd oude en nieuwe semantische ruimtes. Zoekresultaten en labels kunnen dan verschillen afhankelijk van het moment waarop elk item aan het systeem werd toegevoegd.

Immich instrueert beheerders om alle items opnieuw te verwerken na het wijzigen van het model voor slim zoeken en merkt op dat incompatibele gegevens van het vorige model anders fouten kunnen veroorzaken.

Gebruik een versiegebonden heropbouw of een tweede index, controleer of de verwerking is voltooid en schakel vervolgens de zoekfunctie atomair over. Verwijder de oude index pas nadat de nieuwe generatie volledige aantallen items bevat en de zoektests aanvaardbare resultaten opleveren.

Voorzie voorspellingen van versies en bescherm handmatige correcties

Houd door het model gegenereerde labels gescheiden van door gebruikers gemaakte albums, handmatige tags, benoemde personen en beslissingen om labels te verbergen. Een geautomatiseerde heropbouw mag het organisatorische werk van de gebruiker niet stilzwijgend overschrijven.

Evalueer vรณรณr de implementatie een vaste set representatieve fotoโ€™s. Vergelijk toegevoegde en verwijderde labels, wijzigingen in rangschikking, fout-positieven, splitsingen en samenvoegingen van gezichten en zoekqueryโ€™s die voor het huishouden belangrijk zijn.

Het artikel van ZimaSpace over waarom beeldresolutie de belasting van multimodale AI verandert voegt nog een variabele toe: de resolutie van de voorverwerking en het beleid voor uitsnedes kunnen het visuele bewijs veranderen dat aan het geรผpgradede model wordt aangeboden.

Veelgestelde vragen

Betekent een gewijzigd label dat het nieuwe model slechter is?

Nee. Het kan een andere woordenschat gebruiken of een specifiekere klasse binnen een ouder-kindrelatie kiezen. De nauwkeurigheid moet worden geรซvalueerd aan de hand van representatieve fotoโ€™s en de beoogde zoektaken.

Moeten oude AI-labels onmiddellijk worden verwijderd?

Nee. Bewaar de oude generatie totdat de herverwerking en vergelijking zijn afgerond. Gelabelde versies maken terugdraaien en regressieanalyse mogelijk.

Kunnen handmatige fototags upgrades van het model overleven?

Ja, wanneer handmatige tags afzonderlijk van gegenereerde voorspellingen worden opgeslagen en heropbouwtaken beperkt blijven tot velden die door het model worden beheerd.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.