Pourquoi les étiquettes des photos générées par l’IA changent-elles après la mise à niveau d’un modèle ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Les libellés photo générés par l’IA changent après une mise à niveau, car le nouveau modèle représente les images, compare les libellés et applique les seuils de confiance différemment de l’ancien modèle.

Une photothèque auto-hébergée peut conserver les mêmes fichiers originaux tout en modifiant les termes de recherche intelligente, les objets détectés, les groupes de visages, les suggestions de doublons ou les libellés de scènes après une mise à jour. Ces libellés sont des enregistrements dérivés dans la base de données, et non des faits inscrits définitivement dans l’image. Lorsque l’encodeur visuel, l’encodeur textuel, le vocabulaire des classes, le seuil, le pipeline de prétraitement ou la règle de regroupement change, le système recalcule la catégorie à laquelle appartient une photo.

Un libellé photo est une décision du modèle, pas une métadonnée permanente

Les horodatages de l’appareil photo et les noms de fichiers peuvent être lus à partir des données stockées, mais des libellés tels que « plage », « chien », « anniversaire » ou « véhicule » sont des prédictions produites par une version et une configuration particulières du modèle.

Amazon Rekognition renvoie la version du modèle de détection des libellés avec les résultats, car la version fait partie du sens de la prédiction. Le service expose également les alias, les catégories et les valeurs de confiance, au lieu de considérer une chaîne de libellé comme une propriété immuable.

Un système photo local devrait conserver la même traçabilité. Sans le nom et la version du modèle, les paramètres de prétraitement et l’heure d’exécution de la tâche, un administrateur ne peut pas déterminer si un libellé modifié reflète un nouveau modèle, un seuil différent ou un index endommagé.

De nouveaux embeddings créent un espace de similarité différent

Les systèmes de recherche intelligente convertissent généralement chaque image en vecteur. Les requêtes textuelles et les concepts candidats sont mappés dans le même espace, et les libellés ou résultats de recherche dépendent des éléments les plus proches.

Qdrant explique que même de petites modifications du modèle d’embedding peuvent déplacer la géométrie de l’espace vectoriel, ce qui nécessite de recalculer les embeddings et de réindexer les données pour obtenir des comparaisons fiables.

Les anciens et les nouveaux vecteurs ne produisent pas des scores interchangeables. Une photo proche de « jardin » dans un espace peut se rapprocher de « parc » ou « arrière-cour » dans un autre, même si les deux modèles décrivent raisonnablement la scène.

Les mots et les invites candidats changent le résultat gagnant

La classification sans exemples ne découvre pas un libellé universel indépendamment de la langue. Elle compare une image aux libellés candidats ou aux invites textuelles fournis, puis classe ces différentes possibilités.

Le workflow de classification d’images sans exemples de Hugging Face construit explicitement des invites à partir de libellés candidats telles que « Ceci est une photo de… » avant de les comparer à une image.

Une mise à niveau peut ajouter des libellés, les renommer, les traduire ou modifier les modèles d’invite. L’ajout de « golden retriever » peut remplacer le libellé plus général « chien », tandis que la suppression d’une classe précise peut faire revenir la même image à « animal ».

Les hiérarchies de libellés modifient le niveau de précision

Les libellés photo forment souvent des relations parent-enfant : véhicule, voiture, voiture de sport ; nourriture, dessert, gâteau. Selon le modèle et l’interface, le système peut afficher la classe la plus précise, la classe parente ou plusieurs niveaux.

Les travaux de recherche CHiLS montrent que les ensembles de libellés hiérarchiques peuvent modifier la classification en générant des sous-classes, puis en remappant les prédictions vers des catégories parentes.

Une ontologie mise à niveau peut donc rendre les libellés plus précis ou plus généraux sans entraîner de baisse d’exactitude évidente. L’audit doit comparer la hiérarchie et les règles de mappage, et pas seulement vérifier si l’ancienne chaîne est toujours présente.

Les seuils de confiance déterminent les libellés visibles

Les modèles renvoient généralement plusieurs candidats avec leurs scores. L’application choisit combien de résultats stocker et le niveau minimal de confiance requis avant qu’un libellé apparaisse dans la recherche ou dans la vue détaillée de la photo.

Modifier un seuil peut masquer des libellés limites ou en afficher beaucoup d’autres, plus faibles. Un modèle dont l’étalonnage des scores diffère de celui de son prédécesseur peut nécessiter un seuil différent, même si la qualité de son classement est meilleure.

Stockez les scores bruts ou les scores des k meilleurs résultats pendant l’évaluation, puis choisissez des seuils d’affichage pour chaque version du modèle. Réutiliser une même valeur seuil pour des modèles sans rapport peut donner l’impression que la mise à niveau est instable, alors que le véritable problème vient de l’étalonnage des scores.

Les groupes de visages peuvent changer même si les libellés d’objets restent identiques

La reconnaissance faciale crée généralement des embeddings pour les visages détectés et regroupe les points proches en personnes. Un nouveau détecteur peut modifier le cadrage, tandis qu’un nouveau modèle de reconnaissance modifie les distances entre les vecteurs faciaux.

DBSCAN regroupe les points selon un rayon de voisinage et une densité minimale ; les paramètres de distance et de densité déterminent si un visage rejoint une personne, forme un autre groupe ou reste une valeur aberrante.

Les changements de modèle et ceux du regroupement doivent être audités séparément. Un cadrage facial plus précis peut séparer une personne auparavant fusionnée avec une autre, tandis qu’un seuil de distance plus permissif peut regrouper des proches qui se ressemblent.

Le retraitement partiel mélange deux générations de libellés

Si seules les nouvelles photos sont traitées avec le modèle mis à niveau, la photothèque contient simultanément d’anciens et de nouveaux espaces sémantiques. Les résultats de recherche et les libellés peuvent varier selon la date à laquelle chaque élément a été ajouté au système.

Immich demande aux administrateurs de retraiter tous les éléments après avoir changé le modèle de recherche intelligente et précise que les données incompatibles de l’ancien modèle peuvent sinon provoquer des erreurs.

Utilisez une reconstruction versionnée ou un second index, vérifiez son achèvement, puis basculez les recherches de manière atomique. Ne supprimez pas l’ancien index avant que la nouvelle génération affiche un nombre complet d’éléments et obtienne des résultats acceptables lors des tests de recherche.

Versionnez les prédictions et protégez les corrections humaines

Conservez les libellés générés par le modèle séparément des albums créés par les utilisateurs, des balises manuelles, des personnes nommées et des décisions de masquage des libellés. Une reconstruction automatisée ne doit pas écraser silencieusement le travail d’organisation effectué par les utilisateurs.

Évaluez un ensemble fixe de photos représentatives avant le déploiement. Comparez les libellés ajoutés ou supprimés, les changements de classement, les faux positifs, les séparations et fusions de visages, ainsi que les requêtes importantes pour le foyer.

L’article de ZimaSpace consacré à la façon dont la résolution des images modifie la charge de traitement de l’IA multimodale ajoute une autre variable : la résolution de prétraitement et la politique de recadrage peuvent modifier les informations visuelles fournies au modèle mis à niveau.

FAQ

Un libellé modifié signifie-t-il que le nouveau modèle est moins performant ?

Non. Il peut utiliser un vocabulaire différent ou choisir une classe parente ou enfant plus précise. L’exactitude doit être évaluée sur des photos représentatives et selon les tâches de recherche visées.

Faut-il supprimer immédiatement les anciens libellés générés par l’IA ?

Non. Conservez l’ancienne génération jusqu’à la fin du retraitement et de la comparaison. Les libellés versionnés permettent d’effectuer un retour arrière et une analyse des régressions.

Les balises photo manuelles peuvent-elles survivre aux mises à niveau du modèle ?

Oui, lorsque les balises manuelles sont stockées séparément des prédictions générées et que les tâches de reconstruction sont limitées aux champs gérés par le modèle.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.