La recherche visuelle peut manquer de petits objets après la régénération des miniatures lorsque le nouveau chemin de prétraitement supprime des pixels ou du contexte auparavant encodés par l'embedding.
Une photo de famille peut contenir un vélo, une étiquette, un animal ou un outil qui n'occupe qu'une petite région de l'image originale. Si un service photo régénère les aperçus avec un recadrage, une règle d'orientation, une résolution ou un paramètre de compression différent, le modèle de vision reçoit une entrée différente, même si le fichier original reste inchangé. La taille effective de l'objet et le contexte environnant déterminent si ce détail est conservé dans l'embedding.
La géométrie de la miniature détermine le nombre de pixels de l'objet conservés
Les encodeurs de vision redimensionnent généralement une entrée en tenseur carré ou rectangulaire de taille fixe. Un petit objet qui occupe 30 pixels dans l'original peut être réduit en dessous d'une échelle de caractéristiques utile, tandis qu'un recadrage centré peut supprimer complètement un objet situé sur le bord.
l'inférence découpée pour les petits objets divise les grandes images en régions qui se chevauchent avant la détection, afin que les petits objets conservent davantage de pixels à l'entrée du modèle. Les gains rapportés montrent qu'une réduction de l'image entière peut supprimer des détails utiles, même lorsque la résolution originale est élevée.
Les politiques d'ajustement, de remplissage et de recadrage centré ne sont pas équivalentes. L'ajustement préserve l'ensemble de l'image avec des marges, le remplissage peut rogner les bords et la gestion de l'orientation peut faire pivoter l'image avant ou après le recadrage. La régénération modifie la recherche dès que l'une de ces opérations diffère de celle utilisée pour l'embedding précédent.
Les caractéristiques multi-échelles ne peuvent pas récupérer les pixels supprimés
Les systèmes de vision modernes combinent des cartes spatiales fines avec des caractéristiques sémantiques plus profondes, ce qui aide à reconnaître les objets à plusieurs échelles. Cette représentation commence néanmoins par la miniature présentée à l'encodeur ; les informations supprimées lors du redimensionnement ou de la compression ne sont plus disponibles pour les couches suivantes.
les pyramides de caractéristiques multi-échelles construisent une pyramide de caractéristiques descendante avec des connexions latérales, afin que des caractéristiques sémantiquement fortes existent à plusieurs résolutions. Ce mécanisme explique pourquoi la reconnaissance des petits objets bénéficie de cartes spatiales fines plutôt que d'une seule représentation grossière.
Un embedding global de l'image peut privilégier la scène dominante et ignorer un petit élément, même lorsqu'un détecteur est capable de le trouver. Les pipelines de recherche qui nécessitent un rappel au niveau des objets peuvent avoir besoin de tuiles, d'embeddings de régions ou de légendes d'objets détectés en plus d'un unique vecteur issu de la miniature entière.
La compression et la normalisation déplacent les similarités limites
La quantification JPEG, l'accentuation, la conversion des couleurs, la composition alpha et les filtres de rééchantillonnage modifient les contours locaux et les textures. Les grands objets restent sémantiquement stables, mais un petit objet proche du seuil de reconnaissance du modèle peut changer suffisamment pour passer sous le seuil de récupération.
les régions haute résolution ciblées orientent le traitement haute résolution vers les petites régions prometteuses au lieu d'appliquer partout une pyramide d'images coûteuse. Sa conception grossière à fine montre qu'allouer des pixels à la région pertinente peut préserver la précision tout en réduisant le traitement total.
L'erreur consiste à supposer que tout résultat modifié provient d'un défaut de miniature. Un nouveau modèle d'embedding, un encodeur de requêtes modifié, une reconstruction de l'index ou la concurrence entre les résultats les mieux classés peuvent également déplacer les classements. Comparez les anciennes et les nouvelles miniatures avec le même modèle figé et le même index avant d'en attribuer la cause.
Effectuez un test de récupération entre l'original et la miniature
Sélectionnez cinquante photos contenant de petits objets au centre, sur les bords, dans des zones sombres et sur des arrière-plans encombrés. Enregistrez les miniatures précédentes, régénérez-les, puis notez pour les deux versions les dimensions, les cadres de recadrage, l'orientation, le codec, la qualité, le profil colorimétrique et les empreintes de fichiers.
Utilisez la méthode de traitement par régions présentée dans le traitement tenant compte des régions pour comparer les embeddings de l'image originale, de l'ancienne miniature, de la nouvelle miniature et des images en tuiles avec les mêmes requêtes et le même index. Suivez le nombre de pixels de l'objet, le rappel top-k, les changements de rang et les absences selon l'emplacement et la taille de l'objet.
Ne conservez les miniatures régénérées que si elles atteignent le rappel requis pour les petits objets, au coût de stockage et de calcul prévu. Si les aperçus globaux restent insuffisants, ajoutez des embeddings de régions pour certaines photos au lieu d'affirmer qu'une résolution de miniature supérieure garantit la recherche d'objets.
Centre Tech & IA
Plus à lire

Pourquoi la consommation électrique du GPU augmente-t-elle au début d’une requête d’inférence locale ?
Découvrez comment la montée en fréquence du GPU, le préremplissage du modèle, l'initialisation du noyau, l'allocation de mémoire et les intervalles d'échantillonnage créent des...

Pourquoi le classement de la recherche vectorielle change-t-il lorsque plusieurs segments d’index sont interrogés simultanément ?
Découvrez comment les limites de candidats par segment, les graphes approximatifs, l’étalonnage des scores, les mises à jour et la consolidation modifient le classement...

Pourquoi les groupes de déduplication des photos se séparent-ils après la modification des métadonnées ?
Découvrez comment les hachages exacts, les hachages perceptuels, l’orientation EXIF, les horodatages, les seuils et les versions du pipeline entraînent la division des groupes...

