Un plongement multimodal représente différents types de médias dans un espace vectoriel sémantique comparable, afin qu’une requête dans une modalité puisse retrouver du contenu dans une autre.
Pour une archive personnelle, cela peut signifier saisir « vélo rouge à côté du garage » et retrouver des photos ou des images vidéo, même si aucun nom de fichier ni aucune légende ne contient ces mots. L’intérêt ne réside pas simplement dans le fait que les images et le texte disposent chacun de plongements ; leurs représentations doivent être suffisamment alignées pour que la similarité intermodale ait un sens. Cela devient particulièrement utile lorsque les métadonnées des médias sont limitées, mais introduit également des compromis en matière d’indexation, de granularité et de faux positifs.
Les plongements multimodaux projettent différentes entrées dans un espace comparable
Un encodeur de texte et un encodeur d’image, d’audio ou de vidéo peuvent produire des vecteurs dont la géométrie est entraînée de sorte que les entrées sémantiquement liées se trouvent à proximité les unes des autres. C’est cet alignement qui permet de comparer directement une requête textuelle à des représentations visuelles ou audio.
La supervision en langage naturel peut produire des représentations visuelles et linguistiques alignées, permettant une comparaison sans apprentissage spécifique entre images et texte.
Un index multimédia personnel peut donc stocker des plongements d’image et encoder une expression de recherche avec l’encodeur de texte associé. La base de données effectue toujours une recherche de similarité vectorielle, mais les vecteurs relient désormais plusieurs modalités au lieu de représenter uniquement du texte.
Un espace partagé permet la recherche intermodale
La même idée s’étend au-delà de l’image et du texte lorsqu’un modèle est entraîné à aligner plusieurs modalités autour d’un contenu sémantique connexe. Un son, une image et une description peuvent alors être comparés, même si leurs formats bruts ne partagent ni jetons ni pixels.
Un plongement conjoint de plusieurs modalités peut inclure des images, du texte, de l’audio, la profondeur, des données thermiques et des signaux inertiels.
Pour une archive privée, cela permet notamment de rechercher des séquences montrant un chien qui aboie à partir d’une expression textuelle, ou de regrouper des fichiers audio et des images associés au même événement. La prise en charge dépend des modalités réellement apprises par le modèle choisi, et non d’une affirmation générale selon laquelle tous les vecteurs seraient interopérables.
Les différentes familles de plongements utilisent également des dimensions et des géométries différentes. Les vecteurs issus de modèles sans lien ne doivent donc pas être mélangés dans un même espace de similarité, à moins que le système n’apprenne ou n’applique explicitement un alignement.
La vidéo nécessite généralement des représentations au niveau de l’image ou de la séquence
Une longue vidéo contient de nombreuses scènes, objets, personnes qui parlent et actions. Un seul vecteur pour l’ensemble du fichier peut donc brouiller le moment que l’utilisateur souhaite retrouver. La recherche dans des contenus multimédias personnels nécessite généralement des représentations pour les images, les plans, les séquences ou les segments regroupés temporellement.
Un modèle unifié peut projeter le texte, les images, la vidéo et l’audio dans un espace de recherche partagé, mais l’application doit toujours choisir l’unité temporelle qui deviendra un enregistrement interrogeable.
Une séquence de dix secondes peut mieux préserver le contexte d’une action qu’une seule image isolée, tandis que des plongements d’images denses augmentent le stockage et les doublons de contenus presque identiques. La granularité appropriée dépend de la recherche souhaitée : objets, scènes, personnes, sons ou événements.
La similarité intermodale constitue un indice sémantique, pas une preuve d’identité
Un score de similarité élevé signifie que le modèle a trouvé des éléments sémantiquement liés selon son objectif d’entraînement. Cela ne prouve pas que deux enregistrements montrent la même personne, le même produit exact ou le même événement, et le modèle peut confondre des contenus domestiques visuellement ou conceptuellement similaires.
Même avec des vecteurs normalisés de type CLIP, la géométrie des plongements reflète une similarité apprise plutôt qu’une relation d’identité vérifiée.
Utilisez les métadonnées, les horodatages, l’identité de la caméra, des modèles spécialisés dans les visages ou les objets, ainsi qu’une vérification humaine lorsque l’application nécessite des éléments plus solides qu’une simple recherche sémantique.
Cette limite est importante pour les images de vidéosurveillance à domicile. Une recherche textuelle sur « livreur » peut faire ressortir des séquences plausibles, mais ne doit pas à elle seule servir de base à une décision de contrôle d’accès ou d’identification.
Les plongements multimodaux sont surtout utiles lorsque les métadonnées sont incomplètes
Des albums correctement étiquetés, avec des légendes, des dates et des tags de personnes fiables, peuvent déjà être faciles à parcourir par recherche lexicale. Les plongements multimodaux apportent le plus de valeur lorsque le contenu visuel ou acoustique contient des informations utiles qui n’ont jamais été consignées dans les métadonnées.
La couche d’organisation privée des contenus multimédias peut utiliser les plongements multimodaux comme une méthode de recherche parmi d’autres pour retrouver des contenus que les noms de fichiers et les dossiers ne peuvent pas décrire.
Évaluez la recherche avec des requêtes propres à votre foyer avant de générer un plongement pour chaque image d’une grande archive. L’augmentation du nombre de vecteurs, du stockage et du travail d’indexation ne se justifie que si la recherche intermodale permet de retrouver des contenus utiles que les métadonnées existantes ne permettent pas de trouver.
Centre Tech & IA
Plus à lire

Qu’est-ce que l’état de Plex et quelles parties doivent être persistantes ?
L’état persistant de Plex regroupe les informations qui préservent l’expérience du serveur après un redémarrage ou une reconstruction ; les données multimédias et les...

Comment Plex gère-t-il l’authentification entre les sessions locales et distantes ?
L’authentification Plex commence par l’identité du serveur et du compte, puis les chemins réseau locaux ou distants déterminent l’accessibilité et le fonctionnement de la...

Pourquoi la recherche dans Plex peut-elle ralentir à mesure que les données de la bibliothèque augmentent ?
La croissance de la bibliothèque n’est pas à elle seule la cause du problème. Testez la forme des requêtes, les index, l’état du cache,...

