Pourquoi le rappel de la recherche vectorielle diminue-t-il après avoir mélangé plusieurs langues dans un même index ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Le rappel de la recherche vectorielle peut diminuer après le mélange de plusieurs langues, car les embeddings multilingues n’alignent pas toutes les langues, tous les domaines et toutes les directions de requête avec la même efficacité.

Un index domestique peut commencer par des manuels et des notes en anglais, puis intégrer des reçus chinois, des messages espagnols, des pages de produits japonaises ou des documents familiaux multilingues. La base de données vectorielle effectue toujours la même opération de recherche des plus proches voisins, mais l’espace des représentations a changé : les langues peuvent occuper des régions inégales, partager imparfaitement les concepts, utiliser des tokenisations d’efficacité différente et créer de nouveaux faux négatifs difficiles. Un top-k global peut alors favoriser la langue dominante ou récupérer des voisins sémantiquement larges dans d’autres langues, tout en manquant le passage pertinent.

Un modèle multilingue doit placer les significations équivalentes à proximité

La recherche interlingue ne fonctionne que lorsque une requête dans une langue et un document pertinent dans une autre sont projetés dans des régions compatibles de l’espace partagé des embeddings.

LaBSE a été conçu pour créer des embeddings indépendants de la langue à l’aide de vastes données d’entraînement monolingues et bilingues.

La prise en charge de nombreuses langues n’implique pas une qualité de recherche identique pour chacune d’elles. L’alignement dépend de la quantité et de la nature des données apportées par chaque langue pendant l’entraînement.

Le déséquilibre de l’entraînement produit une géométrie inégale entre les langues

Les langues dotées de nombreuses ressources disposent généralement de davantage de textes, de paires de traductions et de faux négatifs difficiles pendant l’entraînement du modèle. Les variétés linguistiques disposant de moins de ressources ou spécifiques à un domaine peuvent bénéficier d’un alignement moins efficace.

Les recherches sur les représentations multilingues font état de performances linguistiques inégales et les relient aux limites des données d’alignement interlingue.

Lorsque ces langues sont intégrées à un même index domestique, un seuil de cosinus ou un top-k commun suppose une comparabilité que le modèle d’embeddings n’offre peut-être pas réellement.

La langue dominante peut sembler bien optimisée, tandis qu’une autre langue perd silencieusement des voisins pertinents.

La recherche monolingue et la recherche interlingue sont deux tests différents

Une requête en anglais qui récupère des documents en anglais teste la recherche sémantique dans une même langue. Une requête en chinois qui récupère un manuel en anglais teste à la fois l’alignement interlingue et la pertinence.

M3-Embedding évalue les modes de recherche multilingues avec des représentations denses, creuses et multivectorielles.

Un modèle peut être performant lorsque la requête et le document sont dans la même langue, mais perdre en rappel lorsque les langues diffèrent. Faire la moyenne de ces deux cas dans une seule métrique masque la direction qui échoue.

Mesurez explicitement les paires de langues : anglais vers chinois ne se comporte pas nécessairement comme chinois vers anglais.

Un seul modèle d’embeddings peut sacrifier la qualité de l’anglais pour une couverture plus large

Un encodeur multilingue dispose d’une capacité limitée et doit représenter de nombreux systèmes d’écriture, vocabulaires et distributions sémantiques.

Arctic-Embed 2.0 étudie l’équilibre de la recherche multilingue, plutôt que de supposer qu’une couverture linguistique plus large n’a aucun effet sur les performances établies en anglais.

Après le mélange des langues, les documents anglais pertinents peuvent être confrontés à des candidats supplémentaires sémantiquement similaires dans d’autres langues. Le modèle doit préserver à la fois l’équivalence interlingue et les distinctions fines propres à chaque langue.

La hubness peut faire apparaître certains vecteurs multilingues trop souvent

Dans les espaces de grande dimension, un petit ensemble de vecteurs peut devenir le plus proche voisin de nombreuses requêtes sans rapport. Ces hubs occupent des positions du top-k qui devraient contenir des éléments pertinents.

Une analyse multilingue récente identifie la hubness interlingue comme un facteur des comportements de recherche asymétriques.

Le mélange des langues peut révéler des hubs qui étaient moins visibles dans un index monolingue, notamment autour de textes génériques standardisés, de modèles traduits ou de courtes expressions courantes.

La déduplication, de meilleurs négatifs, un filtrage tenant compte de la langue, le reranking ou un score prenant en compte les hubs peuvent restaurer le rappel selon la nature du problème.

La tokenisation et la longueur des documents modifient la qualité des représentations

Une même quantité de sens peut nécessiter un nombre de tokens très différent selon les langues et les systèmes d’écriture. Le découpage selon une limite fixe de caractères ou de tokens produit donc des unités sémantiques inégales.

MMTEB élargit l’évaluation des embeddings multilingues à des centaines de langues et à différentes tâches de recherche, au lieu de s’appuyer sur un petit benchmark centré sur l’anglais.

Un découpeur réglé pour les paragraphes anglais peut séparer le chinois, le japonais, les langues agglutinantes ou les documents multilingues à des endroits inadaptés. Les vecteurs obtenus encodent alors des éléments incomplets ou des informations excessivement générales.

Évaluez et acheminez la recherche selon la paire de langues

Créez des recherches annotées pour chaque langue de requête importante, chaque langue de document et chaque direction. Incluez les noms exacts, les paraphrases, le changement de langue, les tableaux, le texte OCR et le vocabulaire domestique.

Les travaux de Snowflake sur les embeddings multilingues présentent une évaluation par langue, car une seule moyenne globale peut masquer des différences importantes.

Le guide de ZimaSpace sur l’indexation sémantique NAS montre que l’extraction et la qualité du découpage restent essentielles à la recherche, même lorsque le modèle vectoriel prend en charge la langue.

Utilisez un index multilingue unique lorsque le rappel mesuré est acceptable. Sinon, ajoutez des filtres linguistiques, une recherche hybride par mots-clés, des requêtes assistées par traduction, des moteurs de recherche propres à chaque langue ou un reranker cross-encodeur pour les directions les moins performantes.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.