Les modèles d’embeddings peuvent regrouper des documents personnels sans rapport après un changement de domaine, car leur géométrie de similarité apprise ne correspond plus au nouveau vocabulaire ni aux nouvelles tâches.
Un index privé peut commencer par des notes personnelles et des manuels, puis s’étendre à des dossiers médicaux, du code source, des factures, des documents juridiques, des articles universitaires ou des archives multilingues. Le même embedder généraliste continue de projeter chaque segment dans un espace vectoriel unique, mais le sens de « similaire » a changé. Les termes spécialisés, les modèles répétitifs, les nouvelles longueurs de documents et les différentes intentions de recherche peuvent rapprocher des documents sans rapport. Les sections ci-dessous expliquent comment le décalage de domaine modifie les voisinages sans qu’aucune erreur d’indexation évidente ne survienne.
La similarité des embeddings reflète la distribution des données d’entraînement du modèle
Un modèle d’embeddings apprend quels textes doivent être proches à partir de son préentraînement et de ses exemples contrastifs. Ces exemples définissent une notion opérationnelle de la similarité avant même l’indexation du corpus personnel.
Google Research évalue la recherche hors domaine, montrant que la qualité des représentations change lorsque la collection cible diffère de la distribution d’entraînement.
Un modèle entraîné à associer de grandes paraphrases thématiques peut ne pas distinguer les entités, procédures ou types de dossiers précis qui comptent dans une nouvelle collection domestique.
Un nouveau vocabulaire peut fusionner des documents distincts en un seul thème général
Les documents spécialisés partagent souvent des termes rares dans les textes généraux. Le modèle peut reconnaître le thème général, mais manquer de contraste spécifique au domaine pour séparer des concepts voisins.
Les recherches sur les embeddings adaptés au domaine montrent que la précision et le comportement de la similarité dans un domaine technique peuvent changer après un affinement sur les données cibles.
Après un changement de domaine, plusieurs fichiers sans rapport peuvent devenir des voisins les plus proches, car ils contiennent tous le même vocabulaire technique, même s’ils répondent à des questions différentes.
Les noms d’entités, les unités, les dates et les rôles des documents peuvent nécessiter une recherche lexicale ou des filtres de métadonnées lorsque la représentation dense ne conserve que le thème commun.
Les modèles répétitifs et les documents longs peuvent dominer le vecteur
Les factures, rapports, formulaires et journaux exportés répètent souvent des en-têtes, des mentions légales, des noms de champs ou du texte standard dans des dossiers par ailleurs sans rapport.
L’étude Length-Induced Embedding Collapse constate que les embeddings de textes longs peuvent devenir plus similaires et se regrouper à mesure que du contenu est ajouté.
Si le texte standard occupe une grande partie d’un segment, les vecteurs peuvent se regrouper selon le modèle plutôt que selon l’événement, la personne, l’appareil ou la décision particulière qu’il contient.
Supprimer le texte répétitif, préserver les champs structurels et intégrer de plus petites sections cohérentes peut restaurer des voisinages plus discriminants.
L’effet de hub fait apparaître certains documents comme similaires à beaucoup d’autres
Les espaces vectoriels de grande dimension peuvent contenir des hubs : des documents qui deviennent les plus proches voisins d’un nombre anormalement élevé de requêtes et d’autres documents.
Une analyse de Sentence-BERT a montré que l’effet de hub des embeddings crée des voisinages asymétriques et augmente les erreurs de classification.
Une vue d’ensemble générique, un glossaire ou un modèle répétitif peut devenir un hub après un changement du corpus, donnant l’impression que des documents personnels sans rapport sont regroupés autour de lui.
La correction des scores de similarité, les diagnostics de hub, le reranking et l’adaptation au corpus peuvent réduire cet effet, mais le remède approprié dépend de la géométrie mesurée.
Le mélange de thèmes au sein d’un même segment crée un enchevêtrement sémantique
Un segment long qui combine des instructions, du dépannage, des informations de garantie et des notes personnelles produit un seul vecteur qui doit résumer plusieurs sens à la fois.
IBM Research rapporte que les embeddings spécifiques au domaine préservent mieux les relations spécialisées que les modèles généraux dans les tâches de recherche cibles.
Un changement de domaine introduit souvent de nouvelles structures documentaires ; un segmenteur ancien fondé sur le nombre de caractères peut donc soudainement réunir des sections qui devraient constituer des unités de preuve distinctes.
Les anciens seuils de similarité ne séparent plus les correspondances du bruit
Un seuil calibré sur des notes personnelles peut ne plus fonctionner après l’ajout de milliers de documents techniques. Les distributions de similarité des correspondances positives et des éléments aléatoires peuvent se rapprocher.
Les recherches sur la récupération continue mesurent la dérive des embeddings au lieu de supposer qu’un ancien seuil cosinus reste valable après une modification de la distribution cible.
L’index peut donc produire davantage de faux voisins, même si le modèle d’embeddings, la base de données et le code de recherche n’ont pas changé.
Les seuils doivent être recalibrés séparément pour le nouveau corpus, les types de requêtes, les tailles de segments et les éventuels filtres de métadonnées appliqués avant la recherche vectorielle.
Reconstruire le jeu d’évaluation autour du nouveau domaine
Créez des requêtes représentatives comprenant des positifs annotés, des négatifs difficiles, des modèles quasi dupliqués, des termes spécialisés et des documents qui partagent un thème sans devoir être regroupés.
Une étude sur la recherche affinée montre pourquoi le nouveau domaine a besoin de son propre jeu de requêtes et de sa propre évaluation de la pertinence.
Le guide de ZimaSpace consacré à la recherche sémantique de fichiers montre pourquoi l’extraction, le découpage en segments, les métadonnées et la récupération doivent être évalués comme un seul pipeline local.
Comparez l’ancien et le nouveau corpus à l’aide du rappel, du rang des négatifs difficiles, de la pureté des clusters, de la fréquence des hubs, des distributions de scores et des résultats du reranker. Le problème n’est résolu que lorsque les distinctions importantes du nouveau domaine réapparaissent dans les résultats de recherche.
Centre Tech & IA
Plus à lire

Quelles fonctionnalités permettent de créer une frontière de confiance pour l’IA domestique autour des fichiers sensibles ?
Une frontière de confiance pour l’IA à domicile combine le chiffrement des données au repos, des autorisations selon le principe du moindre privilège, un...

Pourquoi les résultats de recherche privés privilégient-ils les fichiers fréquemment modifiés ?
Les fichiers fréquemment modifiés bénéficient d’un meilleur classement lorsque chaque mise à jour ajoute des signaux de fraîcheur, des segments, des versions ou des...

Qu’est-ce qui pousse les modèles de détection de présence pour maison intelligente à confondre les invités avec les résidents ?
Les invités peuvent être pris pour des résidents lorsque le système observe des habitudes d’activité du foyer, mais ne dispose d’aucun signal d’identité stable...

