La dérive des embeddings apparaît lors de la réindexation lorsque le modèle, le texte, les paramètres de l’encodeur, le chemin numérique ou les règles de comparaison utilisés pour représenter la bibliothèque changent.
Une base de connaissances domestique peut contenir les mêmes PDF, notes, manuels et archives familiales avant et après une reconstruction, tout en renvoyant des plus proches voisins ou des scores de similarité différents. Certains changements sont de véritables dérives des embeddings : le vecteur produit pour une entrée identique a changé. D’autres relèvent de la dérive d’ingestion, lorsque le texte envoyé à l’encodeur a changé, ou de la dérive de recherche, lorsque des vecteurs identiques sont interrogés avec des métriques ou des paramètres d’index différents. La première limite diagnostique consiste donc à comparer séparément les octets sources, le texte extrait, l’identité des segments, les vecteurs bruts et les résultats classés, comme autant d’artefacts distincts.
La dérive réelle des vecteurs et la dérive apparente de la recherche sont différentes
Une dérive réelle signifie qu’un même texte normalisé produit un vecteur différent. Une dérive apparente signifie que le vecteur est stable, mais que l’appartenance aux segments, la métrique de similarité, le filtrage, la quantification ou la recherche approximative des voisins modifie le classement des résultats.
Les collections Qdrant définissent la taille des vecteurs et la métrique de distance au niveau de la collection. Une reconstruction dans une collection utilisant une autre métrique peut modifier les scores et l’ordre des résultats sans modifier les valeurs des embeddings elles-mêmes.
Comparer uniquement les premiers résultats de recherche mélange ces différentes causes. Une somme de contrôle des vecteurs bruts, calculée pour des chaînes de test fixes, permet de distinguer la dérive de l’encodeur de celle de l’index ou du classement.
Une révision de modèle non verrouillée peut remplacer l’encodeur
Un nom de modèle ne correspond pas toujours à un ensemble permanent de poids et de fichiers de configuration. Le propriétaire d’un dépôt peut mettre à jour les poids, les fichiers du tokenizer, la configuration de mise en commun ou le code du modèle tout en conservant le nom public du dépôt.
Les dépôts Hugging Face sont gérés par contrôle de version, et les téléchargements peuvent utiliser une révision précise plutôt que l’état de la branche la plus récente.
Cette cause entraîne un déplacement généralisé sur un ensemble de sondes fixe, souvent accompagné d’une modification du commit du modèle, du chemin du cache, du hachage de la configuration ou des ressources du tokenizer. Elle diffère d’une dérive propre aux documents, qui ne touche que les fichiers dont l’extraction ou le découpage a changé.
Les options de l’encodeur peuvent modifier la longueur, l’échelle et la géométrie des vecteurs
Les mêmes poids peuvent produire des représentations différentes lorsque la mise en commun, la normalisation, la précision, les préfixes d’invite, la longueur maximale des séquences ou les dimensions de sortie changent.
Sentence Transformers expose des réglages d’encodage tels que la précision, la normalisation, les invites et les dimensions tronquées.
Un changement de normalisation peut préserver la direction tout en modifiant la magnitude du vecteur ; un préfixe d’invite peut déplacer chaque document vers un autre espace conditionné par la tâche ; la troncature peut supprimer certaines dimensions. Il s’agit de changements de configuration, et non d’une instabilité aléatoire.
Le texte transmis à l’encodeur peut ne plus être le même
La réindexation peut faire appel à une autre version de l’analyseur, à un autre processus d’OCR, à une autre normalisation des espaces, à une autre règle d’ordre des pages ou à une autre stratégie de découpage, même lorsque les fichiers d’origine sont identiques octet par octet.
Unstructured effectue le découpage après le partitionnement et explique comment la taille des segments, le chevauchement et les limites des sections déterminent le texte intégré à chaque segment.
Si un titre est détecté pour la première fois ou si l’OCR d’une page produit un résultat différent, toutes les limites des segments suivants peuvent se décaler. Les vecteurs obtenus ne sont pas des représentations dérivées d’une entrée identique ; ils représentent des portions de texte différentes.
Une exécution non déterministe peut créer de petites différences numériques
Les noyaux parallèles, les bibliothèques matérielles, l’ordre des opérations et les composants aléatoires peuvent faire légèrement varier les résultats d’inférences répétées, même avec le même modèle et la même entrée.
PyTorch précise qu’une reproductibilité complète n’est pas garantie entre les versions, les plateformes ou les appareils, et fournit des réglages pour les algorithmes déterministes concernant les opérations prises en charge.
Cette cause produit généralement de petites différences de coordonnées plutôt qu’une réorganisation complète de l’espace sémantique. Si la similarité cosinus entre les anciens et les nouveaux vecteurs de sonde reste extrêmement élevée, le changement est peut-être un bruit numérique qui ne devient visible qu’en présence de résultats presque ex æquo.
La précision et la quantification peuvent modifier les voisins limites
Une reconstruction peut passer de float32 à float16, int8 ou à un autre profil d’exécution optimisé afin de réduire la mémoire utilisée et d’améliorer le débit.
ONNX Runtime explique que la conversion en float16 peut introduire des différences de précision nécessitant des tests de tolérance.
L’effet sémantique est souvent faible, mais une bibliothèque locale peut contenir de nombreux segments similaires. De petits déplacements des coordonnées peuvent inverser l’ordre de voisins dont les scores initiaux étaient presque identiques.
La réindexation peut mélanger plusieurs générations de vecteurs
Une collection partiellement reconstruite peut contenir des vecteurs générés avec différents commits du modèle, paramètres de découpage, dimensions ou règles de normalisation.
Le mélange de générations produit des comportements irréguliers : les documents inchangés peuvent rester stables tandis que seuls les fichiers retraités se déplacent, et les vecteurs de requête peuvent être incompatibles avec une partie de la collection stockée.
Le guide de ZimaSpace consacré à l’indexation sémantique sur NAS fournit la limite adjacente : la bibliothèque source, les enregistrements extraits, les embeddings et l’index de recherche sont des couches distinctes et ne doivent pas être considérés comme un seul objet immuable.
FAQ
Un texte identique doit-il toujours produire des embeddings identiques bit par bit ?
Uniquement avec un modèle verrouillé, une configuration identique, un chemin d’exécution déterministe et un environnement matériel et logiciel correspondant. De petites différences en virgule flottante peuvent néanmoins survenir dans les autres cas.
Des résultats de recherche inchangés peuvent-ils prouver que les embeddings n’ont pas dérivé ?
Non. Les vecteurs peuvent se déplacer sans franchir les limites de classement. Comparez les vecteurs bruts, leurs hachages ou leurs similarités sur un ensemble de sondes fixe.
Un changement de plus proche voisin indique-t-il toujours une dérive du modèle ?
Non. Le découpage, les filtres, les métriques de distance, la quantification et la construction de l’index approximatif peuvent modifier la recherche alors que la sortie de l’encodeur reste stable.
Centre Tech & IA
Plus à lire

Qu’est-ce qui amène un planificateur d’agent IA à répéter des étapes déjà effectuées ?
Suivez les étapes répétées du planificateur à travers la persistance de l’état, les preuves d’achèvement, l’analyse des résultats des outils, la conservation du contexte,...

Qu’est-ce qui provoque des erreurs d’autorisation uniquement dans les sous-processus des agents d’IA ?
Comparez l’identité du processus parent et du processus enfant, la vue du système de fichiers, l’environnement, les capacités, la politique de sécurité et le...

Quelles sont les causes de la saturation du processeur lorsque le transcodage matériel et l’IA vidéo s’exécutent simultanément ?
Suivez la saturation du processeur au niveau du déchargement des codecs, de la conversion des pixels, des copies d’images, du prétraitement de l’IA, de...

