RAG peut citer un fichier plus ancien après la synchronisation, car l’arrivée du fichier, l’ingestion réussie, l’activation de l’index et la sélection de la version actuelle sont des transitions d’état distinctes.
Une interface NAS peut afficher immédiatement la nouvelle copie alors que l’index de recherche ne contient encore que la version précédente. Même après l’intégration du nouveau document, les deux copies peuvent rester consultables, et l’ancien segment peut être mieux classé parce que son texte, ses métadonnées ou son vecteur correspondent davantage à la requête. Un système fiable a besoin d’une identité de version explicite et d’une activation atomique, et non de la seule récence du nom de fichier.
La synchronisation s’achève avant le pipeline de recherche
Un client de synchronisation considère son travail terminé une fois que les octets et les métadonnées ont atteint leur destination. L’indexeur doit encore détecter la modification, attendre que le fichier soit stable, l’analyser ou effectuer son OCR, le découper, générer les représentations vectorielles, écrire les enregistrements et publier une génération d’index.
Une description de la fraîcheur incrémentielle de l’index distingue la détection des modifications, le traitement du contenu et les mises à jour de l’index. Ce modèle par étapes explique l’écart de fraîcheur durant lequel un fichier est présent sur le stockage, mais indisponible pour la recherche. Cette distinction reste visible lors des tests ultérieurs à domicile.
Les files d’attente, le délai exponentiel entre les tentatives, les fichiers verrouillés, les formats non pris en charge ou les protections contre les copies partielles peuvent allonger cet écart. La comparaison des horodatages du NAS avec ceux des validations de l’index révèle davantage que la simple vérification de l’existence du nouveau nom de fichier. Le résultat intermédiaire doit rester inspectable avant que l’automatisation ne se poursuive.
Les deux versions peuvent entrer en concurrence après l’indexation de la nouvelle copie
Si le fichier mis à jour reçoit un nouvel identifiant de document sans que l’ancien soit retiré, la recherche les traite comme des éléments de preuve indépendants. Un contenu similaire produit des segments presque identiques, et de petites différences de formulation ou de limites de segmentation déterminent lequel est classé en premier.
L’approche de recherche tenant compte de la fraîcheur étudie la prise en compte de la fraîcheur pour les connaissances évolutives. Son principe montre pourquoi la pertinence seule ne suffit pas lorsque plusieurs réponses valides à des dates différentes coexistent. Cette limite doit être mesurée séparément dans des conditions d’utilisation réalistes.
La date de modification du système de fichiers est une identité de version peu fiable, car la copie peut la conserver ou la réécrire, les horloges peuvent différer et les fichiers renommés peuvent appartenir à la même lignée. Un identifiant de document stable associé à une version monotone ou à une lignée de contenu est plus sûr.
L’assemblage des citations peut conserver une ancienne association avec la source
Le générateur peut utiliser un segment actuel tandis qu’un cache de citations, un service d’aperçu ou une table des sources associe encore son identifiant logique à un ancien chemin. À l’inverse, le résultat de recherche lui-même peut être obsolète alors que le nom de fichier affiché semble actuel.
Un cadre pour les associations de provenance des données considère la provenance comme un ensemble d’associations reliant les artefacts dérivés aux entrées sources et aux transformations. L’application de cette chaîne au RAG permet de distinguer une recherche obsolète d’une présentation de citation obsolète. La conséquence pratique apparaît lorsque plusieurs sources se disputent un contexte limité.
La limite à ne pas franchir consiste à juger la fraîcheur à partir de la seule étiquette de citation. Vérifiez les octets cités, l’identifiant de version, le hachage du contenu, l’horodatage d’indexation, le segment récupéré et la source affichée. Un ancien fichier renommé et un document réellement actuel peuvent porter le même nom convivial.
Tester l’activation d’une version avec une mise à jour de fichier contrôlée
Créez un document dont les anciennes et nouvelles versions contiennent des faits distinctifs. Consignez la fin de la synchronisation, l’événement du surveillant, la fin de l’analyse, l’écriture de la représentation vectorielle, la génération de l’index actif, le marqueur de retrait de l’ancienne version, le résultat de recherche, la résolution de la citation et l’aperçu de la source tout au long de la mise à jour.
Comparez l’implémentation avec la gestion des versions des documents RAG. La nouvelle version doit devenir active de manière atomique, et la précédente doit cesser de participer aux requêtes actuelles sans que la lignée nécessaire à l’explication des réponses historiques soit détruite. Cette dépendance doit rester explicite dans l’interface finale.
Le test ne doit être considéré comme réussi que lorsque les filtres de version actuelle sélectionnent les nouveaux octets après l’activation et que les requêtes effectuées pendant l’ingestion renvoient soit la dernière version complète, soit un état explicite de mise à jour. Si les deux versions sont classées, corrigez l’identité et le retrait avant d’ajuster la similarité.
Centre Tech & IA
Plus à lire

Pourquoi les modifications de fichiers SMB parviennent-elles à un indexeur incrémentiel par à-coups ?
Découvrez comment la mise en cache des écritures SMB, les baux, CHANGE_NOTIFY, le dépassement de tampon, la reconnexion et le traitement par lots de...

Pourquoi l’OCR omet-il les textes pâles après la recompression d’un PDF ?
Découvrez comment la recompression des PDF modifie les pixels peu visibles, pourquoi les lecteurs peuvent masquer cette perte et comment tester la résolution, le...

Pourquoi la latence de l’IA locale oscille-t-elle avec la courbe de ventilation d’un serveur domestique ?
Découvrez comment la chaleur, le contrôle du ventilateur, les limites de fréquence, le retard des capteurs et la synchronisation de la charge de travail...

