Pourquoi un pipeline RAG cite-t-il le bon fichier, mais le mauvais passage ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Un pipeline RAG peut citer le bon fichier, mais le mauvais passage, lorsque la découverte du document réussit tandis que la récupération des segments ou la correspondance des citations échoue.

Les fichiers volumineux contiennent souvent de nombreuses sections qui partagent une terminologie, des en-têtes répétés, des exemples similaires ou plusieurs versions d’un même fait. Un récupérateur au niveau du fichier peut identifier correctement le manuel, le rapport ou la note domestique pertinent, tandis que l’étape au niveau du passage sélectionne un segment voisin. Le modèle de réponse peut alors déduire le détail manquant de ses propres connaissances ou d’un autre segment, tout en associant les métadonnées du fichier sélectionné. Une citation fiable exige une exactitude indépendante aux niveaux du document, de la page, du segment, de l’extrait et de la génération.

Le rappel des documents et celui des passages sont deux problèmes de récupération différents

Un fichier peut être très bien classé parce que son titre, ses métadonnées ou son embedding global correspond à la question. Cela ne prouve pas que le paragraphe contenant la réponse figure dans l’ensemble de segments récupérés.

Un guide pratique sur les échecs RAG sépare les couches d’échec de la récupération et recommande d’examiner les segments exacts plutôt que la seule réponse finale.

Le pipeline doit mesurer séparément le rappel des documents, des pages et des segments. Un nom de fichier correct peut masquer un extrait de réponse manqué.

Les limites des segments peuvent séparer les éléments probants de leur contexte

Un découpage de taille fixe peut placer un titre dans un segment, l’affirmation dans un autre, et l’exception ou l’étiquette du tableau dans un troisième.

Le guide d’Edtek explique comment de mauvaises limites de segments produisent des passages qui mentionnent la requête sans contenir la réponse complète.

Le récupérateur peut tout de même sélectionner le bon fichier, car de nombreux segments partagent le même sujet. Le générateur reçoit un passage incomplet et cite la source au niveau du fichier comme si elle prouvait l’affirmation.

Le découpage structurel, la récupération parent-enfant et l’expansion aux segments voisins ne sont utiles que si les décalages dans la source restent traçables.

Les métadonnées de citation peuvent être associées au mauvais niveau de granularité

Certains pipelines copient une seule URL ou un seul nom de fichier sur chaque segment sans enregistrer la page, la section, la zone englobante ou les décalages de caractères.

Le guide de Tensorlake sur les citations montre comment les ancres spatiales peuvent être transmises du prétraitement du document à la récupération, puis à la génération de la réponse.

Un pointeur limité au fichier prouve l’origine de l’élément du corpus, mais pas quels octets étayent la phrase. Les citations au niveau du passage nécessitent une identité stable du segment et des métadonnées de localisation.

L’OCR, la recomposition des PDF et les documents modifiés peuvent invalider les décalages, sauf si la citation enregistre également l’instantané indexé ou le hachage du contenu.

Des passages similaires peuvent amener le générateur à mélanger les identifiants

Le contexte peut contenir plusieurs segments du même fichier utilisant un langage similaire. Le modèle peut exploiter le contenu d’un passage et produire l’étiquette de citation d’un autre segment voisin.

Un article sur le RAG critique pour les citations avertit que les erreurs de passage voisin restent possibles même lorsque le document cité fait autorité.

Attribuez aux segments des identifiants clairs et distincts, et gardez la citation à proximité du texte justificatif. Demander au modèle de mémoriser une carte de citations distincte après la synthèse augmente le risque de discordance.

Une vérification déterministe de la correspondance entre citation et segment peut détecter les cas où le passage cité ne contient pas le texte affirmé ou cité.

Le reclassement doit évaluer la pertinence probante du passage, pas seulement la similarité thématique

Un récupérateur de première étape peut ramener de nombreux segments du bon fichier. Un reclasseur doit distinguer la section qui répond directement à la question de celles qui partagent simplement le même sujet.

Le guide de Databricks sur le découpage souligne que des unités de récupération cohérentes sont nécessaires avant que les étapes ultérieures puissent classer précisément les passages.

Effectuez le reclassement avec la requête complète, conservez le titre et le contexte parent du passage, et pénalisez les segments qui ne contiennent pas le champ, la date, l’entité ou le type d’élément probant demandé.

Le flux de recherche documentaire de ZimaSpace traite ces éléments comme des étapes distinctes plutôt que comme un score générique unique de « qualité RAG ».

Vérifiez le passage exact avant d’afficher la citation

Après la génération, reliez chaque phrase factuelle ou citation au segment qui contient l’élément justificatif. Rejetez les citations qui pointent uniquement vers le bon fichier.

Infolitz recommande d’associer les citations aux segments contenant la source, plutôt que de les reconstituer au niveau de l’ensemble du fichier.

Évaluez la précision des passages, l’exhaustivité des éléments probants, le fait que les citations contiennent bien les extraits, la validité des décalages de citation et la capacité de l’extrait cité à étayer exactement l’affirmation générée.

Le système n’est réellement corrigé que lorsque l’utilisateur clique sur la citation et ouvre le plus petit passage suffisant, et pas simplement le bon document à proximité de la réponse.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.