Le RAG local répond souvent mieux aux documents narratifs, car le découpage ordinaire préserve le contexte de la prose, mais détruit la structure relationnelle qui donne leur sens aux cellules d’un tableur.
Un paragraphe de politique contient son sujet et ses qualificatifs dans les phrases voisines, tandis que « 42 » dans un classeur peut dépendre d’un intitulé de ligne, d’une date de colonne, d’une unité, d’une formule et du nom de la feuille. Lorsqu’un serveur domestique convertit les deux en blocs de texte brut, le récit survit plus fidèlement à cette transformation que la grille et ses relations intercellulaires implicites lors de la génération de réponses fondées sur les sources.
Les blocs narratifs contiennent leur propre voisinage sémantique
La prose répète les entités, les verbes et les relations de cause à effet dans des phrases adjacentes. Un bloc de taille fixe conserve généralement suffisamment de langage pour qu’un plongement représente le sujet et qu’un générateur interprète les éléments probants. Le chevauchement peut préserver une phrase qui se trouve à cheval sur une limite.
Une approche du RAG axée sur les tableaux indique que le RAG conventionnel fonctionne bien pour les textes narratifs, mais échoue lorsque les informations clés se trouvent dans des tableaux et des structures. Le décalage commence avant la génération, au stade de la représentation et de la récupération.
La qualité narrative peut néanmoins être trompeuse : des passages fluides favorisent des réponses fluides, même lorsque le mauvais bloc a été récupéré. L’avantage comparatif réside dans la préservation de la structure, et non dans la garantie que les réponses narratives sont factuellement exactes.
Le sens d’un tableur réside dans les coordonnées et les opérations
Le sens d’une cellule provient des relations entre les axes. L’aplatissement ligne par ligne peut dissocier les en-têtes, les libellés fusionnés, les formules, les feuilles masquées ou les unités. Les plongements comparent alors des chaînes isolées plutôt que l’opération demandée par une question, comme filtrer un trimestre et additionner une catégorie.
Les recherches sur la topologie des tableaux modélisent explicitement le texte et la topologie des tableaux, car les documents hybrides contiennent des connexions que les blocs linéaires ordinaires perdent. La préservation de l’adjacence et de la hiérarchie modifie les éléments probants pouvant être récupérés.
Même une récupération parfaite peut ne pas suffire à répondre à une question sur un tableur. Le générateur doit sélectionner les cellules, respecter les types de données, effectuer les calculs arithmétiques et citer les coordonnées. Un modèle de langage capable de résumer correctement un paragraphe peut tout de même intervertir des colonnes ou effectuer un calcul sur du texte d’affichage formaté.
Quand le RAG narratif perd son avantage
L’avantage narratif disparaît lorsque les documents contiennent de nombreuses références croisées, de longues annexes ou des faits séparés de leurs définitions. À l’inverse, les tableurs dotés d’en-têtes explicites, de lignes bien structurées et d’une couche de requête sémantique peuvent être plus faciles à interroger qu’une prose ambiguë.
Un guide consacré à l’évaluation du RAG sur des données tabulaires insiste sur l’évaluation à l’aide de questions ancrées dans les tableaux plutôt que sur des métriques génériques de texte. La réponse doit être vérifiée par rapport aux cellules et aux opérations exactes.
Le mécanisme échoue également si les pipelines narratif et tableur utilisent des systèmes OCR, des modèles de plongement ou des autorisations différents. Dans ce cas, le format est confondu avec les outils. « Plus agréable à lire » n’est pas synonyme de meilleur ancrage ; les deux formats nécessitent une vérification au niveau de la réponse.
Évaluez la récupération et le calcul comme deux étapes distinctes
Créez des questions appariées à partir d’un même rapport narratif et d’un classeur bien structuré : questions de recherche, de comparaison, d’agrégation et d’identification d’exceptions. Notez les passages ou les coordonnées des cellules nécessaires, puis faites passer les deux ensembles dans le même modèle avec le même budget de récupération. Évaluez séparément la récupération, le calcul, la citation et la réponse finale.
Utilisez une base de données vectorielle locale pour conserver localement les vecteurs et les fichiers sources tout en comparant une sérialisation tenant compte des tableaux avec un simple texte organisé par lignes. Gardez la température du modèle et l’invite constantes.
Si les éléments probants du tableur sont récupérés, mais que l’arithmétique échoue, ajoutez une étape d’exécution structurée. Si les en-têtes disparaissent avant la récupération, corrigez l’extraction et la sérialisation. Si les réponses narratives semblent seulement meilleures, mais citent les mauvais passages, ajustez l’évaluation au lieu de déclarer le pipeline narratif supérieur.
Centre Tech & IA
Plus à lire

Comment mesurer la qualité de la récupération RAG locale et interpréter le rappel, la précision et la couverture des citations
Créez un jeu de test RAG local, calculez les principales métriques de récupération, interprétez leurs compromis et vérifiez si les affirmations des réponses sont...

Pourquoi le calcul des fonctionnalités de la maison intelligente devient-il plus important lorsque le nombre de capteurs augmente à fréquence d’échantillonnage constante ?
Suivez les calculs par capteur et intercapteurs à mesure que le nombre d’appareils augmente, identifiez les coûts de fusion non linéaires et évaluez les...

Pourquoi le coût de l’évaluation du RAG devient-il plus important à mesure que la bibliothèque de documents s’agrandit, pour un même volume de requêtes ?
Comprenez pourquoi l’augmentation du corpus accroît l’effort d’évaluation du RAG sans augmenter le nombre de requêtes des utilisateurs, et comment les tests stratifiés maintiennent...

