L’évaluation du RAG devient plus importante à mesure qu’une bibliothèque s’agrandit, car l’ambiguïté de la récupération et la surface de régression augmentent, même lorsque les utilisateurs posent le même nombre de questions.
Une famille peut toujours effectuer 100 recherches par semaine après que ses archives sont passées de 10 000 à un million de fragments. Pourtant, chaque requête comporte désormais davantage de quasi-doublons, de versions obsolètes, de langues et de limites d’autorisation susceptibles de se concurrencer dans le classement. Un petit jeu de tests fixe couvre une part de plus en plus réduite des défaillances potentielles de récupération dans chaque nouvelle strate de contenu.
Davantage de candidats créent davantage de possibilités de récupérer des erreurs plausibles
La recherche approximative n’évalue pas chaque passage de manière exacte. À mesure que le corpus s’agrandit, davantage de fragments peuvent se rapprocher d’une requête, y compris des éléments redondants et obsolètes. La précision peut diminuer même si le nombre de requêtes et le top-k restent fixes.
Une étude contrôlée des stratégies de récupération compare la récupération dense, hybride, réordonnée et étendue dans des conditions de génération fixes, montrant que les changements de stratégie entraînent des compromis mesurables entre précision et rappel.
L’évaluation doit donc examiner la pertinence, le rang, la version et les autorisations, et pas seulement vérifier si une réponse existe. Un plus grand nombre de documents augmente également la probabilité qu’une réponse fluide cite un doublon plausible, mais dépourvu d’autorité.
La couverture et l’annotation augmentent avec la diversité du corpus
Un jeu de tests représente les types de documents, les langues, les dates, les entités et les intentions des requêtes. Lorsque la bibliothèque accueille de nouvelles familles de contenus, les anciennes questions ne couvrent plus l’ensemble de la surface de risque. Étendre la couverture nécessite des jugements de pertinence et des éléments de preuve attendus, même lorsque le trafic de production reste inchangé.
Les recherches sur la couverture de l’information soutiennent que la précision et le rappel classiques peuvent ne pas déterminer si les résultats couvrent des besoins d’information distincts. La diversité du corpus peut augmenter plus rapidement que le volume de requêtes.
Chaque index, segmenteur, modèle d’embeddings, politique de filtrage et variante de réordonneur multiplie les comparaisons. Les évaluateurs automatisés réduisent le travail, mais ajoutent un coût d’inférence ainsi que leur propre travail d’étalonnage. Le coût de l’évaluation est le prix à payer pour savoir si la croissance du corpus a modifié le comportement du système.
Quand la taille de la bibliothèque n’est pas le principal facteur de coût
La taille de l’index peut avoir peu d’incidence lorsque les requêtes ciblent des identifiants uniques et que des filtres déterministes réduisent d’abord le nombre de candidats. Un corpus plus vaste composé de doublons homogènes peut augmenter le stockage sans accroître significativement la diversité des requêtes.
Un cadre consacré à la vérifiabilité des affirmations décompose les requêtes et les réponses en unités de couverture et de vérifiabilité, montrant que la charge d’évaluation dépend de la structure des affirmations autant que de la taille du corpus.
Le mécanisme échoue également si le coût de l’évaluation est dominé par une génération coûteuse ou par une vérification humaine pour chaque réponse. Dans ce cas, la croissance de la bibliothèque est secondaire. Davantage de tests ne signifie pas automatiquement de meilleurs résultats ; des questions redondantes peuvent augmenter les dépenses sans améliorer la couverture des risques.
Associez les dépenses d’évaluation aux nouveaux risques du corpus
Conservez un jeu de régression principal, puis ajoutez des questions stratifiées uniquement lorsque la bibliothèque accueille une nouvelle langue, un nouveau type de document, une nouvelle classe d’autorisation, une nouvelle période ou une entité à forte valeur. Annotez les éléments de preuve requis et les faux négatifs difficiles connus. Exécutez d’abord les métriques de récupération, avant les métriques de génération plus coûteuses.
Reliez les mises à jour des tests aux événements d’actualisation de l’index afin que les fichiers nouvellement indexés ou manqués déclenchent une évaluation ciblée plutôt qu’une nouvelle exécution complète et non structurée. Conservez un échantillon de contrôle fixe pour comparer les tendances.
Suivez le coût par strate couverte et par défaut détecté, plutôt que le coût par requête de production. Échantillonnez les strates courantes à faible risque et testez intégralement les contenus sensibles aux autorisations ou fréquemment modifiés. Si les scores ne dérivent que dans une nouvelle strate, corrigez-la et réexécutez cette portion avant d’étendre l’ensemble de la suite.
Centre Tech & IA
Plus à lire

Comment mesurer la qualité de la récupération RAG locale et interpréter le rappel, la précision et la couverture des citations
Créez un jeu de test RAG local, calculez les principales métriques de récupération, interprétez leurs compromis et vérifiez si les affirmations des réponses sont...

Pourquoi le calcul des fonctionnalités de la maison intelligente devient-il plus important lorsque le nombre de capteurs augmente à fréquence d’échantillonnage constante ?
Suivez les calculs par capteur et intercapteurs à mesure que le nombre d’appareils augmente, identifiez les coûts de fusion non linéaires et évaluez les...

Pourquoi la surcharge des outils d’agent devient-elle plus importante à mesure que le nombre d’étapes du workflow augmente, pour une taille de modèle identique ?
Suivez comment les attentes séquentielles, l’augmentation du contexte, les nouvelles tentatives et la fiabilité se cumulent à chaque étape de l’agent, puis mesurez séparément...

