Pourquoi le coût de l’évaluation du RAG devient-il plus important à mesure que la bibliothèque de documents s’agrandit, pour un même volume de requêtes ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

L’évaluation du RAG devient plus importante à mesure qu’une bibliothèque s’agrandit, car l’ambiguïté de la récupération et la surface de régression augmentent, même lorsque les utilisateurs posent le même nombre de questions.

Une famille peut toujours effectuer 100 recherches par semaine après que ses archives sont passées de 10 000 à un million de fragments. Pourtant, chaque requête comporte désormais davantage de quasi-doublons, de versions obsolètes, de langues et de limites d’autorisation susceptibles de se concurrencer dans le classement. Un petit jeu de tests fixe couvre une part de plus en plus réduite des défaillances potentielles de récupération dans chaque nouvelle strate de contenu.

Davantage de candidats créent davantage de possibilités de récupérer des erreurs plausibles

La recherche approximative n’évalue pas chaque passage de manière exacte. À mesure que le corpus s’agrandit, davantage de fragments peuvent se rapprocher d’une requête, y compris des éléments redondants et obsolètes. La précision peut diminuer même si le nombre de requêtes et le top-k restent fixes.

Une étude contrôlée des stratégies de récupération compare la récupération dense, hybride, réordonnée et étendue dans des conditions de génération fixes, montrant que les changements de stratégie entraînent des compromis mesurables entre précision et rappel.

L’évaluation doit donc examiner la pertinence, le rang, la version et les autorisations, et pas seulement vérifier si une réponse existe. Un plus grand nombre de documents augmente également la probabilité qu’une réponse fluide cite un doublon plausible, mais dépourvu d’autorité.

La couverture et l’annotation augmentent avec la diversité du corpus

Un jeu de tests représente les types de documents, les langues, les dates, les entités et les intentions des requêtes. Lorsque la bibliothèque accueille de nouvelles familles de contenus, les anciennes questions ne couvrent plus l’ensemble de la surface de risque. Étendre la couverture nécessite des jugements de pertinence et des éléments de preuve attendus, même lorsque le trafic de production reste inchangé.

Les recherches sur la couverture de l’information soutiennent que la précision et le rappel classiques peuvent ne pas déterminer si les résultats couvrent des besoins d’information distincts. La diversité du corpus peut augmenter plus rapidement que le volume de requêtes.

Chaque index, segmenteur, modèle d’embeddings, politique de filtrage et variante de réordonneur multiplie les comparaisons. Les évaluateurs automatisés réduisent le travail, mais ajoutent un coût d’inférence ainsi que leur propre travail d’étalonnage. Le coût de l’évaluation est le prix à payer pour savoir si la croissance du corpus a modifié le comportement du système.

Quand la taille de la bibliothèque n’est pas le principal facteur de coût

La taille de l’index peut avoir peu d’incidence lorsque les requêtes ciblent des identifiants uniques et que des filtres déterministes réduisent d’abord le nombre de candidats. Un corpus plus vaste composé de doublons homogènes peut augmenter le stockage sans accroître significativement la diversité des requêtes.

Un cadre consacré à la vérifiabilité des affirmations décompose les requêtes et les réponses en unités de couverture et de vérifiabilité, montrant que la charge d’évaluation dépend de la structure des affirmations autant que de la taille du corpus.

Le mécanisme échoue également si le coût de l’évaluation est dominé par une génération coûteuse ou par une vérification humaine pour chaque réponse. Dans ce cas, la croissance de la bibliothèque est secondaire. Davantage de tests ne signifie pas automatiquement de meilleurs résultats ; des questions redondantes peuvent augmenter les dépenses sans améliorer la couverture des risques.

-15% OFF

Associez les dépenses d’évaluation aux nouveaux risques du corpus

Conservez un jeu de régression principal, puis ajoutez des questions stratifiées uniquement lorsque la bibliothèque accueille une nouvelle langue, un nouveau type de document, une nouvelle classe d’autorisation, une nouvelle période ou une entité à forte valeur. Annotez les éléments de preuve requis et les faux négatifs difficiles connus. Exécutez d’abord les métriques de récupération, avant les métriques de génération plus coûteuses.

Reliez les mises à jour des tests aux événements d’actualisation de l’index afin que les fichiers nouvellement indexés ou manqués déclenchent une évaluation ciblée plutôt qu’une nouvelle exécution complète et non structurée. Conservez un échantillon de contrôle fixe pour comparer les tendances.

Suivez le coût par strate couverte et par défaut détecté, plutôt que le coût par requête de production. Échantillonnez les strates courantes à faible risque et testez intégralement les contenus sensibles aux autorisations ou fréquemment modifiés. Si les scores ne dérivent que dans une nouvelle strate, corrigez-la et réexécutez cette portion avant d’étendre l’ensemble de la suite.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.