La qualité d’un RAG local est mesurable lorsque les éléments probants annotés, les métriques de récupération et les vérifications des citations au niveau des affirmations sont évalués séparément sur un ensemble représentatif de requêtes.
Une réponse fluide peut dissimuler une source manquée, tandis qu’un système de récupération performant peut transmettre les bons passages à un générateur qui les cite mal. Commencez par des requêtes dont les segments pertinents sont connus, puis évaluez la liste des k premiers résultats avant de générer les réponses. La couverture des citations relève de la couche de réponse et ne doit pas servir de substitut au rappel de récupération.
Créez la vérité terrain avant de calculer une métrique
Pour chaque requête de test, identifiez tous les segments de preuve acceptables ou, au minimum, un ensemble évalué défendable. Incluez les recherches directes, les questions de synthèse, les cas nécessitant des informations récentes, les abréviations, les langues et les limites d’autorisation. Séparez les questions utilisées pour l’ajustement d’un ensemble de test tenu à l’écart.
Une présentation pratique de l’évaluation du RAG recommande d’évaluer séparément les composants de récupération et de génération, car les scores de bout en bout ne permettent pas de localiser les défaillances.
La vérité terrain peut être incomplète dans une vaste bibliothèque. Regroupez les résultats de plusieurs systèmes de récupération, évaluez leur union et marquez les cas incertains plutôt que de considérer chaque segment non évalué comme non pertinent. Des annotations faibles produisent des métriques précises en apparence, mais trompeuses.
Le rappel et la précision répondent à des questions différentes sur la récupération
Le Recall@k correspond au nombre de segments pertinents récupérés parmi les k premiers, divisé par le nombre total de segments pertinents connus. La Precision@k correspond au nombre de segments pertinents parmi les k premiers, divisé par k. Une valeur de k plus élevée améliore généralement le rappel tout en ajoutant davantage de bruit ; les deux métriques doivent donc être lues conjointement.
Les définitions classiques de la précision et du rappel établissent cet équilibre dans la recherche d’information. Elles ne tiennent pas compte de la position dans le classement ; ajoutez donc le MRR ou le nDCG lorsque les premières preuves sont déterminantes.
Une requête comportant un seul passage pertinent obtient un Recall@5 de 1,0 si ce passage apparaît n’importe où parmi cinq résultats, mais sa Precision@5 n’est que de 0,2. Cela peut être acceptable pour un reranker, mais produire trop de bruit pour un générateur disposant d’un contexte réduit. Les objectifs des métriques dépendent du budget de preuves en aval.
La couverture des citations évalue les affirmations, pas les liens
Décomposez la réponse générée en affirmations vérifiables. La couverture des citations correspond au nombre d’affirmations étayées divisé par le nombre d’affirmations nécessitant des preuves ; la correction des citations consiste à vérifier si chaque passage cité étaye réellement l’affirmation à laquelle il est associé. Une réponse peut contenir de nombreux liens tout en ayant une faible couverture.
Des travaux récents sur la récupération tenant compte des citations évaluent la couverture des requêtes et la vérifiabilité des affirmations atomiques, car un unique score global de pertinence ne peut pas révéler les fragments de réponse non étayés.
La couverture des citations cesse d’être pertinente lorsque les affirmations ne sont pas segmentées de manière cohérente, ou lorsque les connaissances générales et les affirmations nécessitant une source sont mélangées sans politique définie. Elle ne peut pas non plus prouver que la réponse est complète. Davantage de citations ne signifie pas automatiquement un meilleur ancrage documentaire.
Utilisez une règle de décision qui préserve la séparation diagnostique
Exécutez d’abord la récupération et enregistrez les identifiants des segments classés, les scores et les versions. Calculez le Recall@k, la Precision@k, le MRR ou le nDCG, puis générez les réponses à partir des résultats figés et évaluez la fidélité, la pertinence de la réponse, la couverture des citations et leur correction.
Une évaluation contrôlée des métriques du RAG rapporte conjointement la précision contextuelle, le rappel contextuel, la fidélité et la pertinence de la réponse, illustrant pourquoi aucun score unique ne suffit.
Validez une version uniquement lorsque le rappel de récupération atteint son seuil minimal, que la précision reste compatible avec le budget de contexte et que chaque affirmation importante de la réponse est étayée ou explicitement nuancée. Si le rappel échoue, corrigez l’indexation ou la récupération ; si les citations échouent alors que les bonnes preuves sont présentes, corrigez la génération et l’attribution.
Appliquez un seul seuil de validation à la récupération et aux citations
Constituez au moins 50 requêtes représentatives pour un petit système domestique, puis passez à 100–200 à mesure que les types de documents et les langues se diversifient. Évaluez les preuves parmi les 5 et les 10 premiers résultats, figez l’ensemble de résultats, puis auditez les affirmations générées. Présentez les moyennes macro ainsi que les strates de requêtes les moins performantes.
Conservez le test à côté du contenu sur l’évaluation des formats RAG afin que les sources riches en tableaux et les sources narratives soient représentées plutôt que moyennées ensemble. Versionnez chaque identifiant de segment et chaque évaluation de pertinence.
Utilisez des seuils initiaux tels qu’un Recall@5 de 0,85 et une correction des citations de 0,95 uniquement comme points de départ locaux, et non comme normes universelles. Renforcez-les en fonction du risque. Ne sacrifiez jamais la justesse des autorisations ni l’étayage des affirmations à fort impact au profit d’un score global plus élevé.
Centre Tech & IA
Plus à lire

Pourquoi le calcul des fonctionnalités de la maison intelligente devient-il plus important lorsque le nombre de capteurs augmente à fréquence d’échantillonnage constante ?
Suivez les calculs par capteur et intercapteurs à mesure que le nombre d’appareils augmente, identifiez les coûts de fusion non linéaires et évaluez les...

Pourquoi le coût de l’évaluation du RAG devient-il plus important à mesure que la bibliothèque de documents s’agrandit, pour un même volume de requêtes ?
Comprenez pourquoi l’augmentation du corpus accroît l’effort d’évaluation du RAG sans augmenter le nombre de requêtes des utilisateurs, et comment les tests stratifiés maintiennent...

Pourquoi la surcharge des outils d’agent devient-elle plus importante à mesure que le nombre d’étapes du workflow augmente, pour une taille de modèle identique ?
Suivez comment les attentes séquentielles, l’augmentation du contexte, les nouvelles tentatives et la fiabilité se cumulent à chaque étape de l’agent, puis mesurez séparément...

