Un jeu de données d’évaluation RAG est un ensemble reproductible de requêtes et d’éléments probants attendus, ou de comportements de réponse attendus, utilisé pour mesurer de manière cohérente les évolutions d’une recherche privée.
Sans ensemble d’évaluation fixe, une base de connaissances domestique peut sembler meilleure après l’adoption d’une nouvelle taille de segment, d’un modèle d’embeddings, d’un réordonnanceur ou d’une règle de métadonnées, simplement parce que des questions différentes ont été posées. Un jeu de données utile fige des requêtes représentatives du foyer, indique les éléments probants qui devraient être récupérés, consigne les comportements de réponse acceptables et inclut les cas où le système devrait admettre que le corpus ne contient pas la réponse.
Un jeu de données d’évaluation fige les questions et les éléments probants attendus
L’unité de base est un cas de test qui peut être réexécuté après chaque modification du pipeline RAG. Il peut contenir une question, une réponse de référence, les passages sources pertinents, l’identité du document, des contraintes de métadonnées et des notes décrivant l’apparence d’un refus correct.
Un test RAG stable peut associer des questions et des réponses attendues avant de mesurer l’application de manière répétée.
Pour une recherche privée, les étiquettes des éléments probants sont souvent plus utiles que le seul texte de réponse, car elles révèlent si le bon fichier et la bonne version ont été intégrés au contexte, même lorsque le modèle de langage a produit par hasard une phrase finale plausible.
Un cas de test doit conserver l’identité de la source au même niveau de granularité que celui utilisé par le système pour la récupération. Si l’évaluation n’étiquette qu’un PDF entier alors que l’index renvoie des segments, un échec peut se dissimuler derrière une correspondance apparemment correcte au niveau du document.
La recherche privée a besoin de modes d’échec issus du véritable corpus domestique
Les benchmarks publics contiennent rarement les noms de fichiers en double, les scans OCR, les manuels révisés, le vocabulaire propre à une famille, les numéros de série exacts, les règles de dossiers privés et les versions obsolètes qui façonnent une base de connaissances domestique.
Selon les corpus, il peut être nécessaire d’utiliser une évaluation RAG spécifique au domaine, plutôt que de supposer qu’un seul benchmark général de questions-réponses représente tous les environnements de récupération.
Constituez des cas à partir des journaux de recherche réels et des fichiers connus pour être difficiles, puis ajoutez des variantes synthétiques uniquement lorsqu’elles testent une limite clairement définie. Les identifiants exacts, les paraphrases, la synthèse de plusieurs documents, les conflits entre versions obsolètes et actuelles, ainsi que les requêtes dont la réponse est absente ne devraient pas être représentés par un seul type de question générique.
La récupération et la génération ont besoin d’étiquettes distinctes
Une réponse finale correcte peut dissimuler une récupération faible si le modèle connaissait déjà le fait grâce à son préentraînement, tandis qu’une mauvaise réponse peut survenir même lorsque le passage idéal a été récupéré. Le jeu de données devrait donc prendre en charge des métriques par étape, plutôt qu’un score unique où tout est correct ou incorrect.
Des échantillons d’évaluation structurés permettent aux métriques d’évaluer la qualité de la récupération et des réponses à partir d’entrées de test cohérentes.
Pour chaque requête, indiquez les éléments probants qui doivent être présents, les versions interdites et les propriétés importantes de la réponse. Comparez ensuite séparément le rappel, la qualité du classement, la précision du contexte, la fidélité, l’exactitude de la réponse, l’identité de la citation et le comportement de refus.
Cette séparation rend les régressions exploitables. Une baisse du score de réponse peut être attribuée au découpage ou à la récupération lorsque les éléments probants ont disparu du top-k, ou à la génération lorsque les éléments probants sont restés intacts mais que la réponse les a mal utilisés.
Les cas négatifs et limites empêchent le système de fausser le jeu de données
Un jeu de données contenant uniquement des questions faciles et auxquelles il est possible de répondre récompense les systèmes qui répondent toujours avec assurance. La recherche privée a également besoin de requêtes dont la réponse est absente, ambiguë, soumise à des restrictions d’autorisation, remplacée par une autre ou dépendante de plusieurs sources.
Les cas hors base de connaissances sont nécessaires pour mesurer un comportement prudent, et pas uniquement le rappel sur les réponses connues.
Les tests d’autorisation sont tout aussi importants pour un index domestique. Un résultat sémantiquement parfait mais non autorisé doit être considéré comme un échec du système, et non comme une excellente récupération.
Incluez des exemples de quasi-doublons et de conflits entre versions afin que le système ne puisse pas améliorer simplement ses métriques moyennes en renvoyant davantage de candidats. Les éléments probants attendus doivent identifier la source faisant autorité, et pas seulement le sujet.
Le versionnage des jeux de données transforme les tests ponctuels en contrôle des régressions
Le corpus et les questions évoluent tous deux au fil du temps. De nouveaux appareils, des dossiers renommés, des politiques mises à jour et un vocabulaire utilisateur différent peuvent rendre un ancien jeu d’évaluation non représentatif. Les données de test elles-mêmes ont donc besoin d’un cycle de vie maîtrisé.
Le versionnage des jeux de données permet de comparer les résultats du pipeline à un état connu des exemples d’évaluation.
Le flux de travail d’une base de connaissances privée constitue la couche applicative ; le jeu de données d’évaluation est ce qui rend les changements apportés à ce flux mesurables plutôt qu’anecdotiques.
Actualisez le jeu de données lorsque le corpus ou le comportement des utilisateurs évolue, mais conservez les versions historiques afin qu’un nouvel ensemble d’évaluation n’efface pas les preuves qu’une modification de la récupération a fait régresser un ancien flux de travail critique.
Centre Tech & IA
Plus à lire

Qu’est-ce que l’état de Plex et quelles parties doivent être persistantes ?
L’état persistant de Plex regroupe les informations qui préservent l’expérience du serveur après un redémarrage ou une reconstruction ; les données multimédias et les...

Comment Plex gère-t-il l’authentification entre les sessions locales et distantes ?
L’authentification Plex commence par l’identité du serveur et du compte, puis les chemins réseau locaux ou distants déterminent l’accessibilité et le fonctionnement de la...

Pourquoi la recherche dans Plex peut-elle ralentir à mesure que les données de la bibliothèque augmentent ?
La croissance de la bibliothèque n’est pas à elle seule la cause du problème. Testez la forme des requêtes, les index, l’état du cache,...

