Un dataset di valutazione RAG è un insieme ripetibile di query e prove attese o comportamenti di risposta, utilizzato per misurare in modo coerente le modifiche alla ricerca privata.
Senza un set di valutazione fisso, una knowledge base domestica può sembrare migliorata dopo l'introduzione di una nuova dimensione dei chunk, di un modello di embedding, di un reranker o di una regola per i metadati, semplicemente perché sono state provate domande diverse. Un dataset utile fissa query rappresentative dell'ambiente domestico, etichetta le prove che dovrebbero essere recuperate, registra il comportamento di risposta accettabile e include casi in cui il sistema dovrebbe ammettere che il corpus non contiene la risposta.
Un dataset di valutazione fissa le domande e le prove attese
L'unità di base è un caso di test che può essere eseguito nuovamente dopo le modifiche alla pipeline RAG. Può contenere una domanda, una risposta di riferimento, i passaggi rilevanti delle fonti, l'identità del documento, vincoli sui metadati e note su come dovrebbe apparire un rifiuto corretto.
Un test RAG stabile può associare domande e risposte attese prima di misurare ripetutamente l'applicazione.
Per la ricerca privata, le etichette delle prove sono spesso più preziose del solo testo della risposta, perché mostrano se il file e la versione corretti sono entrati nel contesto, anche quando il modello linguistico ha prodotto per caso una frase finale plausibile.
Un caso di test dovrebbe preservare l'identità della fonte allo stesso livello di granularità con cui il sistema recupera i contenuti. Se le etichette di valutazione identificano solo un intero PDF mentre l'indice restituisce chunk, un errore può nascondersi all'interno di una corrispondenza apparentemente corretta a livello di documento.
La ricerca privata ha bisogno di modalità di errore tratte dal corpus domestico reale
I benchmark pubblici contengono raramente nomi di file duplicati, scansioni OCR, manuali revisionati, vocabolario specifico della famiglia, numeri di serie esatti, regole per le cartelle private e versioni obsolete che influenzano una knowledge base domestica.
Corpus diversi possono richiedere una valutazione RAG specifica per dominio, invece di presumere che un unico benchmark generale di domande e risposte rappresenti ogni ambiente di recupero.
Costruisci i casi a partire dai log di ricerca reali e dai file notoriamente difficili, quindi aggiungi variazioni sintetiche solo quando verificano un confine chiaramente definito. Identificatori esatti, parafrasi, sintesi di più documenti, conflitti tra versioni obsolete e correnti e query la cui risposta non è presente non dovrebbero essere rappresentati da un unico tipo generico di domanda.
Il recupero e la generazione richiedono etichette separate
Una risposta finale corretta può nascondere un recupero debole se il modello conosceva già il fatto grazie al pre-training, mentre una risposta errata può verificarsi anche quando è stato recuperato il passaggio perfetto. Il dataset dovrebbe quindi supportare metriche a livello di fase, anziché un unico punteggio tutto-o-niente.
I campioni di valutazione strutturati consentono alle metriche di analizzare la qualità del recupero e della risposta a partire da input di test coerenti.
Per ogni query, indica quali prove devono essere presenti, quali versioni sono vietate e quali proprietà della risposta sono importanti. Quindi confronta separatamente recall, qualità del ranking, precisione del contesto, fedeltà, correttezza della risposta, identità della citazione e comportamento di rifiuto.
Questa separazione rende le regressioni più facili da correggere. Un punteggio inferiore della risposta può essere ricondotto al chunking o al recupero quando le prove sono scomparse dai risultati top-k, oppure alla generazione quando le prove sono rimaste intatte ma la risposta le ha utilizzate in modo errato.
I casi negativi e di confine impediscono al sistema di manipolare il dataset
Un dataset che contiene solo domande facili con risposta premia i sistemi che rispondono sempre con sicurezza. La ricerca privata ha bisogno anche di query la cui risposta è assente, ambigua, soggetta a restrizioni di autorizzazione, superata oppure dipendente da più di una fonte.
I casi fuori dalla knowledge base sono necessari per misurare un comportamento prudente, non solo il recall sulle risposte note.
I test delle autorizzazioni sono altrettanto importanti per un indice domestico. Un risultato semanticamente perfetto ma non autorizzato dovrebbe essere valutato come un errore del sistema, non come un recupero eccellente.
Includi esempi con quasi-duplicati e conflitti tra versioni, in modo che il sistema non possa migliorare semplicemente le metriche medie restituendo più candidati. Le prove attese dovrebbero identificare la fonte autorevole, non solo l'argomento.
La gestione delle versioni del dataset trasforma i test una tantum in un controllo delle regressioni
Nel tempo cambiano sia il corpus sia le domande. Nuovi dispositivi, cartelle rinominate, policy aggiornate e un vocabolario diverso degli utenti possono rendere non rappresentativo un vecchio set di valutazione; perciò anche i dati di test hanno bisogno di un ciclo di vita controllato.
Il controllo delle versioni del dataset consente di confrontare i risultati della pipeline con uno stato noto degli esempi di valutazione.
Il flusso di lavoro per la knowledge base privata è il livello applicativo; il dataset di valutazione è ciò che rende misurabili le modifiche a quel flusso di lavoro, invece di lasciarle a valutazioni aneddotiche.
Aggiorna il dataset quando cambiano il corpus o il comportamento degli utenti, ma conserva le versioni storiche, così un nuovo set di valutazione non cancellerà le prove che una modifica al recupero ha causato una regressione in un flusso di lavoro critico precedente.
Hub Tecnologico e AI
Altro da leggere

Che cos’è lo stato di Plex e quali parti devono essere persistenti?
Lo stato persistente di Plex è l’insieme di informazioni che conserva l’esperienza del server tra un riavvio e una ricostruzione; i contenuti multimediali e...

In che modo Plex gestisce l’autenticazione nelle sessioni locali e remote?
L’autenticazione Plex inizia con l’identità del server e dell’account; quindi i percorsi di rete locali o remoti determinano la raggiungibilità e il comportamento della...

Perché la ricerca in Plex può rallentare man mano che aumentano i dati della libreria?
La crescita della libreria, da sola, non è la diagnosi. Verifica la struttura delle query, gli indici, lo stato della cache, la latenza dello...

