Come misurare la qualità del recupero RAG locale e interpretare recall, precisione e copertura delle citazioni

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

La qualità del RAG locale è misurabile quando le evidenze etichettate, le metriche di recupero e i controlli delle citazioni a livello di affermazione vengono valutati separatamente su un insieme rappresentativo di query.

Una risposta fluida può nascondere una fonte mancata, mentre un buon sistema di recupero può fornire passaggi corretti a un generatore che li cita male. Inizia con query per cui i blocchi pertinenti sono noti, quindi valuta l’elenco dei primi k risultati prima di generare le risposte. La copertura delle citazioni appartiene al livello della risposta e non deve essere usata come sostituto del recall del recupero.

Crea la verità di riferimento prima di calcolare qualsiasi metrica

Per ogni query di test, identifica tutti i blocchi di evidenza accettabili o almeno un insieme di valutazione difendibile. Includi ricerche dirette, domande di sintesi, casi di aggiornamento, abbreviazioni, lingue e limiti di autorizzazione. Separa le domande usate per la messa a punto da un insieme di test mantenuto separato.

Una panoramica pratica della valutazione del RAG raccomanda di valutare separatamente i componenti di recupero e generazione, perché i punteggi end-to-end non consentono di localizzare il problema.

La verità di riferimento può essere incompleta in una raccolta ampia. Riunisci i risultati di diversi sistemi di recupero, valuta l’unione e contrassegna i casi incerti invece di considerare irrilevante ogni blocco non valutato. Etichette deboli producono metriche dall’aspetto preciso ma fuorvianti.

Recall e precision rispondono a domande diverse sul recupero

Il Recall@k è il numero di blocchi pertinenti recuperati nei primi k risultati diviso per il numero totale di blocchi pertinenti noti. La Precision@k è il numero di blocchi pertinenti nei primi k risultati diviso per k. Un valore di k più alto di solito migliora il recall, introducendo però più rumore, quindi le due metriche vanno interpretate insieme.

Le definizioni classiche di precision e recall stabiliscono questo compromesso nel recupero delle informazioni. Non tengono conto della posizione nella graduatoria, quindi aggiungi MRR o nDCG quando l’evidenza iniziale è importante.

Una query con un solo passaggio pertinente ha un Recall@5 pari a 1,0 se quel passaggio compare in una qualsiasi delle cinque posizioni, ma la Precision@5 è solo 0,2. Ciò può essere accettabile per un riclassificatore, ma rumoroso per un generatore con contesto ridotto. Gli obiettivi delle metriche dipendono dal budget di evidenza a valle.

La copertura delle citazioni verifica le affermazioni, non i link

Suddividi la risposta generata in affermazioni verificabili. La copertura delle citazioni è il numero di affermazioni supportate diviso per il numero di affermazioni che richiedono evidenze; la correttezza delle citazioni verifica se ogni passaggio citato supporta effettivamente l’affermazione a cui è associato. Una risposta può contenere molti link e avere comunque una copertura scarsa.

Un lavoro recente sul recupero consapevole delle citazioni valuta la copertura delle query e la verificabilità delle affermazioni atomiche, perché un singolo punteggio aggregato di rilevanza non può far emergere i frammenti di risposta non supportati.

La copertura delle citazioni perde significato quando le affermazioni non vengono segmentate in modo coerente o quando le conoscenze generali e le affermazioni che richiedono una fonte vengono mescolate senza una policy. Inoltre, non può dimostrare che la risposta sia completa. Più citazioni non significano automaticamente un ancoraggio migliore alle fonti.

Usa una regola decisionale che preservi la separazione diagnostica

Esegui prima il recupero e salva gli ID dei blocchi ordinati, i punteggi e le versioni. Calcola Recall@k, Precision@k, MRR o nDCG, quindi genera dai risultati congelati e valuta fedeltà, rilevanza della risposta, copertura delle citazioni e correttezza delle citazioni.

Una valutazione controllata del RAG riporta insieme precision contestuale, recall contestuale, fedeltà e rilevanza della risposta, mostrando perché nessun singolo punteggio è sufficiente.

Approva una release solo quando il recall del recupero raggiunge la soglia minima, la precision resta entro il budget di contesto e ogni affermazione sostanziale della risposta è supportata o qualificata esplicitamente. Se il recall non è sufficiente, correggi l’indicizzazione o il recupero; se le citazioni falliscono pur in presenza di evidenze corrette, correggi la generazione e l’attribuzione.

Applica un’unica soglia di rilascio a recupero e citazioni

Costruisci almeno 50 query rappresentative per un piccolo sistema domestico, aumentando a 100–200 con la crescita dei tipi di documento e delle lingue. Valuta le evidenze nei primi 5 e 10 risultati, congela l’insieme dei risultati, quindi verifica le affermazioni generate. Riporta le medie macro e gli strati di query con le prestazioni peggiori.

Conserva il test accanto ai contenuti sulla valutazione dei formati RAG, così le fonti ricche di tabelle e quelle narrative vengono rappresentate invece di essere mediate insieme. Gestisci la versione di ogni ID di blocco e di ogni giudizio di rilevanza.

Usa soglie iniziali come Recall@5 pari a 0,85 e correttezza delle citazioni pari a 0,95 solo come punti di partenza locali, non come standard universali. Rendile più rigorose in base al rischio. Non sacrificare mai la correttezza delle autorizzazioni o le affermazioni ad alto impatto non supportate per ottenere un punteggio aggregato più alto.

Hub Tecnologico e AI

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.