La qualità del RAG locale è misurabile quando le evidenze etichettate, le metriche di recupero e i controlli delle citazioni a livello di affermazione vengono valutati separatamente su un insieme rappresentativo di query.
Una risposta fluida può nascondere una fonte mancata, mentre un buon sistema di recupero può fornire passaggi corretti a un generatore che li cita male. Inizia con query per cui i blocchi pertinenti sono noti, quindi valuta l’elenco dei primi k risultati prima di generare le risposte. La copertura delle citazioni appartiene al livello della risposta e non deve essere usata come sostituto del recall del recupero.
Crea la verità di riferimento prima di calcolare qualsiasi metrica
Per ogni query di test, identifica tutti i blocchi di evidenza accettabili o almeno un insieme di valutazione difendibile. Includi ricerche dirette, domande di sintesi, casi di aggiornamento, abbreviazioni, lingue e limiti di autorizzazione. Separa le domande usate per la messa a punto da un insieme di test mantenuto separato.
Una panoramica pratica della valutazione del RAG raccomanda di valutare separatamente i componenti di recupero e generazione, perché i punteggi end-to-end non consentono di localizzare il problema.
La verità di riferimento può essere incompleta in una raccolta ampia. Riunisci i risultati di diversi sistemi di recupero, valuta l’unione e contrassegna i casi incerti invece di considerare irrilevante ogni blocco non valutato. Etichette deboli producono metriche dall’aspetto preciso ma fuorvianti.
Recall e precision rispondono a domande diverse sul recupero
Il Recall@k è il numero di blocchi pertinenti recuperati nei primi k risultati diviso per il numero totale di blocchi pertinenti noti. La Precision@k è il numero di blocchi pertinenti nei primi k risultati diviso per k. Un valore di k più alto di solito migliora il recall, introducendo però più rumore, quindi le due metriche vanno interpretate insieme.
Le definizioni classiche di precision e recall stabiliscono questo compromesso nel recupero delle informazioni. Non tengono conto della posizione nella graduatoria, quindi aggiungi MRR o nDCG quando l’evidenza iniziale è importante.
Una query con un solo passaggio pertinente ha un Recall@5 pari a 1,0 se quel passaggio compare in una qualsiasi delle cinque posizioni, ma la Precision@5 è solo 0,2. Ciò può essere accettabile per un riclassificatore, ma rumoroso per un generatore con contesto ridotto. Gli obiettivi delle metriche dipendono dal budget di evidenza a valle.
La copertura delle citazioni verifica le affermazioni, non i link
Suddividi la risposta generata in affermazioni verificabili. La copertura delle citazioni è il numero di affermazioni supportate diviso per il numero di affermazioni che richiedono evidenze; la correttezza delle citazioni verifica se ogni passaggio citato supporta effettivamente l’affermazione a cui è associato. Una risposta può contenere molti link e avere comunque una copertura scarsa.
Un lavoro recente sul recupero consapevole delle citazioni valuta la copertura delle query e la verificabilità delle affermazioni atomiche, perché un singolo punteggio aggregato di rilevanza non può far emergere i frammenti di risposta non supportati.
La copertura delle citazioni perde significato quando le affermazioni non vengono segmentate in modo coerente o quando le conoscenze generali e le affermazioni che richiedono una fonte vengono mescolate senza una policy. Inoltre, non può dimostrare che la risposta sia completa. Più citazioni non significano automaticamente un ancoraggio migliore alle fonti.
Usa una regola decisionale che preservi la separazione diagnostica
Esegui prima il recupero e salva gli ID dei blocchi ordinati, i punteggi e le versioni. Calcola Recall@k, Precision@k, MRR o nDCG, quindi genera dai risultati congelati e valuta fedeltà, rilevanza della risposta, copertura delle citazioni e correttezza delle citazioni.
Una valutazione controllata del RAG riporta insieme precision contestuale, recall contestuale, fedeltà e rilevanza della risposta, mostrando perché nessun singolo punteggio è sufficiente.
Approva una release solo quando il recall del recupero raggiunge la soglia minima, la precision resta entro il budget di contesto e ogni affermazione sostanziale della risposta è supportata o qualificata esplicitamente. Se il recall non è sufficiente, correggi l’indicizzazione o il recupero; se le citazioni falliscono pur in presenza di evidenze corrette, correggi la generazione e l’attribuzione.
Applica un’unica soglia di rilascio a recupero e citazioni
Costruisci almeno 50 query rappresentative per un piccolo sistema domestico, aumentando a 100–200 con la crescita dei tipi di documento e delle lingue. Valuta le evidenze nei primi 5 e 10 risultati, congela l’insieme dei risultati, quindi verifica le affermazioni generate. Riporta le medie macro e gli strati di query con le prestazioni peggiori.
Conserva il test accanto ai contenuti sulla valutazione dei formati RAG, così le fonti ricche di tabelle e quelle narrative vengono rappresentate invece di essere mediate insieme. Gestisci la versione di ogni ID di blocco e di ogni giudizio di rilevanza.
Usa soglie iniziali come Recall@5 pari a 0,85 e correttezza delle citazioni pari a 0,95 solo come punti di partenza locali, non come standard universali. Rendile più rigorose in base al rischio. Non sacrificare mai la correttezza delle autorizzazioni o le affermazioni ad alto impatto non supportate per ottenere un punteggio aggregato più alto.
Hub Tecnologico e AI
Altro da leggere

Perché l’elaborazione delle funzionalità della casa intelligente diventa più importante all’aumentare del numero di sensori con la stessa frequenza di campionamento?
Monitora i calcoli per sensore e tra sensori all’aumentare del numero di dispositivi, identifica i costi di fusione non lineari e valuta le prestazioni...

Perché il costo della valutazione RAG diventa più importante con l’aumentare della libreria di documenti, a parità di volume di query?
Comprendi perché la crescita del corpus aumenta lo sforzo di valutazione del RAG senza un aumento delle query degli utenti e come i test...

Perché il sovraccarico degli strumenti dell’agente è più importante all’aumentare dei passaggi del flusso di lavoro a parità di dimensioni del modello?
Analizza come le attese seriali, la crescita del contesto, i tentativi e l’affidabilità si accumulano tra i passaggi dell’agente, quindi misura separatamente il costo...

