L’accuratezza delle citazioni nel RAG dipende dal recupero dell’intervallo corretto della fonte e dal suo collegamento all’affermazione esatta che supporta, non dal semplice elenco di documenti pertinenti.
Una knowledge base domestica può rispondere basandosi su una polizza assicurativa, sul manuale di un elettrodomestico o su una fattura scansionata e citare comunque la pagina sbagliata. Il documento corretto può essere presente, mentre la frase di supporto è stata suddivisa, classificata sotto un altro chunk o collegata all’affermazione generata sbagliata. La qualità delle citazioni riflette quindi congiuntamente ingestione, recupero, generazione, allineamento e controllo delle versioni.
La qualità della fonte e dei chunk stabilisce il limite massimo dell’evidenza
Gli errori OCR, le tabelle mancanti, le copie obsolete e i titoli persi compromettono l’evidenza prima ancora che inizi il recupero. I confini dei chunk devono preservare l’affermazione, la precisazione e il contesto identificativo necessari a supportare una tesi; un frammento contenente solo un numero può corrispondere senza dimostrare che cosa misuri.
La ricerca che confronta le strategie avanzate di chunking rileva che le scelte di segmentazione dei documenti modificano le prestazioni del recupero, perché i chunk fissi possono separare concetti o mescolare contenuti non correlati. L’accuratezza delle citazioni non può superare la qualità dell’intervallo disponibile per la citazione.
I metadati devono conservare la versione del documento, la pagina, la sezione e le coordinate, così che la citazione rimandi a un’evidenza verificabile. La deduplicazione deve impedire che copie obsolete e attuali competano tra loro senza eliminare la versione storica utilizzata da una risposta precedente.
Recupero e generazione devono preservare l’allineamento a livello di affermazione
Un retriever può restituire una pagina pertinente per argomento che non implica la frase finale. Il reranking dovrebbe dare priorità al supporto diretto, mentre la generazione dovrebbe mantenere visibili i confini delle affermazioni e gli identificativi delle fonti, in modo che ogni segmento fattuale corrisponda all’evidenza effettivamente presente nel contesto.
La ricerca sulla fedeltà delle citazioni distingue la correttezza dalla fedeltà delle citazioni e segnala che citazioni apparentemente di supporto possono essere state associate dopo che il modello si è basato su altre informazioni. Per questo la sola concordanza superficiale può sovrastimare l’affidabilità.
La copertura e la correttezza delle citazioni sono aspetti distinti. Una risposta può citare accuratamente due affermazioni lasciandone tre senza supporto, oppure citare ogni frase con un unico documento ampio che non ne supporta precisamente nessuna. Entrambe le dimensioni richiedono misurazioni indipendenti. Questa distinzione resta visibile anche durante i successivi test domestici.
Il post-processing può correggere i collegamenti, ma non recuperare l’evidenza mancante
Un verificatore può confrontare ogni affermazione generata con i passaggi candidati, spostare una citazione verso una fonte migliore o rimuovere un’affermazione priva di supporto. Questo consente di individuare gli errori di allineamento dopo la generazione, ma non può recuperare l’evidenza che l’ingestione o il recupero non hanno mai fornito.
Il sistema di correzione delle citazioni verifica le citazioni generate confrontandole con gli articoli recuperati e riporta una maggiore accuratezza delle citazioni con un costo aggiuntivo limitato. I suoi risultati dimostrano il valore di una fase dedicata all’allineamento dopo la stesura della risposta. Il risultato intermedio deve restare verificabile prima che proceda l’automazione.
Il limite del fallimento è rappresentato da un’affermazione sicura di sé senza alcuna fonte implicante nell’insieme recuperato. Il verificatore dovrebbe astenersi, effettuare un nuovo recupero o eliminare l’affermazione, invece di assegnare la citazione dall’aspetto più simile facendo sembrare la risposta fondata.
Valuta separatamente il supporto e la copertura delle citazioni
Prepara cinquanta domande con intervalli di risposta verificati, includendo PDF puliti, scansioni OCR, tabelle, versioni duplicate e casi senza risposta. Suddividi ogni risposta generata in affermazioni atomiche, quindi valuta se ciascuna citazione implica la propria affermazione e se ogni affermazione fattuale dispone di una citazione.
Utilizza il framework di richiamo, precisione e copertura descritto nel framework di valutazione RAG, ma aggiungi l’implicazione della citazione, la correttezza della versione e una pagina o una regione risolvibile. Confronta i risultati per tipo di documento invece di riportare un solo punteggio aggregato. Questo limite dovrebbe essere misurato separatamente in condizioni operative realistiche.
Considera il test superato solo quando le citazioni rimandano a intervalli attuali e verificabili e le affermazioni prive di supporto attivano l’astensione o un altro tentativo di recupero. Quando una fonte è pertinente ma non implica la frase, considerala una citazione inaccurata anziché un successo parziale.
Hub Tecnologico e AI
Altro da leggere

Quali funzionalità consentono di ottenere un output JSON affidabile da un LLM locale?
Scopri quali funzionalità impongono la sintassi JSON, quali proteggono la correttezza semantica e come testare un modello locale con diversi schemi, prompt e casi...

Provenienza dei dati dell’IA locale: perché ogni risposta necessita di un percorso delle fonti tracciabile
Scopri come i percorsi delle fonti rendono verificabili le risposte dell’IA locale, perché le sole citazioni sono incomplete e come testare la provenienza attraverso...

Indicizzazione tramite hash dei contenuti: come le impronte digitali dei file evitano il lavoro ridondante dell’IA
Scopri come le impronte digitali di file e blocchi guidano l’indicizzazione incrementale, perché i metadati non sono sufficienti e in quali casi gli hash...

