Så mäter du kvaliteten på lokal RAG-hämtning och tolkar återkallning, precision och källhänvisningstäckning

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

Kvaliteten hos lokal RAG kan mätas när märkt evidens, hämtningsmått och kontroller av citeringar på påståendenivå utvärderas separat på en representativ uppsättning frågor.

Ett välformulerat svar kan dölja en missad källa, medan en stark hämtare kan överlämna korrekta textavsnitt till en generator som citerar dem dåligt. Börja med frågor där de relevanta textsegmenten är kända och poängsätt sedan topplistan med k bästa resultat innan du genererar svar. Citatens täckning hör till svarslagret och får inte användas som ersättning för återkallning i hämtningen.

Skapa facit innan du beräknar något mått

För varje testfråga identifierar du alla godtagbara evidenssegment eller åtminstone en försvarbar bedömd mängd. Ta med direkta uppslag, syntesfrågor, fall som rör aktualitet, förkortningar, språk och behörighetsgränser. Dela upp frågor som används för finjustering och en separat testmängd.

En praktisk översikt av RAG-utvärdering rekommenderar att hämtar- och generatorkomponenter utvärderas separat, eftersom poäng för hela kedjan inte kan lokalisera fel.

Facit kan vara ofullständigt i ett stort bibliotek. Samla resultat från flera hämtare, bedöm unionen och markera osäkra fall i stället för att kalla varje ej bedömt segment irrelevant. Svaga etiketter skapar metrik som ser exakt ut men är missvisande.

Återkallning och precision besvarar olika frågor om hämtning

Recall@k är antalet relevanta segment som hämtas bland de k främsta resultaten, dividerat med alla kända relevanta segment. Precision@k är antalet relevanta segment bland de k främsta resultaten, dividerat med k. Ett högre k förbättrar vanligtvis återkallningen men släpper samtidigt in mer brus, så måtten bör läsas tillsammans.

De klassiska definitionerna av precision och återkallning fastställer denna avvägning inom informationshämtning. De tar inte hänsyn till rangordningen, så lägg till MRR eller nDCG när tidig evidens är viktig.

En fråga med ett relevant textavsnitt har Recall@5 på 1,0 om avsnittet förekommer någonstans bland fem resultat, men Precision@5 är bara 0,2. Det kan vara godtagbart för en omrankare men brusigt för en generator med liten kontext. Mål för måtten beror på den efterföljande evidensbudgeten.

Citatens täckning testar påståenden, inte länkar

Dela upp det genererade svaret i kontrollerbara påståenden. Citatens täckning är antalet underbyggda påståenden dividerat med antalet påståenden som kräver evidens; citeringens korrekthet handlar om huruvida varje citerat textavsnitt faktiskt stöder det påstående som det kopplats till. Ett svar kan innehålla många länkar men ändå ha dålig täckning.

Nya arbeten om citatmedveten hämtning utvärderar frågetäckning och verifierbarhet hos atomära påståenden, eftersom ett enda samlat relevansmått inte kan avslöja fragment av svaret som saknar stöd.

Citatens täckning slutar att vara meningsfull när påståenden inte segmenteras konsekvent eller när allmän kunskap och källberoende påståenden blandas utan en policy. Den kan inte heller bevisa att svaret är fullständigt. Fler citat innebär inte automatiskt bättre förankring.

Använd en beslutsregel som bevarar den diagnostiska åtskillnaden

Kör hämtningen först och spara rangordnade segment-ID:n, poäng och versioner. Beräkna Recall@k, Precision@k, MRR eller nDCG, generera sedan från de frysta resultaten och poängsätt tillförlitlighet, svarens relevans, citatens täckning och citeringens korrekthet.

En kontrollerad uppsättning RAG-utvärderingsmått rapporterar kontextuell precision, kontextuell återkallning, tillförlitlighet och svarens relevans tillsammans och visar varför inget enskilt mått är tillräckligt.

Godkänn en version först när återkallningen i hämtningen når sitt minimikrav, precisionen håller sig inom kontextbudgeten och varje väsentligt påstående i svaret har stöd eller uttryckligen kvalificeras. Om återkallningen brister, åtgärda indexering eller hämtning; om citeringarna brister trots att korrekt evidens finns, åtgärda generering och attribuering.

Tillämpa en gemensam versionsspärr för hämtning och citat

Bygg minst 50 representativa frågor för ett litet system i hemmet och utöka till 100–200 när dokumenttyper och språk blir fler. Bedöm evidens bland de fem och tio främsta resultaten, frys resultatmängden och granska sedan de genererade påståendena. Rapportera makrogenomsnitt samt de sämst presterande frågeskikten.

Ha testet bredvid innehållet om RAG-utvärdering av format, så att tabelltunga och berättande källor representeras i stället för att slås ihop i ett genomsnitt. Versionshantera varje segment-ID och relevansbedömning.

Använd inledande minimikrav som Recall@5 på 0,85 och citeringskorrekthet på 0,95 endast som lokala startgränser, inte som universella standarder. Skärp dem utifrån risken. Byt aldrig bort korrekt behörighetshantering eller ogrundade högriskpåståenden mot en högre sammanlagd poäng.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.