RAG-evaluatie wordt belangrijker naarmate een bibliotheek groeit, omdat ambiguïteit bij het ophalen en het regressieoppervlak toenemen, zelfs wanneer gebruikers hetzelfde aantal vragen stellen.
Een gezin kan nog steeds 100 zoekopdrachten per week uitvoeren nadat zijn archief is gegroeid van 10.000 naar één miljoen chunks. Elke zoekopdracht heeft nu echter meer bijna-duplicaten, verouderde versies, talen en toestemmingsgrenzen die met elkaar kunnen concurreren om een hoge positie. Een kleine vaste testset dekt een steeds kleiner deel van de mogelijke fouten bij het ophalen binnen elke nieuw toegevoegde inhoudslaag.
Meer kandidaten zorgen voor meer manieren om aannemelijke fouten op te halen
Een benaderende zoekopdracht beoordeelt niet elke passage exact. Naarmate het corpus groeit, kunnen meer chunks dicht bij een zoekopdracht liggen, waaronder overtollig en verouderd bewijsmateriaal. De precisie kan dalen, zelfs als het aantal zoekopdrachten en top-k ongewijzigd blijven.
Een gecontroleerde studie naar strategieën voor het ophalen vergelijkt dense, hybride, opnieuw gerangschikte en uitgebreide retrieval onder vaste generatieomstandigheden. Daaruit blijkt dat veranderingen in strategie meetbare afwegingen tussen precisie en recall opleveren.
Evaluatie moet daarom niet alleen controleren of er een antwoord bestaat, maar ook relevantie, rangschikking, versie en toestemming. Meer documenten vergroten bovendien de kans dat een vloeiend antwoord een aannemelijk maar niet-geautoriseerd duplicaat citeert.
Dekking en labeling groeien mee met de diversiteit van het corpus
Een testset vertegenwoordigt documenttypen, talen, datums, entiteiten en vraagintenties. Wanneer de bibliotheek nieuwe inhoudsfamilies krijgt, vormen de oude vragen niet langer een volledige steekproef van het risicovlak. Voor extra dekking zijn relevantiebeoordelingen en verwacht bewijsmateriaal nodig, zelfs wanneer het productiegebruik onveranderd blijft.
Onderzoek naar informatiedekking stelt dat klassieke precisie en recall mogelijk niet zichtbaar maken of resultaten verschillende informatiebehoeften afdekken. De diversiteit van een corpus kan sneller toenemen dan het aantal zoekopdrachten.
Elke index-, chunker-, embeddingmodel-, filterbeleids- en rerankervariant vermenigvuldigt het aantal vergelijkingen. Geautomatiseerde beoordelaars verminderen de werklast, maar brengen inferentiekosten en hun eigen kalibratiewerk met zich mee. Evaluatiekosten zijn de prijs voor zekerheid over de vraag of groei van het corpus het gedrag heeft veranderd.
Waar bibliotheekgrootte niet de belangrijkste kostenfactor is
De indexgrootte kan weinig effect hebben wanneer zoekopdrachten unieke identifiers gebruiken en deterministische filters eerst de kandidaten beperken. Een groter corpus met homogene duplicaten kan opslag toevoegen zonder betekenisvolle diversiteit in zoekopdrachten te creëren.
Een raamwerk voor verifieerbaarheid van claims splitst zoekopdrachten en antwoorden op in eenheden voor dekking en verifieerbaarheid. Daaruit blijkt dat de evaluatielast zowel afhangt van de structuur van claims als van de omvang van het corpus.
Het mechanisme werkt ook niet wanneer de evaluatiekosten vooral worden bepaald door dure generatie of menselijke beoordeling per antwoord. In dat geval is bibliotheekgroei van ondergeschikt belang. Meer tests zijn niet automatisch beter; redundante vragen kunnen de uitgaven verhogen zonder de risicodekking te vergroten.
Koppel evaluatie-uitgaven aan nieuwe corpusrisico's
Houd een kernset voor regressietests bij en voeg alleen gestratificeerde vragen toe wanneer de bibliotheek een nieuwe taal, documentsoort, toestemmingsklasse, periode of waardevolle entiteit krijgt. Label het vereiste bewijsmateriaal en bekende moeilijke negatieve voorbeelden. Voer eerst uitsluitend retrievalmetrics uit, vóór de duurdere generatiemetrics.
Koppel updates van de tests aan vernieuwingsevenementen van de index, zodat nieuw geïndexeerde of gemiste bestanden gerichte evaluatie activeren in plaats van een volledige ongestructureerde herhaling. Bewaar een vaste hold-out voor vergelijking van trends.
Houd de kosten per gedekte laag en gevonden defect bij, niet de kosten per productiequery. Neem steekproeven van routinematige lagen met een laag risico en test inhoud die gevoelig is voor toestemming of vaak verandert volledig. Als scores alleen in één nieuwe laag afwijken, herstel en herhaal dan eerst dat deel voordat je de volledige suite uitbreidt.
Tech & AI HUB
Meer om te lezen

Hoe je de kwaliteit van lokale RAG-opvragingen meet en recall, precisie en citatiedekking interpreteert
Bouw een lokale RAG-testset, bereken de belangrijkste retrievalmetrics, interpreteer de afwegingen ertussen en controleer of beweringen in antwoorden worden ondersteund door aangehaald bewijs.

Waarom wordt computation in smart homes belangrijker naarmate het aantal sensoren toeneemt bij dezelfde bemonsteringsfrequentie?
Houd de berekeningen per sensor en tussen sensoren bij naarmate het aantal apparaten toeneemt, identificeer niet-lineaire fusiekosten en benchmark de functiepijplijn voordat automatiseringen vertraging...

Waarom wordt de overhead van agenttools belangrijker naarmate het aantal workflowstappen toeneemt bij dezelfde modelgrootte?
Breng in kaart hoe seriële wachttijden, contextgroei, herpogingen en betrouwbaarheid zich opstapelen over agentstappen heen, en meet vervolgens de uitvoeringsoverhead afzonderlijk van de modelinferentie.

