Waarom verwijst een RAG-pipeline naar het juiste bestand, maar naar de verkeerde passage?

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Een RAG-pijplijn kan naar het juiste bestand verwijzen, maar naar de verkeerde passage wanneer documentdetectie slaagt en het ophalen van chunks of het koppelen van citaten mislukt.

Grote bestanden bevatten vaak veel secties met dezelfde terminologie, herhaalde kopteksten, vergelijkbare voorbeelden of meerdere versies van hetzelfde feit. Een retriever op bestandsniveau kan de relevante handleiding, het juiste rapport of de juiste huishoudelijke notitie correct identificeren, terwijl de fase op passageniveau een aangrenzende chunk selecteert. Het antwoordmodel kan het ontbrekende detail vervolgens afleiden uit zijn eigen kennis of uit een andere chunk, maar de metadata van het geselecteerde bestand eraan koppelen. Betrouwbare citaten vereisen onafhankelijke correctheid op document-, pagina-, chunk-, fragment- en generatieniveau.

Document recall en passage recall zijn verschillende retrievalproblemen

Een bestand kan hoog scoren omdat de titel, metadata of algemene embedding overeenkomt met de vraag. Dat bewijst niet dat de alinea die het antwoord bevat, voorkomt in de opgehaalde chunks.

Een praktische RAG-gids voor fouten maakt onderscheid tussen lagen van retrievalfouten en raadt aan de exacte chunks te inspecteren in plaats van alleen het uiteindelijke antwoord.

De pijplijn moet document recall, pagina recall en chunk recall afzonderlijk meten. Een correcte bestandsnaam kan verhullen dat het relevante antwoordfragment is gemist.

Chunkgrenzen kunnen het bewijs van de context scheiden

Bij een splitsing in vaste afmetingen kunnen een koptekst in de ene chunk, de bewering in een andere en de uitzondering of het tabelopschrift in een derde chunk terechtkomen.

De gids van Edtek beschrijft hoe verkeerde chunkgrenzen passages opleveren die de zoekopdracht vermelden zonder het volledige antwoord te bevatten.

De retriever kan nog steeds het juiste bestand selecteren omdat veel chunks over hetzelfde onderwerp gaan. De generator ontvangt een onvolledige passage en citeert de bron op bestandsniveau alsof die de bewering bewijst.

Structureel chunken, parent-child-retrieval en het uitbreiden met aangrenzende chunks helpen alleen wanneer bronoffsets traceerbaar blijven.

Citatiemetadata kan aan het verkeerde detailniveau worden gekoppeld

Sommige pijplijnen kopiëren één document-URL of bestandsnaam naar elke chunk zonder pagina, sectie, begrenzingsvak of tekenoffsets op te slaan.

De citatiegids van Tensorlake laat zien hoe ruimtelijke ankers vanuit de voorbewerking van documenten kunnen doorstromen naar retrieval en het genereren van antwoorden.

Een verwijzing die alleen naar een bestand wijst, bewijst waar het corpusitem vandaan kwam, maar niet welke bytes de zin ondersteunen. Citaten op passageniveau vereisen een stabiele chunkidentiteit en locatiegegevens.

OCR, PDF-heropmaak en bewerkte documenten kunnen offsets ongeldig maken, tenzij het citaat ook de geïndexeerde snapshot of content-hash vastlegt.

Vergelijkbare passages kunnen ervoor zorgen dat de generator ID’s verwisselt

De context kan meerdere chunks uit hetzelfde bestand bevatten met vergelijkbare formuleringen. Het model kan de inhoud van de ene passage gebruiken en het citalabel van een andere nabijgelegen chunk genereren.

Een artikel over citatiekritische RAG waarschuwt dat fouten met nabijgelegen passages mogelijk blijven, zelfs wanneer het geciteerde document gezaghebbend is.

Geef chunks duidelijke, niet-overeenkomstige ID’s en houd het citaat naast de ondersteunende tekst. Als je het model na de synthese een afzonderlijke citatietoewijzing laat onthouden, neemt het risico op mismatches toe.

Deterministische verificatie van citaat naar chunk kan detecteren wanneer de geciteerde passage de beweerde of geciteerde tekst niet bevat.

Reranking moet ondersteuning door de passage beoordelen, niet alleen onderwerpsovereenkomst

Een retriever in de eerste fase kan veel chunks uit het juiste bestand ophalen. Een reranker moet de sectie die de vraag rechtstreeks beantwoordt onderscheiden van secties die alleen hetzelfde onderwerp delen.

De chunking-gids van Databricks benadrukt dat coherente retrievaleenheden nodig zijn voordat latere retrievalfasen passages nauwkeurig kunnen rangschikken.

Voer reranking uit met de volledige vraag, behoud de koptekst en bovenliggende context van de passage en geef chunks een lagere score als ze het gevraagde veld, de gevraagde datum, entiteit of het gevraagde bewijstype missen.

De workflow voor zoeken in documenten van ZimaSpace behandelt dit als afzonderlijke fasen in plaats van als één algemene score voor “RAG-kwaliteit”.

Controleer de exacte passage voordat je het citaat weergeeft

Koppel elke feitelijke zin of elk citaat na het genereren terug aan de chunk die de onderbouwing bevat. Wijs citaten af die alleen naar het juiste bestand verwijzen.

Infolitz raadt aan citaten te koppelen aan bronhoudende chunks in plaats van ze op bestandsniveau te reconstrueren.

Evalueer de precisie van passages, volledigheid van het bewijs, aanwezigheid van geciteerde tekst, geldigheid van citaatoffsets en of het geciteerde fragment de exacte gegenereerde bewering ondersteunt.

Het systeem is pas hersteld wanneer het klikken op het citaat de kleinst mogelijke toereikende passage opent — niet alleen ergens in de buurt van het antwoord het juiste document.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.