Gedeeltelijke bestandsupdates laten verouderde RAG-passages achter wanneer nieuwe chunks worden ingevoegd zonder elk geïndexeerd fragment dat van de oudere bestandsversie is afgeleid ongeldig te maken.
Een lokale kennisbank slaat zelden één vector per bestand op. De tekst wordt geëxtraheerd, het bestand wordt in chunks verdeeld, embeddings worden gegenereerd, metadata wordt toegevoegd en verwerkte of opgehaalde resultaten kunnen worden gecachet. Door één alinea te bewerken kunnen latere chunkgrenzen verschuiven, hashes veranderen, oude tekst verdwijnen en nieuwe chunk-ID's ontstaan. Als het updatepad alleen de gewijzigde of nieuw gedetecteerde onderdelen verwerkt, kunnen oude passages naast de vervangende inhoud doorzoekbaar blijven, ook al ziet het bronbestand er correct uit.
Eén bronbestand wordt meerdere onafhankelijke indexrecords
Een documentupdate is geen update van één databaseregel wanneer de ingestiepijplijn meerdere chunks, paginarecords, samenvattingen en embeddings opslaat.
OptyxStack legt uit dat gedeeltelijke vervanging gemengde oude en nieuwe chunks uit dezelfde documentfamilie kan achterlaten.
De nieuwe passage kan met succes worden geïndexeerd, terwijl een oudere passage met een andere identifier vanuit het perspectief van de vectordatabase nog steeds geldig blijft.
Kleine bewerkingen kunnen elke latere chunkgrens verschuiven
Door één alinea aan het begin toe te voegen, veranderen de tokenposities die vaste of overlappende chunkers gebruiken. Verschillende latere chunks kunnen daardoor nieuwe inhoud krijgen, zelfs wanneer hun brontekst niet rechtstreeks is bewerkt.
Extend beschrijft hoe ingestieverschuiving ontstaat wanneer aannames over chunking en metadata tussen documenten of updates veranderen.
Een updater die alleen het zichtbaar bewerkte gebied opnieuw van embeddings voorziet, kan latere chunks missen waarvan de grenzen of overlap zijn veranderd. Alleen stabiele bronoffsets zijn niet voldoende wanneer extractie of chunking een nieuwe indeling oplevert.
De identiteit van de documentversie moet alle afgeleide records groeperen, zodat de pijplijn indien nodig de volledige oude familie kan vervangen.
Invoegpaden worden vaak beter getest dan verwijderpaden
Ingestietaken controleren vanzelfsprekend of nieuwe chunks zijn aangemaakt. Ze bewijzen mogelijk niet dat uit de bron verwijderde chunks niet langer doorzoekbaar zijn.
De analyse van Ranjan Kumar over de actualiteitskloof van indexen behandelt invoeg-, update- en verwijdergebeurtenissen als afzonderlijke wijzigingen die allemaal moeten worden doorgegeven.
Een hernoemde sectie of verwijderde alinea kan onbeperkt blijven bestaan wanneer de updateworker wel upserts uitvoert, maar geen tombstone of inventaris van oude chunks heeft.
Test verwijdering door na elk updatepad te zoeken naar kenmerkende zinnen uit de verwijderde inhoud.
Een geslaagde taak kan de index toch gedeeltelijk bijgewerkt achterlaten
Parsen, chunking, embedding, verwijderen, invoegen, metadata wegschrijven en cache-invalidering kunnen als afzonderlijke stappen worden uitgevoerd. Sommige stappen kunnen slagen voordat een andere worker faalt.
Jamie Maguire beschrijft de operationele kloof waarbij een ingestietaak succesvol lijkt of gedeeltelijk wordt voltooid, terwijl de zoekindex verouderd blijft.
Een enkele eindstatus kan verbergen welke bestandsversie, welk aantal chunks en welke embeddingset daadwerkelijk doorzoekbaar werd. Registreer de voltooiing per fase en de laatst volledig vastgelegde documentversie.
Indexfragmentatie laat conflicterende versies met elkaar concurreren
Wanneer verouderde en actuele passages dezelfde bestandsnaam of document-ID delen, kunnen beide relevant lijken voor dezelfde zoekopdracht.
De checklist met foutscenario's van LlamaIndex noemt indexfragmentatie als oorzaak van tegenstrijdige zoekresultaten en verouderde gegevens na bronupdates.
Het antwoordmodel kan de oude formulering selecteren omdat die een sterkere lexicale overeenkomst of een kortere, duidelijkere chunk heeft. Actualiteitsmetadata helpt alleen wanneer de retriever of reranker deze daadwerkelijk gebruikt.
Dubbele inhoud moet worden onderdrukt op basis van bronversie en inhoudsidentiteit, niet alleen op basis van vectorsimilariteit.
Stem de index af voordat je een nieuwe documentversie activeert
Een lokale pijplijn moet bronbestanden periodiek vergelijken met geïndexeerde documentfamilies, chunkhashes, versies en verwijderingsmarkeringen, in plaats van alleen te vertrouwen op watcher-events of succesvolle aantallen upserts.
Oracle's handleiding over indexafwijkingen beveelt afstemming tussen bron en index aan, zodat bijgewerkte en verwijderde inhoud na ingestie wordt geverifieerd.
Bouw de vervangende chunks op een nieuwe documentversie, controleer hun aantal, metadata en zoekgedrag en schakel vervolgens over naar de actieve versie voordat je de vorige familie buiten gebruik stelt. Zo voorkom je dat een onvoltooide verwijderings- of embeddingtaak twee versies als even actueel beschikbaar maakt.
Het artikel van ZimaSpace over indexering op de achtergrond legt uit waarom wijzigingsdetectie slechts één onderdeel is van de grotere extractie- en databasepijplijn.
De veiligste update is niet altijd de kleinste update. Voor korte bestanden in huis kan het vervangen van één volledige documentfamilie eenvoudiger en betrouwbaarder zijn dan een kwetsbare patch op chunniveau proberen uit te voeren.
Veelgestelde vragen
Wordt elke chunk bijgewerkt wanneer de wijzigingsdatum van het bestand verandert?
Nee. De watcher kan het bestand detecteren, maar de ingestiecode moet nog steeds alle records identificeren, vervangen en ongeldig maken die van de oudere versie zijn afgeleid.
Kunnen vectorsimilariteit verouderde chunks automatisch onderdrukken?
Nee. Oude en nieuwe passages kunnen beide semantisch relevant zijn. Similariteit bepaalt niet welke versie actueel is.
Is een volledige herbouw van de index altijd nodig?
Nee. Vervanging van documentfamilies en afstemming kunnen incrementele werking behouden, maar de verwijderings- en versiepaden moeten net zo zorgvuldig worden getest als het invoegpad.
Tech & AI HUB
Meer om te lezen

Waarom worden voorspellingen voor slimme woningen minder nauwkeurig nadat routines door seizoensveranderingen zijn gewijzigd?
Seizoensgebonden routines veranderen de relatie tussen tijd, sensoren, aanwezigheid en gewenste acties, waardoor een model dat op oudere gewoonten is getraind verouderd raakt.

Waarom mist een thuis-NVR korte gebeurtenissen wanneer objecttracking is ingeschakeld?
Tracking heeft voldoende detecties nodig om een traject te starten en te bevestigen. Daardoor kan een object kortstondig verdwijnen voordat de NVR een geldig...

Waarom veranderen AI-fotolabels na een modelupgrade?
Een modelupgrade verandert de representatie en rangschikking die worden gebruikt om labels toe te wijzen, waardoor dezelfde foto verschillende semantische of betrouwbaarheidsgrenzen kan overschrijden.

