Volledige verwijdering van persoonsgegevens uit een vectordatabase betekent dat de gegevens niet langer via de API kunnen worden opgevraagd en ook zijn verwijderd, verlopen of cryptografisch onherstelbaar zijn gemaakt in de fysieke indexstatus en alle afhankelijke kopieën.
De complicatie is dat een RAG-systeem één object niet op één plek opslaat. Oorspronkelijke tekst kan chunks, embeddings, metadata, grafiekindexen, caches, replica's, logs, snapshots en back-ups opleveren. Het verwijderen van het primaire record is slechts de eerste overgang in die levenscyclus.
Logische verwijdering en fysieke uitwissing zijn verschillende statussen
Vectorindexen hebben vaak snelle mutaties nodig zonder grote grafiek- of segmentstructuren onmiddellijk opnieuw op te bouwen. Een verwijderbewerking kan een punt daarom markeren als niet beschikbaar voor normale query's, terwijl oude bytes in een indexsegment blijven staan totdat compactie, optimalisatie of segmentvervanging plaatsvindt.
De studie Ghost Vectors uit 2026 liet zien dat zacht verwijderde embeddings fysiek herstelbaar kunnen blijven uit onbewerkte HNSW-indexbestanden, zelfs na verwijdering op API-niveau. De onderzoekers toonden aan dat gevoelige kenmerken uit verschillende soorten embeddings konden worden teruggewonnen, waardoor het onderscheid tussen onzichtbaarheid in zoekresultaten en fysieke uitwissing concreet wordt.
Dit betekent niet dat elke vectordatabase elke verwijderde vector voor altijd bewaart. Het betekent dat een verwijderingsgarantie de opschoningslevenscyclus van de opslagengine moet beschrijven. “De query retourneert het niet langer” is een functionele test, geen bewijs dat de onderliggende representatie is verdwenen.
Afgeleide kopieën vergroten het verwijderingsoppervlak tot voorbij de hoofdvector
Een privédocument kan bestaan als onbewerkte tekst, meerdere chunks, embeddings, documentmetadata, caches voor herordening, gegenereerde samenvattingen, gesprekscitaten en caches met zoekresultaten. Als een afgeleide kopie de verwijderde persoonsgegevens nog kan onthullen, is het verwijderen van één embedding-ID niet voldoende om aan het verzoek van de gebruiker te voldoen.
Een workflow voor gegevenswissing in private RAG benadrukt de reikwijdte van RAG-verwijdering voor bronrecords, embeddings, afgeleide indexen en bewaarlagen. De belangrijkste architectuurles is provenance: elk gegenereerd record heeft een stabiel pad terug naar de bronidentiteit nodig, zodat een verwijderingsverzoek zijn afstammelingen kan vinden.
Het gerelateerde ZimaSpace-artikel over tombstones in vectorindexen onderzoekt één mechanisme op indexniveau. Volledige uitwissing is breder, omdat persoonsgegevens door de hele retrieval-stack moeten worden gevolgd en niet alleen een graafknooppunt uit normale zoekopdrachten moet worden verwijderd.
Compactie, replica's en back-ups zorgen voor verschillende tijdlijnen voor uitwissing
Live replica's moeten verwijderingen mogelijk onmiddellijk verwerken, terwijl onveranderlijke back-ups de oude gegevens kunnen bewaren totdat hun gedocumenteerde bewaartermijn verstrijkt. Een compactietaak kan indexsegmenten fysiek later herschrijven dan het moment van de API-verwijdering. Deze tijdlijnen moeten expliciet zijn, zodat het systeem onderscheid kan maken tussen “niet toegankelijk”, “opschoning in behandeling” en “verlopen in alle bewaarde kopieën”.
De uitleg van Qdrant over opschoning door de optimizer beschrijft hoe verwijderde punten en gefragmenteerde segmenten via optimalisatie worden verwerkt, in plaats van ervan uit te gaan dat elke mutatie de opslag onmiddellijk herschrijft. Hoewel de details productspecifiek zijn, illustreert dit een algemene realiteit van vectoropslag: het onderhoud van de fysieke indeling kan achterlopen op logische verwijdering.
Ook voor back-ups is een regel voor herstel nodig. Als een oudere back-up wordt teruggezet, mag het systeem een verwijdering die na die back-up plaatsvond niet stilzwijgend ongedaan maken. Bewaar een duurzaam verwijderingslogboek of vergelijkbare reconciliatiestatus die na disaster recovery opnieuw kan worden toegepast, totdat elke back-up met de oude gegevens is verlopen.
Een verwijderingsclaim heeft een verifieerbare eindstatus nodig
Definieer de objecten waarop het verzoek betrekking heeft, verwijder ze uit online retrieval, verspreid de verwijdering naar replica's en afgeleide kopieën, start het fysieke opschoningsmechanisme van de engine of wacht daarop, en leg vast welke bewaarde back-ups nog historische kopieën bevatten. Test vervolgens zowel normale API-toegang als blootstelling op een lager opslagniveau, passend bij het dreigingsmodel.
Een studie over databasesystemen naar betekenisvolle gegevenswissing bij afhankelijkheden formaliseert een zwaardere eis dan alleen het verwijderen van een rij: resterende gegevensafhankelijkheden mogen niet toestaan dat de gewiste informatie opnieuw afleidbaar wordt. Dat onderstreept de systeemgrens hier: bij verwijdering moet rekening worden gehouden met afhankelijke representaties en bewaarde kopieën, niet alleen met de primaire vector-ID.
Beschouw de verwijdering alleen als voltooid binnen een gedocumenteerde grens: doorzoekbare kopieën zijn nu verdwenen, fysieke opschoning van de actieve opslag is geverifieerd, afgeleide kopieën zijn verwijderd en bewaarde back-ups vallen onder een expliciet verval- of cryptografisch uitwissingsbeleid. Als het systeem niet kan inventariseren waar één brondocument naartoe is verspreid, kan het niet sterk beweren dat een door de gebruiker gevraagde verwijdering elke kopie heeft bereikt.
Tech & AI HUB
Meer om te lezen

Welke invloed heeft downsampling van tijdreeksen op anomaliedetectie in een slimme woning?
Ontdek hoe bucketbreedte, aggregatie, anti-aliasing, ontbrekende gegevens, gebeurtenisduur en retentie op meerdere schalen de detectie van afwijkingen in slimme woningen beïnvloeden.

Hoe combineert een bezettingsraster zwakke signalen van een slim huis?
Leer hoe ruimtelijke cellen, sensormodellen, log-odds-updates, verval, gecorreleerd bewijs en drempelwaarden zwakke signalen uit huis omzetten in bezettingsschattingen.

Hoe beïnvloedt fotometrische normalisatie het clusteren van privégezichten?
Bekijk hoe verlichtingscorrectie gezichtscrops, embeddings, clust afstanden, drempelwaarden, overnormalisatie en de evaluatie van privéfotozoekopdrachten verandert.

