La cancellazione completa dei dati personali da un database vettoriale significa che i dati non sono più recuperabili tramite l’API e che sono stati rimossi, sono scaduti oppure sono stati resi irrecuperabili crittograficamente dallo stato fisico degli indici e da tutte le copie dipendenti.
La complicazione è che un sistema RAG non archivia un singolo oggetto in un unico luogo. Il testo originale può generare chunk, embedding, metadati, indici a grafo, cache, repliche, log, snapshot e copie di backup. L’eliminazione del record principale è solo la prima fase di quel ciclo di vita.
La cancellazione logica e la cancellazione fisica sono stati diversi
Gli indici vettoriali spesso richiedono modifiche rapide senza ricostruire immediatamente strutture di grafo o segmenti di grandi dimensioni. Un’operazione di eliminazione può quindi contrassegnare un punto come non disponibile per le query normali, mentre i vecchi byte restano in un segmento dell’indice fino a quando non viene eseguita la compattazione, l’ottimizzazione o la sostituzione del segmento.
Lo studio Ghost Vectors del 2026 ha dimostrato che gli embedding eliminati logicamente possono rimanere fisicamente recuperabili dai file di indice HNSW grezzi anche dopo l’eliminazione a livello di API. I ricercatori hanno dimostrato il recupero di attributi sensibili da diversi tipi di embedding, rendendo concreta la distinzione tra invisibilità nella ricerca e cancellazione fisica.
Questo non significa che ogni database vettoriale conservi per sempre ogni vettore eliminato. Significa che una garanzia di cancellazione deve descrivere il ciclo di pulizia del motore di archiviazione. «La query non lo restituisce più» è un test funzionale, non la prova che la rappresentazione sottostante sia scomparsa.
Le copie derivate ampliano la superficie di cancellazione oltre il vettore principale
Un documento privato può esistere come testo grezzo, diversi chunk, embedding, metadati del documento, cache del reranker, riepiloghi generati, citazioni nelle conversazioni e cache dei risultati di ricerca. Se una qualsiasi derivazione può rivelare le informazioni personali eliminate, cancellare un solo ID di embedding non completa la richiesta a livello utente.
Un flusso di lavoro per la cancellazione dei dati in un sistema RAG privato enfatizza l’ambito della cancellazione RAG tra record sorgente, embedding, indici derivati e livelli di conservazione. La lezione architetturale utile è la provenienza: ogni record generato deve avere un percorso stabile che risalga all’identità della fonte, affinché una richiesta di cancellazione possa trovare tutti i suoi discendenti.
L’articolo correlato di ZimaSpace sui tombstone degli indici vettoriali esamina un meccanismo a livello di indice. La cancellazione completa è più ampia, perché deve seguire i dati personali lungo l’intero stack di recupero, non limitarsi a rimuovere un nodo del grafo dalla ricerca normale.
Compattazione, repliche e backup creano tempistiche di cancellazione diverse
Potrebbe essere necessario propagare immediatamente la cancellazione alle repliche attive, mentre i backup immutabili possono conservare i vecchi dati fino alla scadenza del periodo di conservazione documentato. Un processo di compattazione potrebbe riscrivere fisicamente i segmenti dell’indice in un momento successivo rispetto all’eliminazione tramite API. Queste tempistiche devono essere esplicite, così il sistema può distinguere tra «non accessibile», «cancellazione in attesa» e «scaduto da tutte le copie conservate».
La spiegazione di Qdrant sulla pulizia gestita dall’ottimizzatore descrive come i punti eliminati e i segmenti frammentati vengano gestiti tramite l’ottimizzazione, senza presumere che ogni modifica riscriva immediatamente lo spazio di archiviazione. Sebbene i dettagli siano specifici del prodotto, questo esempio illustra una realtà generale dei database vettoriali: la manutenzione del layout fisico può essere successiva alla cancellazione logica.
Anche i backup richiedono una regola applicabile al ripristino. Se viene ripristinato un backup precedente, il sistema non deve far riapparire silenziosamente una cancellazione avvenuta dopo quel backup. Mantieni un registro durevole delle cancellazioni, o uno stato equivalente di riconciliazione, che possa essere riapplicato dopo un ripristino di emergenza finché ogni backup contenente i vecchi dati non è scaduto.
Una dichiarazione di cancellazione richiede uno stato finale verificabile
Definisci gli oggetti coperti dalla richiesta, rimuovili dal recupero online, propaga la cancellazione alle repliche e alle derivazioni, avvia o attendi il meccanismo di pulizia fisica del motore e registra quali backup conservati contengono ancora copie storiche. Quindi verifica sia l’accesso tramite API normali sia l’esposizione a livello di archiviazione, in base al modello di minaccia.
Uno studio sui sistemi di database relativo alla cancellazione significativa in presenza di dipendenze formalizza un requisito più complesso della semplice eliminazione di una riga: le dipendenze dei dati rimanenti non dovrebbero consentire di dedurre nuovamente le informazioni cancellate. Questo rafforza il confine sistemico in questione: la cancellazione deve tenere conto delle rappresentazioni dipendenti e delle copie conservate, non soltanto dell’ID del vettore principale.
Considera completa la cancellazione solo rispetto a un confine documentato: copie ricercabili rimosse immediatamente, pulizia fisica dell’archivio attivo verificata, derivazioni eliminate e backup conservati regolati da una politica esplicita di scadenza o di cancellazione crittografica. Se il sistema non è in grado di enumerare i luoghi in cui si è propagato un documento sorgente, non può affermare con certezza che una cancellazione richiesta dall’utente abbia raggiunto ogni copia.
Hub Tecnologico e AI
Altro da leggere

In che modo un broker segreto fornisce le credenziali a un agente IA senza esporle nei prompt?
Segui l'identità del carico di lavoro, le policy, l'emissione dei token, l'iniezione delle richieste, la redazione, la scadenza e la revoca attraverso un'architettura secretless...

In che modo un sandbox degli strumenti contiene gli effetti collaterali degli agenti IA?
Scopri come l'isolamento, i gate delle capacità, lo stato usa e getta, il controllo dell'egress, le quote e i log di audit limitano gli...

In che modo la decodifica vincolata produce JSON valido secondo lo schema?
Comprendi la compilazione dello schema, il mascheramento dei token, lo stato del parser, i sottoinsiemi supportati, la latenza, il troncamento e perché la validità...

