La suppression complète d’un vecteur nécessite de supprimer chaque dérivé accessible d’une source, et pas seulement de masquer son identifiant dans les requêtes de similarité classiques.
La suppression d’un PDF privé peut retirer sa ligne documentaire tandis que les embeddings restent dans un fichier HNSW, un cache, une réplique, un instantané ou un jeu d’évaluation. Un système fiable commence par associer la source à chaque segment et artefact dérivé. Il bloque ensuite immédiatement la récupération, réécrit les structures physiques, invalide les caches, traite les sauvegardes et l’état appris, puis consigne une confirmation vérifiable sans conserver le contenu sensible lui-même.
La traçabilité identifie chaque objet créé par la source
L’ingestion attribue un identifiant stable à la source et à sa version, puis enregistre les identifiants des segments, des embeddings et des métadonnées, les entrées lexicales, les miniatures, les résumés, les clés de cache, les exemples d’évaluation et les emplacements des répliques. La suppression commence à partir de ce graphe, et non d’une recherche par nom de fichier.
Les recherches sur les vecteurs supprimés récupérables montrent que des embeddings supprimés logiquement peuvent rester physiquement récupérables dans les fichiers d’index HNSW et proposent la rotation des clés de chiffrement comme mesure d’atténuation. Ce résultat montre pourquoi une absence au niveau de l’API n’équivaut pas à un effacement.
Les segments partagés et les blobs dédupliqués nécessitent des compteurs de références ou des liens de propriété. La suppression de la source d’un utilisateur ne doit pas effacer un objet légitimement partagé, mais elle doit supprimer les autorisations, la provenance et l’association récupérable liées à la source supprimée. Cette distinction reste visible lors de tests ultérieurs en environnement domestique.
Les marqueurs de suppression assurent l’exclusion immédiate avant la réécriture physique
Une transaction de suppression marque chaque enregistrement dérivé comme inactif et avance une génération d’index afin que les nouvelles requêtes l’excluent de manière cohérente lors des étapes vectorielle, lexicale, des métadonnées et du reclassement. Les caches intègrent la génération ou l’état de suppression dans leurs clés.
Les suppressions dans les index ANN en continu prennent en charge les ajouts, mises à jour et suppressions en continu dans un index de plus proches voisins approximatifs fondé sur un graphe. Leur conception montre pourquoi la recherche dynamique nécessite une maintenance explicite, au-delà de la simple création initiale d’un index statique. Le résultat intermédiaire doit rester inspectable avant que l’automatisation ne poursuive.
Les marqueurs de suppression protègent le chemin en ligne, mais laissent les octets présents jusqu’à ce que la compaction reconstruise les segments concernés ou l’intégralité de l’index. La nouvelle génération doit être vérifiée et publiée de manière atomique avant la récupération des anciens fichiers, des espaces de travail temporaires et des instantanés.
Les caches, les sauvegardes et l’état appris définissent la limite stricte
Les tâches de suppression doivent purger les caches de résultats, les caches de prompts, les répliques, les exports de recherche, les tables analytiques, les journaux ayant copié du contenu et les fichiers temporaires locaux. La politique de sauvegarde peut prévoir l’expiration ultérieure des instantanés chiffrés plutôt que la modification immédiate de supports immuables. Cette limite doit être mesurée séparément dans des conditions d’exploitation réalistes.
Les limites de l’oubli machine formalisent l’oubli machine comme la suppression de l’influence d’un exemple d’entraînement sans réentraînement complet et montrent les limites pratiques des approches approximatives. Cela est important lorsque le contenu vectoriel supprimé a également intégré un reclasseur ou un adaptateur appris.
La limite d’échec correspond à la promesse d’une suppression dans des artefacts que le système ne peut pas recenser ou réécrire. Un enregistrement de suppression signé peut prouver quelles générations et quelles clés ont été supprimées, mais pas qu’un export non documenté a disparu. Les dérivés inconnus doivent rester un échec de conformité visible, et non une réussite silencieuse.
Lancez un défi de récupération après suppression
Ingérez une phrase et une image sentinelles uniques dans une source de test, puis localisez chaque segment, vecteur, ligne de métadonnées, entrée de cache, réplique, génération de sauvegarde, résumé, copie dans les journaux et lien vers un jeu de données appris avant de demander la suppression. La conséquence pratique apparaît lorsque plusieurs sources se disputent un contexte limité.
Appliquez la limite des marqueurs de suppression dans la limite des marqueurs de suppression des vecteurs, compactez l’index, faites expirer les sauvegardes couvertes ou effacez-les cryptographiquement, puis interrogez les chemins vectoriel, lexical, des métadonnées, du cache, des fichiers directs et des instantanés restaurés. Inspectez le stockage brut de l’index à la recherche de la sentinelle.
La suppression est validée uniquement lorsque les systèmes actuels ne peuvent ni récupérer ni reconstruire la source et que l’enregistrement de suppression nomme chaque catégorie d’artefacts traitée et en attente. Si une sauvegarde doit être conservée, isolez sa clé et publiez la limite exacte d’expiration ou de conservation légale.
Centre Tech & IA
Plus à lire

Quelles fonctionnalités permettent de créer une frontière de confiance pour l’IA domestique autour des fichiers sensibles ?
Découvrez comment la classification, l’accès limité aux capacités, l’analyse isolée, les filtres de récupération, la politique de sortie, les approbations et les audits permettent...

Quels facteurs déterminent l’efficacité de la détection des modifications silencieuses par les sauvegardes basées sur des arbres de Merkle ?
Découvrez comment la taille des blocs, le facteur de branchement, les racines de confiance, les hachages mis en cache, la localité des modifications, la...

Quels composants permettent de vérifier les sauvegardes des index d’IA et de l’état des modèles ?
Découvrez comment des instantanés coordonnés, des manifestes de contenu, des sommes de contrôle, des verrouillages de version, des exercices de restauration et des tests...

