La eliminación completa de datos personales de una base de datos vectorial significa que los datos ya no se pueden recuperar mediante la API y que también se han eliminado, caducado o vuelto irrecuperables criptográficamente en el estado físico de los índices y en las copias dependientes.
La complicación es que un sistema RAG no almacena un objeto en un solo lugar. El texto original puede generar fragmentos, embeddings, metadatos, índices de grafos, cachés, réplicas, registros, instantáneas y copias de seguridad. Eliminar el registro principal es solo la primera transición de ese ciclo de vida.
La eliminación lógica y el borrado físico son estados diferentes
Los índices vectoriales suelen necesitar mutaciones rápidas sin reconstruir de inmediato grandes estructuras de grafos o segmentos. Por ello, una operación de eliminación puede marcar un punto como no disponible para las consultas normales mientras los bytes antiguos permanecen en un segmento del índice hasta que se produzca la compactación, optimización o sustitución del segmento.
El estudio Ghost Vectors de 2026 demostró que los embeddings eliminados temporalmente pueden seguir siendo recuperables físicamente desde archivos de índices HNSW sin procesar incluso después de una eliminación a nivel de API. Los investigadores demostraron la recuperación de atributos sensibles a partir de varios tipos de embeddings, haciendo concreta la diferencia entre invisibilidad en las búsquedas y borrado físico.
Esto no significa que todas las bases de datos vectoriales conserven para siempre cada vector eliminado. Significa que una garantía de eliminación debe describir el ciclo de vida de limpieza del motor de almacenamiento. «La consulta ya no lo devuelve» es una prueba funcional, no una demostración de que la representación subyacente haya desaparecido.
Las copias derivadas amplían el alcance de la eliminación más allá del vector principal
Un documento privado puede existir como texto sin procesar, varios fragmentos, embeddings, metadatos del documento, cachés del reranker, resúmenes generados, citas de conversaciones y cachés de resultados de búsqueda. Si cualquier derivado puede revelar la información personal eliminada, borrar un ID de embedding no completa la solicitud a nivel de usuario.
Un flujo de trabajo de borrado de datos para RAG privado hace hincapié en el alcance de la eliminación en RAG en los registros de origen, embeddings, índices derivados y capas de retención. La lección arquitectónica útil es la procedencia: cada registro generado necesita una ruta estable de vuelta a la identidad de origen para que una solicitud de eliminación pueda encontrar sus descendientes.
El artículo relacionado de ZimaSpace sobre los marcadores de eliminación de índices vectoriales examina un mecanismo a nivel de índice. El borrado completo es más amplio porque debe seguir los datos personales por toda la pila de recuperación, no solo eliminar un nodo del grafo de las búsquedas normales.
La compactación, las réplicas y las copias de seguridad crean plazos de eliminación diferentes
Es posible que las réplicas activas deban recibir la eliminación de inmediato, mientras que las copias de seguridad inmutables pueden conservar los datos antiguos hasta que expire su periodo de retención documentado. Un trabajo de compactación puede reescribir físicamente los segmentos del índice después de la eliminación mediante la API. Estos plazos deben ser explícitos para que el sistema pueda distinguir entre «no accesible», «borrado pendiente» y «caducado en todas las copias retenidas».
La explicación de Qdrant sobre la limpieza impulsada por el optimizador describe cómo se gestionan los puntos eliminados y los segmentos fragmentados mediante la optimización, en lugar de asumir que cada mutación reescribe el almacenamiento al instante. Aunque los detalles son específicos del producto, ilustra una realidad general de los almacenes vectoriales: el mantenimiento de la disposición física puede quedar rezagado respecto a la eliminación lógica.
Las copias de seguridad también necesitan una regla para el momento de la restauración. Si se restaura una copia de seguridad antigua, el sistema no debe resucitar silenciosamente una eliminación que se produjo después de esa copia. Mantén un registro de eliminaciones duradero o un estado de conciliación equivalente que pueda reaplicarse después de una recuperación ante desastres hasta que todas las copias de seguridad que contengan los datos antiguos hayan caducado.
Una afirmación de eliminación necesita un estado final verificable
Define los objetos cubiertos por la solicitud, elimínalos de la recuperación en línea, propaga la eliminación a las réplicas y los derivados, activa o espera el mecanismo de limpieza física del motor y registra qué copias de seguridad retenidas aún contienen copias históricas. Después, prueba tanto el acceso normal mediante la API como la exposición del almacenamiento de nivel inferior que corresponda al modelo de amenazas.
Un estudio sobre sistemas de bases de datos acerca del borrado significativo en presencia de dependencias formaliza un requisito más exigente que simplemente eliminar una fila: las dependencias de datos restantes no deberían permitir que la información borrada pueda inferirse de nuevo. Esto refuerza el límite del sistema en este caso: la eliminación debe tener en cuenta las representaciones dependientes y las copias retenidas, no solo el ID del vector principal.
Considera completa la eliminación únicamente en relación con un límite documentado: las copias consultables ya no están disponibles, la limpieza física del almacén activo está verificada, los derivados se han purgado y las copias de seguridad retenidas están sujetas a una política explícita de caducidad o borrado criptográfico. Si el sistema no puede enumerar dónde se propagó un documento de origen, no puede afirmar con solidez que una eliminación solicitada por el usuario llegó a todas las copias.
Centro de Tecnología e IA
Más para leer

¿Cómo proporciona un intermediario secreto credenciales a un agente de IA sin exponerlas en los prompts?
Sigue la identidad de la carga de trabajo, la política, la emisión de tokens, la inyección de solicitudes, la redacción, la caducidad y la...

¿Cómo contiene un entorno aislado de herramientas los efectos secundarios de un agente de IA?
Descubre cómo el aislamiento, los controles de capacidad, el estado desechable, el control de salida, las cuotas y los registros de auditoría limitan los...

¿Cómo produce el decodificado restringido un JSON válido según el esquema?
Comprende la compilación de esquemas, el enmascaramiento de tokens, el estado del analizador sintáctico, los subconjuntos compatibles, la latencia, el truncamiento y por qué...

