Una marca de eliminación de un índice vectorial es un indicador de eliminación lógica que oculta un registro eliminado antes de que la estructura de búsqueda subyacente lo recupere físicamente.
En un índice RAG local, eliminar un PDF o una foto puede hacer que sus fragmentos desaparezcan de los resultados normales mucho antes de que se reescriban el grafo vectorial, los archivos de segmento o las páginas de almacenamiento. Las marcas de eliminación permiten que la base de datos conserve la coherencia del índice mientras el mantenimiento se realiza posteriormente. Ese estado intermedio es importante para las estimaciones de almacenamiento, el estado del índice, la frecuencia de actualización y cualquier suposición de que una eliminación lógica equivale a un borrado físico inmediato.
Una marca de eliminación indica que un registro se ha eliminado antes de la limpieza física
Eliminar un registro de un índice aproximado no siempre permite retirar todas las referencias físicas en una sola operación económica. En su lugar, el sistema puede marcar el elemento como eliminado, excluirlo de los resultados visibles y dejar la limpieza estructural para una tarea de mantenimiento posterior.
En un índice HNSW, las marcas de eliminación indican los objetos eliminados y pueden permanecer en el grafo hasta que un proceso de limpieza las retire.
Para una base de conocimientos doméstica, esto significa que el archivo de origen puede haber desaparecido y que la capa de consultas puede suprimir correctamente sus fragmentos, aunque el estado interno del índice todavía recuerde que esos nodos existieron.
La búsqueda puede ocultar un vector eliminado mientras el índice conserva su estado
La eliminación lógica y la recuperación física responden a preguntas diferentes. La primera determina si el registro puede aparecer en la búsqueda; la segunda, si sus bytes y sus relaciones dentro del índice se han eliminado de las estructuras de almacenamiento y memoria.
Los índices basados en segmentos pueden conservar los registros eliminados hasta la fusión, en lugar de obligar a reescribir un segmento inmediatamente después de cada eliminación.
Esta separación explica por qué el recuento de una colección puede disminuir antes de que lo haga el uso del disco. También explica por qué las cargas de trabajo con muchas eliminaciones y actualizaciones pueden acumular tareas de mantenimiento pendientes sin que los registros obsoletos vuelvan a aparecer en las búsquedas normales.
Por lo tanto, un panel de supervisión debería distinguir entre registros activos, estado de eliminación pendiente, cantidad de segmentos y uso real del disco, en lugar de considerar una sola métrica como prueba de que la limpieza ha terminado.
Las marcas de eliminación se acumulan cuando los archivos cambian o se sustituyen repetidamente
Un índice privado puede generar marcas de eliminación durante las actualizaciones normales, no solo cuando un usuario elimina un archivo de forma permanente. Sustituir una versión de un documento puede eliminar los fragmentos antiguos e insertar otros nuevos, mientras que reorganizar carpetas puede retirar registros asociados a identidades anteriores.
Las colecciones de vectores mutables acumulan actualizaciones y eliminaciones antes de que la optimización de segmentos consolide esos cambios de forma asíncrona.
Si una base de conocimientos doméstica vuelve a generar embeddings de los documentos con frecuencia, la presión de las marcas de eliminación puede ser un indicador de cambios más útil que el número de archivos que se pueden buscar actualmente. La frecuencia de limpieza debería reflejar la tasa de actualización y el margen de E/S disponible.
Una marca de eliminación no equivale a un borrado seguro
Un indicador lógico está diseñado para garantizar la corrección del índice, no para realizar un borrado forense. Los bytes antiguos pueden permanecer en archivos de segmento, instantáneas, réplicas, copias de seguridad, espacio libre del sistema de archivos u otros almacenes derivados hasta que procesos independientes del ciclo de vida los eliminen.
La etapa posterior de compactación después de la eliminación es un mecanismo diferente de la propia marca de eliminación, ya que puede reescribir el estado obsoleto de los segmentos y recuperar espacio.
Considera la eliminación de datos sensibles como un problema de retención integral que abarque los archivos de origen, los almacenes vectoriales, los metadatos, las cachés, las instantáneas y las copias de seguridad. Las marcas de eliminación son un mecanismo intermedio de coherencia dentro de ese ciclo de vida más amplio.
Esta distinción también evita una expectativa engañosa sobre el almacenamiento: eliminar miles de fragmentos puede ser inmediatamente correcto para la búsqueda y, aun así, no reflejarse en los gráficos de espacio libre hasta que termine la limpieza programada.
Centro de Tecnología e IA
Más para leer

¿Qué es el estado de Plex y qué partes deben persistir?
El estado persistente de Plex es la información que conserva la experiencia del servidor entre reinicios y reconstrucciones; los datos multimedia y los datos...

¿Cómo gestiona Plex la autenticación entre sesiones locales y remotas?
La autenticación de Plex comienza con la identidad del servidor y de la cuenta; después, las rutas de red locales o remotas determinan la...

¿Por qué puede ralentizarse la búsqueda en Plex a medida que crecen los datos de la biblioteca?
El crecimiento de la biblioteca por sí solo no es el diagnóstico. Comprueba la estructura de las consultas, los índices, el estado de la...

