Znacznik usunięcia indeksu wektorowego to logiczny marker usunięcia, który ukrywa usunięty rekord, zanim bazowa struktura wyszukiwania fizycznie go odzyska.
W lokalnym indeksie RAG usunięcie pliku PDF lub zdjęcia może sprawić, że jego fragmenty znikną ze zwykłych wyników na długo przed przepisaniem grafu wektorowego, plików segmentów lub stron pamięci masowej. Znaczniki usunięcia pozwalają bazie danych zachować spójność indeksu, podczas gdy konserwacja odbywa się później. Ten stan pośredni ma znaczenie dla szacowania zajętości pamięci, kondycji indeksu, intensywności aktualizacji oraz wszelkich założeń, że usunięcie logiczne jest równoznaczne z natychmiastowym usunięciem fizycznym.
Znacznik usunięcia oznacza rekord jako usunięty przed fizycznym czyszczeniem
Usunięcie rekordu z indeksu przybliżonego nie zawsze pozwala usunąć wszystkie fizyczne odwołania w ramach jednej taniej operacji. System może zamiast tego oznaczyć element jako usunięty, wykluczyć go z widocznych wyników i pozostawić czyszczenie struktury na późniejszy etap konserwacji.
W indeksie HNSW znaczniki usunięcia oznaczają usunięte obiekty i mogą pozostać w grafie do czasu usunięcia ich przez proces czyszczenia.
W przypadku domowej bazy wiedzy oznacza to, że plik źródłowy może już nie istnieć, a warstwa zapytań może prawidłowo pomijać jego fragmenty, mimo że wewnętrzny stan indeksu nadal pamięta, że te węzły kiedyś istniały.
Wyszukiwanie może ukrywać usunięty wektor, podczas gdy indeks nadal przechowuje jego stan
Usunięcie logiczne i fizyczne odzyskanie miejsca odpowiadają na różne pytania. Pierwsze dotyczy tego, czy rekord może pojawić się w wynikach wyszukiwania; drugie — tego, czy jego bajty i relacje indeksowe zostały usunięte z pamięci masowej oraz struktur pamięci.
Indeksy oparte na segmentach mogą pozostawiać usunięte rekordy do czasu scalenia, zamiast wymuszać natychmiastowe przepisywanie segmentu przy każdym usunięciu.
To rozdzielenie wyjaśnia, dlaczego liczba rekordów w kolekcji może spaść, zanim zmniejszy się zajętość dysku. Wyjaśnia również, dlaczego obciążenia związane z intensywnym usuwaniem i aktualizowaniem mogą powodować narastanie zaległości konserwacyjnych, bez przywracania nieaktualnych rekordów do zwykłego wyszukiwania.
Panel monitorowania powinien zatem rozróżniać aktywne rekordy, oczekujący stan usunięcia, liczbę segmentów i rzeczywistą zajętość dysku, zamiast traktować pojedynczą metrykę jako dowód zakończenia czyszczenia.
Znaczniki usunięcia gromadzą się, gdy pliki są wielokrotnie zmieniane lub zastępowane
Prywatny indeks może generować znaczniki usunięcia podczas zwykłych aktualizacji, a nie tylko wtedy, gdy użytkownik trwale usuwa plik. Zastąpienie jednej wersji dokumentu może usunąć stare fragmenty i dodać nowe, natomiast reorganizacja folderów może wycofać rekordy przypisane do wcześniejszych identyfikatorów.
Zmienne kolekcje wektorowe gromadzą aktualizacje i usunięcia, zanim optymalizacja segmentów asynchronicznie skonsoliduje te zmiany.
Jeśli domowa baza wiedzy często ponownie generuje wektory dokumentów, presja znaczników usunięcia może być lepszym wskaźnikiem intensywności zmian niż liczba aktualnie wyszukiwalnych plików. Częstotliwość czyszczenia powinna uwzględniać tempo aktualizacji i dostępną rezerwę przepustowości operacji wejścia-wyjścia.
Znacznik usunięcia nie oznacza bezpiecznego wymazania
Marker logiczny służy zapewnieniu poprawności indeksu, a nie usuwaniu danych w sposób uniemożliwiający ich odzyskanie. Stare bajty mogą pozostawać w plikach segmentów, migawkach, replikach, kopiach zapasowych, wolnym miejscu systemu plików lub innych pochodnych magazynach do czasu usunięcia ich przez osobne procesy cyklu życia danych.
Późniejszy etap kompaktowania po usunięciu jest innym mechanizmem niż sam znacznik usunięcia, ponieważ może przepisać nieaktualny stan segmentów i odzyskać miejsce.
Usuwanie wrażliwych danych traktuj jako problem retencji obejmujący pliki źródłowe, magazyny wektorowe, metadane, pamięci podręczne, migawki i kopie zapasowe. Znaczniki usunięcia są jednym z pośrednich mechanizmów zapewniania spójności w ramach tego szerszego cyklu życia danych.
To rozróżnienie zapobiega również mylnym oczekiwaniom dotyczącym pamięci masowej: usunięcie tysięcy fragmentów może natychmiast przynieść poprawny efekt w wyszukiwaniu, a jednocześnie pozostać niewidoczne na wykresach wolnego miejsca do czasu zakończenia zaplanowanego czyszczenia.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak tajny broker przekazuje agentowi AI dane uwierzytelniające bez ujawniania ich w promptach?
Śledź tożsamość obciążenia, zasady, wydawanie tokenów, wstrzykiwanie żądań, redakcję, wygasanie i unieważnianie w ramach bezsekretnej architektury domowego agenta AI.

Jak piaskownica narzędzi ogranicza skutki uboczne działania agenta AI?
Zobacz, jak izolacja, bramki uprawnień, ulotny stan, kontrola ruchu wychodzącego, limity i dzienniki audytowe ograniczają skutki uboczne agentów AI bez dowodzenia, że działania są...

Jak dekodowanie z ograniczeniami generuje JSON zgodny ze schematem?
Zrozum kompilację schematu, maskowanie tokenów, stan parsera, obsługiwane podzbiory, opóźnienia, obcinanie oraz to, dlaczego poprawność strukturalna nie gwarantuje prawidłowych wartości.

