Znacznik usunięcia indeksu wektorowego to logiczny marker usunięcia, który ukrywa usunięty rekord, zanim bazowa struktura wyszukiwania fizycznie go odzyska.
W lokalnym indeksie RAG usunięcie pliku PDF lub zdjęcia może sprawić, że jego fragmenty znikną ze zwykłych wyników na długo przed przepisaniem grafu wektorowego, plików segmentów lub stron pamięci masowej. Znaczniki usunięcia pozwalają bazie danych zachować spójność indeksu, podczas gdy konserwacja odbywa się później. Ten stan pośredni ma znaczenie dla szacowania zajętości pamięci, kondycji indeksu, intensywności aktualizacji oraz wszelkich założeń, że usunięcie logiczne jest równoznaczne z natychmiastowym usunięciem fizycznym.
Znacznik usunięcia oznacza rekord jako usunięty przed fizycznym czyszczeniem
Usunięcie rekordu z indeksu przybliżonego nie zawsze pozwala usunąć wszystkie fizyczne odwołania w ramach jednej taniej operacji. System może zamiast tego oznaczyć element jako usunięty, wykluczyć go z widocznych wyników i pozostawić czyszczenie struktury na późniejszy etap konserwacji.
W indeksie HNSW znaczniki usunięcia oznaczają usunięte obiekty i mogą pozostać w grafie do czasu usunięcia ich przez proces czyszczenia.
W przypadku domowej bazy wiedzy oznacza to, że plik źródłowy może już nie istnieć, a warstwa zapytań może prawidłowo pomijać jego fragmenty, mimo że wewnętrzny stan indeksu nadal pamięta, że te węzły kiedyś istniały.
Wyszukiwanie może ukrywać usunięty wektor, podczas gdy indeks nadal przechowuje jego stan
Usunięcie logiczne i fizyczne odzyskanie miejsca odpowiadają na różne pytania. Pierwsze dotyczy tego, czy rekord może pojawić się w wynikach wyszukiwania; drugie — tego, czy jego bajty i relacje indeksowe zostały usunięte z pamięci masowej oraz struktur pamięci.
Indeksy oparte na segmentach mogą pozostawiać usunięte rekordy do czasu scalenia, zamiast wymuszać natychmiastowe przepisywanie segmentu przy każdym usunięciu.
To rozdzielenie wyjaśnia, dlaczego liczba rekordów w kolekcji może spaść, zanim zmniejszy się zajętość dysku. Wyjaśnia również, dlaczego obciążenia związane z intensywnym usuwaniem i aktualizowaniem mogą powodować narastanie zaległości konserwacyjnych, bez przywracania nieaktualnych rekordów do zwykłego wyszukiwania.
Panel monitorowania powinien zatem rozróżniać aktywne rekordy, oczekujący stan usunięcia, liczbę segmentów i rzeczywistą zajętość dysku, zamiast traktować pojedynczą metrykę jako dowód zakończenia czyszczenia.
Znaczniki usunięcia gromadzą się, gdy pliki są wielokrotnie zmieniane lub zastępowane
Prywatny indeks może generować znaczniki usunięcia podczas zwykłych aktualizacji, a nie tylko wtedy, gdy użytkownik trwale usuwa plik. Zastąpienie jednej wersji dokumentu może usunąć stare fragmenty i dodać nowe, natomiast reorganizacja folderów może wycofać rekordy przypisane do wcześniejszych identyfikatorów.
Zmienne kolekcje wektorowe gromadzą aktualizacje i usunięcia, zanim optymalizacja segmentów asynchronicznie skonsoliduje te zmiany.
Jeśli domowa baza wiedzy często ponownie generuje wektory dokumentów, presja znaczników usunięcia może być lepszym wskaźnikiem intensywności zmian niż liczba aktualnie wyszukiwalnych plików. Częstotliwość czyszczenia powinna uwzględniać tempo aktualizacji i dostępną rezerwę przepustowości operacji wejścia-wyjścia.
Znacznik usunięcia nie oznacza bezpiecznego wymazania
Marker logiczny służy zapewnieniu poprawności indeksu, a nie usuwaniu danych w sposób uniemożliwiający ich odzyskanie. Stare bajty mogą pozostawać w plikach segmentów, migawkach, replikach, kopiach zapasowych, wolnym miejscu systemu plików lub innych pochodnych magazynach do czasu usunięcia ich przez osobne procesy cyklu życia danych.
Późniejszy etap kompaktowania po usunięciu jest innym mechanizmem niż sam znacznik usunięcia, ponieważ może przepisać nieaktualny stan segmentów i odzyskać miejsce.
Usuwanie wrażliwych danych traktuj jako problem retencji obejmujący pliki źródłowe, magazyny wektorowe, metadane, pamięci podręczne, migawki i kopie zapasowe. Znaczniki usunięcia są jednym z pośrednich mechanizmów zapewniania spójności w ramach tego szerszego cyklu życia danych.
To rozróżnienie zapobiega również mylnym oczekiwaniom dotyczącym pamięci masowej: usunięcie tysięcy fragmentów może natychmiast przynieść poprawny efekt w wyszukiwaniu, a jednocześnie pozostać niewidoczne na wykresach wolnego miejsca do czasu zakończenia zaplanowanego czyszczenia.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Czym jest stan Plexa i które jego elementy muszą być zachowane?
Trwały stan Plex to informacje, które zachowują konfigurację serwera po ponownym uruchomieniu i odbudowie; multimedia oraz tymczasowe dane transkodowania pełnią odrębne funkcje.

Jak Plex obsługuje uwierzytelnianie w sesjach lokalnych i zdalnych?
Uwierzytelnianie w Plex rozpoczyna się od tożsamości serwera i konta, a następnie lokalne lub zdalne ścieżki sieciowe określają dostępność oraz sposób nawiązywania bezpiecznego połączenia.

Dlaczego wyszukiwanie w Plex może zwalniać wraz ze wzrostem ilości danych biblioteki?
Sam wzrost biblioteki nie jest diagnozą. Zanim obwinisz rozmiar bazy danych, przetestuj kształt zapytań, indeksy, stan pamięci podręcznej, opóźnienia pamięci masowej i aktywność zapisu.

