Indeks wyszukiwania AI w serwerze NAS może ujawniać więcej niż pliki źródłowe, ponieważ tworzy przeszukiwalny tekst, embeddingi, metadane, fragmenty, powiązania i historię zapytań.
Prywatny dokument może pierwotnie być widoczny tylko w jednym folderze i jednej aplikacji, jednak indeksowanie może wyodrębnić tekst OCR, podzielić go na fragmenty, wygenerować wektory semantyczne, skopiować tytuły i ścieżki, utworzyć miniatury oraz dołączyć uprawnienia na potrzeby szybkiego wyszukiwania. Takie rekordy pochodne mogą znajdować się w oddzielnej bazie danych, objętej innymi zasadami tworzenia kopii zapasowych, rejestrowania i dostępu. Wyszukiwanie ujawnia również powiązania między dokumentami oraz intencje użytkownika, które nie są oczywiste podczas przeglądania drzewa źródłowego. Poniższe sekcje wyjaśniają, jak indeks staje się drugim wrażliwym zbiorem danych, a nie tymczasową pamięcią podręczną przeznaczoną do usunięcia.
Pobieranie danych tworzy nowe reprezentacje źródła
Potok wyszukiwania AI rzadko przechowuje wyłącznie odnośnik do każdego pliku. Może analizować tekst, wykonywać OCR, transkrybować dźwięk, opisywać obrazy, normalizować metadane, dzielić dokumenty i zachowywać podglądy na potrzeby wyszukiwania.
Przeglądy baz wektorowych opisują reprezentacje pochodne, które łączą embeddingi z identyfikatorami i metadanymi w celu zapewnienia wydajnego wyszukiwania. Plik PDF, który w przeglądarce plików wydaje się nieprzenikniony, po pobraniu danych może zostać przekształcony w setki niezależnie wyszukiwalnych fragmentów.
Takie rekordy mogą ujawniać tekst ukryty w skanach, zarchiwizowanych załącznikach, podpisach obrazów, komentarzach lub polach metadanych, których użytkownicy nie spodziewali się zobaczyć w interfejsie wyszukiwania.
Embeddingi zachowują poufne informacje, a nie tylko podobieństwo
Embedding ma zachowywać właściwości semantyczne, aby można było wyszukiwać podobne treści. Ta użyteczność oznacza, że nie jest on równoważny losowemu, nieodwracalnemu identyfikatorowi.
Badania nad wyciekiem informacji z embeddingów pokazują, że nauczone wektory mogą ujawniać atrybuty i informacje o przynależności dotyczące danych wejściowych. Późniejsze prace prezentują ataki, których celem jest odtworzenie tekstu lub poufnych pojęć na podstawie przechowywanych reprezentacji.
Szyfrowanie plików źródłowych przy jednoczesnym pozostawieniu bazy wektorowej szeroko dostępnej może zatem stworzyć słabszą granicę prywatności. Indeks powinien być objęty zabezpieczeniami podobnymi do tych, które chronią reprezentowane przez niego treści.
Odwracanie embeddingów może odzyskać znaczenie z przechowywanych wektorów
Atakujący nie zawsze potrzebują dokładnego oryginalnego brzmienia, aby wyrządzić szkodę. Odzyskanie nazwisk, tematów, terminów medycznych, pojęć finansowych lub charakterystycznych fraz może wystarczyć do zidentyfikowania powiązanego dokumentu.
Najnowsze prace dotyczące odwracania embeddingów traktują bazy wektorowe jako cel ataków na prywatność, ponieważ przeciwnicy mogą wykorzystywać embeddingi do odtwarzania poufnych informacji z tekstu źródłowego. Transformacje ochronne ograniczają wyciek tylko kosztem użyteczności wyszukiwania i przy określonych założeniach dotyczących zagrożeń.
Lokalny indeks eliminuje konieczność wysyłania wektorów do dostawcy chmurowego, jednak lokalne przejęcie systemu, słabe uprawnienia aplikacji, ujawnione kopie zapasowe lub zbyt szeroko dostępne API nadal mogą je ujawnić.
Metadane i fragmenty mogą omijać oczekiwania dotyczące poziomu dostępu do folderów
Wyniki wyszukiwania często wyświetlają nazwy plików, ścieżki, osoby, daty, wyodrębnione słowa kluczowe, sąsiedni tekst i miniatury, zanim użytkownik otworzy dokument źródłowy. Ta warstwa podglądu może ujawniać poufny kontekst niezależnie od dostępu do całego pliku.
Badania nad wyszukiwaniem wektorowym uwzględniającym strukturę katalogów wskazują, że metadane katalogów są często spłaszczane lub rozszerzane podczas indeksowania. Jeśli zmiany w hierarchii nie są prawidłowo propagowane, indeks może zachować rekordy pod starą ścieżką lub rozwiązywać zakresy rekurencyjne szerzej niż wynika to z bieżącego widoku systemu plików.
W rezultacie wynik wyszukiwania może wskazywać plik przemianowany, przeniesiony, zarchiwizowany lub objęty ograniczeniem dostępu, nawet gdy bezpośrednie przeglądanie już go nie pokazuje.
Sposób wyszukiwania i wzorce dostępu ujawniają powiązania między plikami
Obserwator warstwy wyszukiwania może dowiedzieć się, które dokumenty pasują do tego samego zapytania, jak często wyszukiwane są określone tematy oraz które rekordy są otwierane razem. Takie powiązania mogą być poufne, nawet gdy przechowywane treści są zaszyfrowane.
Badania USENIX pokazują, że wzorce wyszukiwania mogą podważać prywatność szyfrowanego wyszukiwania, ujawniając powtarzające się zapytania i powiązania między wynikami. Dzienniki zapytań w domowym systemie AI mogą ujawniać problemy zdrowotne, tematy prawne, nazwiska członków rodziny lub planowanie finansowe na podstawie czasu oraz skupisk terminów.
Ogranicz szczegółowe przechowywanie zapytań, oddziel analitykę od surowej historii wyszukiwania i unikaj rejestrowania pełnych promptów, gdy wystarczające są zbiorcze dane o wydajności.
Uprawnienia indeksu muszą odpowiadać uprawnieniom źródła i zasadom usuwania
Bezpieczny wynik wyszukiwania wymaga zarówno trafności semantycznej, jak i aktualnych uprawnień. Filtrowanie dopiero po wyszukaniu może ujawnić fragmenty, liczbę wyników lub czas odpowiedzi dotyczące dokumentów, o których istnieniu użytkownik nie powinien wiedzieć.
Systemy szyfrowanego wyszukiwania pokazują, jak trudno chronić strukturę indeksu, zachowując jednocześnie użyteczność wyszukiwania. W praktycznym systemie NAS wymóg jest prostszy, lecz rygorystyczny: każdy fragment, wektor, miniatura i wpis pamięci podręcznej musi dziedziczyć stabilną tożsamość dokumentu oraz być filtrowany, zanim zostanie zwrócona jakakolwiek treść wyniku.
Omówienie domowego centrum danych firmy ZimaSpace ma tu zastosowanie, ponieważ wyszukiwanie staje się kolejną zarządzaną kopią rodzinnych informacji. Usuwanie, zmiany uprawnień, zasady przechowywania i tworzenia kopii zapasowych muszą obejmować źródło oraz każdy utworzony indeks.
Zweryfikuj system za pomocą użytkownika testowego, któremu odebrano dostęp do folderu. Upewnij się, że nazwy plików, fragmenty, dopasowania semantyczne, miniatury, odpowiedzi zapisane w pamięci podręcznej i wcześniejsze wyniki zapytań znikają, zanim uznasz cofnięcie dostępu za zakończone.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Co powoduje pętle ponownego łączenia WebSocket w zdalnym interfejsie domowej sztucznej inteligencji?
Zdiagnozuj pętle WebSocket na warstwach uzgadniania połączenia, serwera proxy, uwierzytelniania, heartbeat, ścieżki sieciowej, odzyskiwania sesji i wycofywania klienta.

Co powoduje niezgodność sum kontrolnych kopii zapasowej po przerwanym transferze?
Śledź niezgodności sum kontrolnych na podstawie migawek źródłowych, manifestów fragmentów, przesunięć wznowienia, częściowych plików, transformacji, zapisów w pamięci masowej i końcowej weryfikacji.

Co powoduje duplikaty encji gospodarstw domowych w prywatnym grafie wiedzy?
Zdiagnozuj zduplikowane węzły grafu wiedzy, rozdzielając warianty ekstrakcji, klucze tożsamości, progi rozpoznawania, pochodzenie źródeł i równoczesne scalanie.

