Tak — jeśli przez „bez odszyfrowywania ich w spoczynku” rozumiesz, że dokumenty pozostają zaszyfrowane na nośniku i są odszyfrowywane wyłącznie wewnątrz zaufanego procesu, gdy muszą zostać zindeksowane lub pobrane. To realistyczna konstrukcja prywatnego domowego systemu RAG. Zwykłe wyszukiwanie semantyczne nie może jednak po prostu przekazać nieczytelnego szyfrogramu do modelu osadzania i oczekiwać, że zrozumie dokument.
Praktyczna architektura obejmuje zatem szyfrowanie danych w spoczynku, kontrolowane odszyfrowywanie w pamięci, zaszyfrowane indeksy pochodne lub indeksy z kontrolą dostępu oraz ścisłe rozdzielenie kluczy. Bezpośrednie przeszukiwanie szyfrogramu jest możliwe wyłącznie przy użyciu wyspecjalizowanych technik kryptograficznych, które nie zastępują bezpośrednio standardowej wektorowej bazy danych.
„Szyfrowanie danych w spoczynku” nie oznacza „nigdy nie są odszyfrowywane”
Szyfrowanie danych w spoczynku chroni pliki przechowywane na dysku, dysku SSD, urządzeniu do tworzenia kopii zapasowych lub wyłączonym urządzeniu. Proces dysponujący właściwym kluczem może nadal odszyfrować dane, gdy jest to konieczne do zgodnego z prawem przetwarzania.
Zaszyfrowany dokument na dysku
|
| autoryzowany odczyt
v
Pamięć zaufanego procesu RAG
├─ odszyfruj
├─ przeanalizuj / podziel na fragmenty
├─ utwórz osadzenia
└─ pobierz
|
v
Zaszyfrowany indeks / chroniona baza danych
Przypomina to sposób działania wielu zaszyfrowanych baz danych i systemów plików: nośnik danych nie zawiera użytecznego tekstu jawnego, ale aplikacje mogą uzyskać do niego dostęp po autoryzacji.
Taka konstrukcja jest zgodna z działaniem prywatnego asystenta AI na serwerze NAS. Kluczowe jest określenie, gdzie tekst jawny może istnieć i jak długo.
Dlaczego standardowe wyszukiwanie wektorowe nie może przeszukiwać surowego szyfrogramu
Model osadzania potrzebuje znaczących cech tekstu, obrazu lub dźwięku. Konwencjonalne szyfrowanie celowo niszczy widoczne wzorce, dlatego szyfrogram nie zachowuje zależności semantycznych potrzebnych modelowi.
Jeśli dwa zdania w postaci jawnej są podobne, ich bezpiecznie zaszyfrowane teksty szyfrogramu nie powinny w oczywisty sposób wyglądać podobnie. W przeciwnym razie ujawniałyby informacje o oryginałach.
Typowa ścieżka pozyskiwania danych RAG wygląda więc tak:
- Uwierzytelnij proces.
- Odszyfruj dokument do pamięci lub ściśle kontrolowanego obszaru tymczasowego.
- Wyodrębnij i znormalizuj treść.
- Utwórz fragmenty i wektory osadzeń.
- Przechowuj pochodne dane wyszukiwania zgodnie z odrębną polityką ochrony.
- Usuń tymczasowy tekst jawny po zakończeniu pozyskiwania danych.
Sformułowanie „zaszyfrowane dokumenty pozostają zaszyfrowane w spoczynku” może nadal być prawdziwe przez cały ten proces, ponieważ tekst jawny nigdy nie musi stać się trwałym plikiem na dysku.
Wektory reprezentacji nie są tym samym co oryginalny dokument — ale nadal zawierają dane wrażliwe
Częstym błędem jest szyfrowanie plików PDF przy jednoczesnym pozostawieniu niezabezpieczonych wektorów reprezentacji, tekstu fragmentów, nazw plików, metadanych i migawek bazy danych wektorowych. To przenosi problem prywatności, zamiast go rozwiązywać.
| Artefakt | Czy może ujawnić informacje? | Zalecane postępowanie |
|---|---|---|
| Oryginalny plik | Tak, bezpośrednio | Szyfruj w spoczynku |
| Wyodrębniony tekst fragmentu | Tak, bezpośrednio | Szyfruj lub unikaj trwałego tekstu jawnego |
| Wektor reprezentacji | Potencjalnie, jako pochodna semantyczna | Chroń jak dane wrażliwe |
| Nazwa pliku / tagi | Często | Minimalizuj i kontroluj dostęp |
| Indeks wektorowy | Może ujawniać powiązania i członkostwo | Szyfruj pamięć masową i ogranicz dostęp |
| Kopia zapasowa / migawka | Zawiera kopie historyczne | Szyfruj niezależnie |
Obecna dokumentacja bezpieczeństwa Qdrant podkreśla, że wdrożenie hostowane samodzielnie musi być jawnie zabezpieczone. Szyfrowanie pamięci masowej w środowiskach zarządzanych samodzielnie jest obowiązkiem infrastruktury, a nie czymś, co należy zakładać tylko dlatego, że baza danych jest lokalna.
W przypadku prywatnego systemu wyszukiwania traktuj wektory reprezentacji jako część chronionej bazy wiedzy, a nie nieszkodliwe pliki pamięci podręcznej.
Gdzie powinny znajdować się klucze deszyfrujące?
Nie przechowuj klucza deszyfrującego obok zaszyfrowanych dokumentów w ogólnodostępnym pliku konfiguracyjnym. Celem jest uniemożliwienie odzyskania danych po samej kradzieży dysku lub skopiowaniu kopii zapasowej.
Solidniejsza konstrukcja domowego laboratorium oddziela:
- wolumen danych: zaszyfrowane dokumenty i pliki bazy danych;
- materiał kluczowy: pęk kluczy systemu operacyjnego, sprzętowo zabezpieczone przechowywanie kluczy lub oddzielnie chroniony magazyn sekretów;
- tożsamość usługi: proces RAG otrzymuje tylko potrzebne mu klucze;
- klucze kopii zapasowych: przechowywane poza jedyną kopią zaszyfrowanej kopii zapasowej.
Samo szyfrowanie dysku nie chroni w pełni odblokowanego, działającego serwera przed przejęciem na poziomie administratora. Chroni przed innym zagrożeniem: kradzieżą dysków, kopiami offline, wycofanym sprzętem i nieautoryzowanym dostępem do nośników kopii zapasowych.
Jak uniknąć plików tymczasowych w postaci jawnego tekstu?
Wiele parserów dokumentów po cichu tworzy pliki tymczasowe. Potoki OCR mogą rozpakowywać strony, konwertery dokumentów biurowych mogą zapisywać formaty pośrednie, a narzędzia PDF mogą buforować wyodrębnione zasoby.
Przeprowadź audyt ścieżki pozyskiwania danych i wybierz jeden z trzech schematów:
- przesyłaj odszyfrowane bajty bezpośrednio do parsera;
- użyj tymczasowego systemu plików opartego na pamięci RAM dla plików pośrednich;
- umieść tymczasową pamięć masową na zaszyfrowanym woluminie i natychmiast usuń ją po przetworzeniu.
Sprawdź również logi. Log debugowania, który zapisuje tekst dokumentów, prompty, pobrane fragmenty lub argumenty narzędzi, może stać się największą niezaszyfrowaną kopią bazy wiedzy.
Czy szyfrowanie homomorficzne umożliwia wyszukiwanie w dokumentach bez deszyfrowania?
Szyfrowanie homomorficzne to technologia, po którą większość osób sięga, gdy chce wykonywać obliczenia na zaszyfrowanych danych. Dokumentacja SEAL firmy Microsoft wyjaśnia, że schematy homomorficzne mogą wykonywać wybrane obliczenia, gdy wartości pozostają zaszyfrowane.
Jednocześnie wskazuje to na istotne ograniczenie: szyfrowanie homomorficzne wiąże się ze znacznym narzutem wydajnościowym i efektywnie obsługuje tylko określone operacje. Microsoft SEAL obsługuje działania arytmetyczne, takie jak szyfrowane dodawanie i mnożenie; ogólne porównywanie, sortowanie i wyrażenia regularne zwykle nie są praktyczne w taki sam sposób jak obliczenia na danych w postaci jawnej.
Przybliżone obliczenia odległości można skonstruować za pomocą schematów takich jak CKKS, więc badania nad wyszukiwaniem wektorowym z zachowaniem prywatności są rzeczywiste. Nie oznacza to jednak, że zaszyfrowane wyszukiwanie semantyczne jest równoważne z zainstalowaniem Qdrant, pgvector lub Weaviate i włączeniem opcji „zaszyfrowane zapytanie”.
| Podejście | Praktyczność RAG w domu | Główny kompromis |
|---|---|---|
| Zaszyfrowany dysk + deszyfrowanie w pamięci | Wysokie | Uruchomiony proces może uzyskać dostęp do danych w postaci jawnej |
| Zaszyfrowany wolumin bazy danych | Wysokie | Chroni dane w pamięci masowej, ale nie przed przejęciem środowiska wykonawczego |
| Szyfrowanie wyszukiwalne / homomorficzne | Specjalistyczne | Złożoność, modele wycieku danych, wydajność |
| Prześlij szyfrtekst do zwykłej bazy wektorowej | Nieprzydatne | Nie pozostaje żadna struktura semantyczna |
Bezpieczniejszy prywatny projekt RAG
Dla większości domów i małych zespołów najlepszy stosunek bezpieczeństwa do złożoności wygląda następująco:
Zaszyfrowany zbiór danych NAS
|
| Klucz przypisany do usługi
v
Kontener do pozyskiwania danych RAG
|
+-- wyłącznie w postaci jawnej w pamięci / w zaszyfrowanych plikach tymczasowych
|
+-- wektory osadzeń + metadane
v
Zaszyfrowany wolumin bazy wektorowej
|
v
Lokalna usługa wyszukiwania
|
| minimalna liczba pobranych fragmentów
v
Lokalny model lub zatwierdzony model chmurowy
Jeśli używany jest model chmurowy, pamięć masowa może pozostać w pełni zaszyfrowana, podczas gdy pobrany tekst nadal opuści dom w treści promptu. Szyfrowanie pamięci masowej i kontrola wysyłania danych to odrębne problemy. Przydatny jest tutaj przewodnik po lokalnych granicach zaufania AI: komponent uprawniony do odszyfrowywania danych nie powinien automatycznie uzyskiwać uprawnień do ich przesyłania.
Lista kontrolna szyfrowania prywatnego RAG
- Zaszyfruj wolumin z dokumentami źródłowymi.
- Chroń również pamięć masową bazy wektorowej, migawki i kopie zapasowe.
- Przechowuj klucze poza zwykłymi katalogami dokumentów.
- Przyznaj usłudze RAG tylko minimalny wymagany dostęp do kluczy i ścieżek.
- Unikaj trwałych pamięci podręcznych ekstrakcji w postaci jawnej.
- Sprawdź katalogi tymczasowe OCR, konwersji i debugowania.
- Domyślnie nie rejestruj w logach pobranych prywatnych fragmentów.
- Oddziel uprawnienia do lokalnego wyszukiwania od uprawnień do wysyłania danych do chmury.
- Przetestuj odzyskiwanie danych przed rotacją lub usunięciem kluczy szyfrujących.
Przewodnik po wyszukiwaniu dokumentów i RAG może pomóc dopasować tę warstwę bezpieczeństwa do ekstrakcji, dzielenia na fragmenty, tworzenia embeddingów i wyszukiwania.
Najczęściej zadawane pytania
Czy baza danych wektorowych może bezpośrednio indeksować plik PDF zaszyfrowany za pomocą AES?
Nie. Zawartość musi zostać odszyfrowana przez autoryzowany proces, zanim zwykły tekstowy lub multimodalny model embeddingowy będzie mógł wydobyć z niej znaczenie.
Czy szyfrowanie całego dysku chroni działający serwer RAG?
Tylko częściowo. Po odblokowaniu woluminu uprzywilejowane procesy mogą go odczytać. Szyfrowanie całego dysku zapewnia najlepszą ochronę przed dostępem offline, kradzieżą dysków i skopiowanymi nośnikami.
Czy embeddingi powinny być szyfrowane?
W przypadku wrażliwej prywatnej wiedzy — tak: chroń pamięć masową zawierającą embeddingi i indeksy, ogranicz dostęp do bazy danych i uwzględnij te pliki w tym samym przeglądzie bezpieczeństwa co dokumenty źródłowe.
Ostateczny werdykt
Prywatny system RAG może przechowywać dokumenty w spoczynku w postaci zaszyfrowanej bez rezygnacji ze zwykłego wyszukiwania semantycznego. Realistyczny schemat zakłada kontrolowane, tymczasowe odszyfrowywanie w zaufanej pamięci — a nie magiczne wyszukiwanie w nieprzejrzystym szyfrogramie. Chroń wygenerowane embeddingi i indeksy, oddziel klucze od danych, eliminuj tymczasowe pliki w postaci jawnej i traktuj wyszukiwanie homomorficzne jako wyspecjalizowany projekt kryptograficzny, a nie standardową funkcję domowego RAG.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

10 najlepszych lokalnych interfejsów internetowych AI do domowych laboratoriów w 2026 roku
Porównaj 10 lokalnych interfejsów internetowych AI do samodzielnego hostowania w domowych laboratoriach, uwzględniając obsługę Ollama, RAG, agentów, dostęp wielu użytkowników, poziom trudności konfiguracji oraz...

Ile z czasem kosztuje GPT-6 Astra? Kiedy chmurowa sztuczna inteligencja ma sens w porównaniu z lokalną sztuczną inteligencją
Praktyczny przewodnik po kosztach GPT-6 Astra obejmujący zużycie tokenów, długoterminowe obciążenia AI, kompromisy między chmurą a infrastrukturą lokalną oraz znaczenie hybrydowej infrastruktury AI.

GPT-6 Astra kontra lokalna sztuczna inteligencja: które elementy agenta powinny pozostać na Twoim domowym serwerze?
GPT-6 Astra może pozostać w chmurze, podczas gdy Twój serwer domowy przechowuje lokalnie pliki, pamięć, dane RAG, narzędzia, uprawnienia i trwały stan agenta.

