Prywatne cytowania RAG często otwierają się powoli przez domową sieć VPN, ponieważ każde wyświetlenie źródła wymaga dodatkowych podróży w obie strony, nawiązania połączenia i renderowania po stronie serwera.
Lokalna odpowiedź może pojawić się szybko, ponieważ generowanie odbywa się obok indeksu, jednak kliknięcie cytatu PDF kieruje przeglądarkę zaszyfrowaną zdalną ścieżką do serwera NAS. Zanim pojawi się odpowiednia strona, mogą nastąpić rozpoznawanie DNS, trasowanie przez tunel, TLS, uwierzytelnianie, żądania zakresów i generowanie podglądu. Opóźnienie ma większe znaczenie niż deklarowana przepustowość, gdy przeglądarka musi wykonać kilka zależnych wymian.
Otwieranie cytatu to łańcuch zależnych podróży w obie strony
Kliknięcie cytatu rzadko oznacza jeden transfer. Przeglądarka rozpoznaje nazwę, dociera do trasy VPN, negocjuje lub ponownie wykorzystuje zabezpieczenia transportu, uwierzytelnia się w usłudze dokumentów, pobiera metadane, a następnie pobiera bajty źródłowe lub zakres strony potrzebny przeglądarce.
Model wydajności przeglądarki pokazuje, dlaczego zależne podróże sieciowe w obie strony zwielokrotniają opóźnienie, nawet gdy ładunki są małe. Szybkie domowe łącze wysyłające nie może usunąć czasu oczekiwania między żądaniem a odpowiedzią wymaganą do wysłania kolejnego żądania.
Generowanie RAG może omijać tę ścieżkę, ponieważ model i indeks wektorowy komunikują się lokalnie. Widoczna rozbieżność nie oznacza więc, że pobieranie przez VPN było szybkie; oznacza, że przeglądarka cytatu rozpoczyna osobną zdalną transakcję po udostępnieniu odpowiedzi.
Trasowanie tunelu i MTU mogą opóźniać poszczególne fragmenty źródła
VPN dodaje szyfrowanie, enkapsulację i decyzje dotyczące trasowania. Jeśli ruch korzysta z przekaźnika lub trasy przez cały tunel zamiast z trasy bezpośredniej, każde żądanie pokonuje większą odległość; jeśli enkapsulowany pakiet przekracza użyteczne MTU ścieżki, utrata pakietów i retransmisje mogą opóźnić dokładny zakres bajtów potrzebny przeglądarce.
Analiza techniczna wykrywania MTU ścieżki pokazuje, jak zbyt duże pakiety mogą znikać, gdy wykrywanie MTU ścieżki nie działa, powodując zastoje niewspółmierne do średniej przepustowości. Nagłówki VPN zmniejszają ilość danych dostępnych wewnątrz tego samego pakietu zewnętrznego, przez co wcześniej bezpieczny rozmiar może przekroczyć granicę.
Przeglądarki PDF często niezależnie żądają nagłówków, tabel odsyłaczy, czcionek, miniatur i zakresów stron. Jedna utracona odpowiedź może zablokować renderowanie, nawet gdy zbiorczy test szybkości wygląda dobrze, dlatego liczba bajtów na sekundę i czas otwierania cytatu mierzą różne elementy ścieżki.
Renderowanie źródła może dominować po ustabilizowaniu tunelu
Usługa domowa może potrzebować wybudzić dysk, sprawdzić uprawnienia, zdekompresować plik, wykonać wyszukiwanie układu OCR lub wyrenderować podgląd strony. Operacje te odbywają się po dotarciu żądania VPN i mogą dominować opóźnienie w przypadku nieaktywnego dokumentu, podczas gdy niedawno otwarty cytat będzie reagował natychmiast.
Projekt uwierzytelnionego tunelu kładzie nacisk na mały, uwierzytelniony interfejs tunelowy i nowoczesną konstrukcję kryptograficzną, ale nie może wyeliminować pracy aplikacji wykonywanej za punktem końcowym. Narzut szyfrowania, opóźnienie sieciowe, opóźnienie pamięci masowej i opóźnienie podglądu pozostają odrębnymi warstwami obserwowanego czasu kliknięcia.
Błędem jest obwinianie VPN za każdym razem, gdy cytaty otwierają się powoli. Jeśli to samo źródło otwiera się powoli w domowej sieci LAN lub śledzenie serwera pokazuje, że większość czasu upływa przed pierwszym bajtem odpowiedzi, etapami ograniczającymi są pamięć masowa i renderowanie, a nie zdalna zaszyfrowana ścieżka.
Utwórz wykres kaskadowy otwierania cytatu dla obu ścieżek
Wybierz cytaty z pamięci podręcznej i bez niej z małych plików HTML, dużych plików PDF, skanów z OCR oraz uśpionych dysków. Zapisz czas od kliknięcia, DNS, ponowne użycie połączenia, uwierzytelnianie, czas do pierwszego bajtu, liczbę żądań zakresów, przesłane bajty, czas renderowania serwera oraz czas do wyświetlenia cytowanego fragmentu.
Powtórz test dla każdego źródła w sieci LAN i przez VPN, wykorzystując wpływ opóźnienia sieci jako model porównawczy. Przetestuj trasy bezpośrednie i przez przekaźnik, dwie wartości MTU oraz ciepłe i zimne podglądy, nie zmieniając kilku zmiennych podczas jednego uruchomienia.
Uznaj VPN za odpowiedzialny tylko wtedy, gdy różnica między zdalnym dostępem a siecią LAN pojawia się w fazach sieciowych. Jeśli renderowanie serwera dominuje w obu ścieżkach, buforuj bezpieczne podglądy lub usprawnij udostępnianie źródeł; jeśli dominuje wiele podróży w obie strony, ogranicz zależne żądania, zanim kupisz większą przepustowość.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak tajny broker przekazuje agentowi AI dane uwierzytelniające bez ujawniania ich w promptach?
Śledź tożsamość obciążenia, zasady, wydawanie tokenów, wstrzykiwanie żądań, redakcję, wygasanie i unieważnianie w ramach bezsekretnej architektury domowego agenta AI.

Jak piaskownica narzędzi ogranicza skutki uboczne działania agenta AI?
Zobacz, jak izolacja, bramki uprawnień, ulotny stan, kontrola ruchu wychodzącego, limity i dzienniki audytowe ograniczają skutki uboczne agentów AI bez dowodzenia, że działania są...

Jak dekodowanie z ograniczeniami generuje JSON zgodny ze schematem?
Zrozum kompilację schematu, maskowanie tokenów, stan parsera, obsługiwane podzbiory, opóźnienia, obcinanie oraz to, dlaczego poprawność strukturalna nie gwarantuje prawidłowych wartości.

