Degradacja kontekstu to spadek niezawodności, z jaką model wykorzystuje informacje w miarę rozrastania się aktywnego kontekstu, jeszcze zanim wyczerpie się techniczne okno kontekstu.
Długa lokalna sesja AI może zachować każdy ostatni token, a mimo to stawać się coraz trudniejsza do przeanalizowania. Stare instrukcje, poprawki, wyniki narzędzi, pobrane fragmenty, częściowe plany i powtarzające się podsumowania konkurują o uwagę, a ważne dowody mogą znaleźć się w mniej korzystnych pozycjach. Degradacja kontekstu opisuje więc problem wykorzystania informacji, a nie tylko ograniczenie pojemności pamięci. Ma największe znaczenie wtedy, gdy jedna trwała sesja staje się stanem roboczym dla rzeczywistych zadań domowych.
Degradacja kontekstu może rozpocząć się przed zapełnieniem okna kontekstu
Okno kontekstu określa, ile tekstu model może przyjąć, ale nie gwarantuje jednakowej jakości rozumowania przy każdej długości. Większa liczba tokenów zwiększa liczbę zależności, które model musi rozstrzygnąć, i może utrudniać konsekwentne wykorzystanie prostych dowodów.
Nawet gdy istotne informacje nadal są obecne, wydajność może spadać wraz ze wzrostem kontekstu, co stanowi główne zjawisko opisywane jako degradacja kontekstu.
W przypadku domowego asystenta sygnałem ostrzegawczym nie jest błąd przepełnienia. Jest nim sesja, która nadal zawiera wczorajszą poprawkę, a mimo to odpowiada tak, jakby wcześniejsze założenie nadal obowiązywało.
Istotne informacje konkurują ze znaczeniem pozycji i wzajemnymi zakłóceniami
Długie prompty rozmieszczają ważne treści na początku, w środku i na końcu, a modele nie zawsze równie dobrze wykorzystują informacje z tych pozycji. Powtarzające się lub semantycznie podobne szczegóły mogą również utrudniać ustalenie, który fakt należy potraktować jako rozstrzygający.
Modele obsługujące długi kontekst mogą wykazywać silne zależne od pozycji wykorzystanie informacji, zwłaszcza gdy istotne dowody pojawiają się poza preferowanymi pozycjami.
Sesja domowa może więc jednocześnie zawierać prawidłową regułę dotyczącą termostatu, bieżącą ścieżkę kopii zapasowej i wcześniejszą, zastąpioną regułę. Samo zachowanie wszystkich trzech nie gwarantuje, że najnowsza z nich będzie decydować o kolejnej odpowiedzi.
Dlatego zarządzanie kontekstem powinno uwzględniać istotność i nadrzędność informacji, a nie tylko liczbę tokenów. Zwięzły, wiarygodny stan może być bardziej użyteczny niż kompletny zapis każdej myśli pośredniej i każdego wyniku narzędzia.
Długie sesje łączą bieżące instrukcje z nieaktualnym stanem
Trwałe czaty w naturalny sposób gromadzą poprawki, tymczasowe decyzje, porzucone plany i wyniki narzędzi, których ważność wygasa. Bez wyraźnego oznaczenia zastąpienia model otrzymuje kilka historycznych stanów jako zwykły tekst i musi sam ustalić, który z nich nadal obowiązuje w ramach zadania.
W miarę narastania historii kontekst może pogarszać rozumowanie, nawet jeśli większa ilość historii pozornie dostarcza więcej informacji.
W przypadku lokalnych agentów nieaktualny kontekst jest szczególnie niebezpieczny po użyciu narzędzi. Stary stan usługi, wynik kontroli uprawnień lub lokalizacja pliku nie powinny zachowywać jednakowej wiarygodności, gdy późniejsza obserwacja pokazuje, że środowisko się zmieniło.
Podsumowania i przycinanie wymieniają możliwość odtworzenia informacji na czystszy zestaw roboczy
Jednym z rozwiązań jest skompresowanie rozmowy do mniejszego stanu, zachowanie bieżących decyzji i usunięcie materiału pośredniego, który nie wpływa już na zadanie. Ogranicza to zakłócenia, ale podsumowanie może również pominąć zastrzeżenie, które później okaże się istotne.
Przesuwane okno kontekstu tworzy granicę architektoniczną, przy której stare tokeny tracą bezpośredni dostęp do mechanizmu uwagi; przycinanie kontekstu to odrębna decyzja aplikacyjna podejmowana przed osiągnięciem tego twardego limitu.
Solidny lokalny asystent zachowuje zwięzłe informacje, takie jak bieżące cele, poprawki, nierozstrzygnięte pytania i stan zweryfikowany zewnętrznie, a jednocześnie pozwala, by obszerne dialogi eksploracyjne wygasały.
Kompromis powinien być widoczny. Gdy podsumowanie zastępuje surową historię, należy przechowywać wystarczające informacje o pochodzeniu danych, aby można było odzyskać pierwotne dowody, jeśli późniejsze zadanie będzie zależeć od szczegółu skompresowanego w podsumowaniu.
Degradacja kontekstu to nie to samo co zapominanie lub eksmisja pamięci
Zapominanie oznacza, że istotnej informacji brakuje lub jest ona niedostępna. Degradacja kontekstu jest subtelniejsza, ponieważ informacja może nadal być obecna, a mimo to model wykorzystuje ją niespójnie, pomija ją albo pozwala, by zdominował ją konkurencyjny tekst.
To rozróżnienie ma znaczenie podczas diagnozowania lokalnego wnioskowania. Zwiększenie maksymalnej długości kontekstu lub przydzielenie większej ilości pamięci podręcznej KV może utrzymać więcej tokenów w pamięci, ale nie naprawi problemów z wykorzystaniem długiego kontekstu, które powstają w obrębie zachowanego okna.
Sesja, która poprawia się po usunięciu nieistotnej historii, wskazuje na problem selekcji informacji, a niekoniecznie na niedobór pamięci sprzętowej.
Degradacja kontekstu ma znaczenie, gdy sesja staje się pamięcią roboczą dla rzeczywistych działań
Luźna rozmowa może tolerować pewien dryf, ponieważ koszt jednej nieprecyzyjnej odpowiedzi jest niewielki. Sesja, która planuje kopie zapasowe, edytuje pliki, steruje usługami lub zarządza długim zadaniem badawczym, wymaga znacznie większej niezawodności.
Korzystaj z trwałego stanu zewnętrznego dla faktów, które muszą być zachowane bez zmian przez wiele tur: bieżącego statusu zadania, zatwierdzonych parametrów, wersji dokumentów, ukończonych wywołań narzędzi i oczekujących decyzji. Prompt powinien zawierać dowody potrzebne w danej chwili, a nie stawać się jedyną bazą danych całego przepływu pracy.
Degradacja kontekstu wyznacza więc granicę architektury agentów. Gdy historia sesji zaczyna przechowywać stan operacyjny, który musi pozostać dokładny, przenieś ten stan do pamięci strukturalnej, systemu pobierania danych, dzienników lub magazynu przepływów pracy, a kontekst językowy pozostaw jako przestrzeń do rozumowania.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Czym jest stan Plexa i które jego elementy muszą być zachowane?
Trwały stan Plex to informacje, które zachowują konfigurację serwera po ponownym uruchomieniu i odbudowie; multimedia oraz tymczasowe dane transkodowania pełnią odrębne funkcje.

Jak Plex obsługuje uwierzytelnianie w sesjach lokalnych i zdalnych?
Uwierzytelnianie w Plex rozpoczyna się od tożsamości serwera i konta, a następnie lokalne lub zdalne ścieżki sieciowe określają dostępność oraz sposób nawiązywania bezpiecznego połączenia.

Dlaczego wyszukiwanie w Plex może zwalniać wraz ze wzrostem ilości danych biblioteki?
Sam wzrost biblioteki nie jest diagnozą. Zanim obwinisz rozmiar bazy danych, przetestuj kształt zapytań, indeksy, stan pamięci podręcznej, opóźnienia pamięci masowej i aktywność zapisu.

