Próbkowanie lokalnych modeli LLM: dlaczego ustawienia dekodowania zmieniają powtarzalność i stabilność

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Ustawienia dekodowania zmieniają zachowanie lokalnych modeli LLM, modyfikując zbiór kolejnych tokenów, które pozostają możliwe do wyboru, oraz siłę, z jaką różnice prawdopodobieństwa wpływają na każdą decyzję.

Model domowy może konsekwentnie odpowiadać na jedno pytanie faktyczne, a jednocześnie stawać się powtarzalny podczas długiej sesji głosowej lub niestabilny przy kreatywnym pisaniu. Wagi pozostają niezmienione — dekoder za każdym krokiem inaczej wybiera z ich rozkładu prawdopodobieństwa. Temperatura, obcinanie rozkładu, kary za powtórzenia, ziarno losowości i kontekst wspólnie decydują o tym, czy wynik zapętli się w znajomych sekwencjach, czy zboczy w kierunku kontynuacji o niskim prawdopodobieństwie.

Temperatura przeskalowuje pewność przed wyborem tokena

Na każdym kroku model przypisuje logity możliwym tokenom. Temperatura przeskalowuje te logity przed normalizacją: niższe wartości wyostrzają różnice i faworyzują liderów, natomiast wyższe je spłaszczają i przyznają słabszym kandydatom większe prawdopodobieństwo. Dekodowanie zachłanne pomija losowanie i zawsze wybiera aktualnie najbardziej prawdopodobny token.

Wyjaśnienie techniczne rozróżnia temperaturę i filtry tokenów: temperatura zmienia względne prawdopodobieństwa w całym rozkładzie, top-k zachowuje stałą liczbę kandydatów, a top-p zachowuje najmniejszy zbiór osiągający określoną masę prawdopodobieństwa. Te mechanizmy są powiązane, ale nie można ich stosować zamiennie.

Niska losowość może stabilizować formatowanie i sformułowania faktograficzne, lecz może też wielokrotnie wybierać tę samą lokalnie atrakcyjną kontynuację. Wysoka losowość może pomóc wyrwać się z takiego schematu, ale jednocześnie dopuszcza błędy. Stabilność oznacza więc kontrolowaną zmienność dopasowaną do zadania, a nie po prostu najniższą temperaturę.

Dynamiczne filtry zmieniają zbiór kandydatów wraz ze zmianą pewności

Top-p wykorzystuje skumulowane prawdopodobieństwo, dlatego liczba kandydatów rośnie, gdy model jest niepewny, i maleje, gdy jeden token wyraźnie dominuje. Min-p ustawia natomiast próg względem najbardziej prawdopodobnego tokena, dostosowując punkt odcięcia do poziomu pewności bez dążenia do określonej stałej skumulowanej masy.

Badania nad losowaniem min-p wskazują na lepszą jakość i różnorodność treści kreatywnych niż w przypadku top-p w testowanych ustawieniach z wysoką temperaturą. Mechanizm ma znaczenie lokalnie, ponieważ małe lub skwantyzowane modele mogą tworzyć rozkłady ostrzejsze albo bardziej zaszumione niż te, które zakładają domyślne ustawienia hostowanego interfejsu.

Filtry działają przed losowaniem, natomiast kary modyfikują wyniki na podstawie wcześniejszych tokenów. Połączenie agresywnego obcinania z silną karą za powtórzenia może pozostawić niezręczne alternatywy, przez co wynik wygląda niestabilnie, mimo że każde ustawienie z osobna wydawało się zachowawcze.

Gdzie większa losowość przestaje poprawiać naturalność

Różnorodność kreatywna i trafność rozumowania nie zmieniają się w tym samym kierunku. Wysoka temperatura może prowadzić do zróżnicowanych historii, ale pogarszać arytmetykę, kod, zgodność z cytowaniami i ustrukturyzowane dane wyjściowe. Z kolei dekodowanie zachłanne może być odpowiednie przy ekstrakcji z ograniczeniami, choć w rozmowie może brzmieć sztywno.

Badania nad selektywnym losowaniem pokazują, że wybory przy wysokiej temperaturze mogą pogarszać rozumowanie w wrażliwych pozycjach tokenów, co przemawia za losowością selektywną zamiast jednolitej. Jedno globalne ustawienie nie może optymalizować każdej części każdego zadania. To rozróżnienie zmienia wynikową decyzję podejmowaną w domu.

Granica niepowodzenia pojawia się, gdy wynik narusza ograniczenie zadania: zawiera nieprawidłowy JSON, niepoparte twierdzenia, uszkodzony kod lub powtarzające się pętle. Losowanie nie naprawi słabego promptu, brakującego kontekstu, nieodpowiedniego modelu ani uszkodzonej historii rozmowy; zmienia jedynie wybór spośród dostępnych prawdopodobieństw.

-15% OFF

Zbuduj powtarzalną siatkę testów losowania

Wybierz trzy reprezentatywne prompty: deterministyczną ekstrakcję, zwykłą rozmowę i generowanie otwarte. Zachowaj ten sam plik modelu, kwantyzację, prompt, kontekst i maksymalną liczbę tokenów. Uruchom każdy przypadek w małej siatce wartości temperatury i jednej metody obcinania, używając zarówno stałego ziarna losowości, jak i kilku losowych ziaren.

Śledź nieprawidłowe wyniki, dokładne powtórzenia fraz, stosunek unikatowych tokenów, trafność zadania i opóźnienie. Pozwala to odizolować dekodowanie od problemu spójności opisanego w artykule o spójności w długim kontekście, gdzie długi kontekst rozmowy może niezależnie obniżać jakość odpowiedzi. Ta granica pozostaje widoczna podczas późniejszej weryfikacji dowodów.

Wybierz osobne presety dla poszczególnych zastosowań, zamiast jednej uniwersalnej wartości. Odrzuć preset, jeśli poprawia różnorodność, ale nie spełnia twardych ograniczeń zadania, i ponownie uruchom siatkę po zmianie modelu, kwantyzacji, szablonu promptu lub kary za powtórzenia.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.