Ustawienia dekodowania zmieniają zachowanie lokalnych modeli LLM, modyfikując zbiór kolejnych tokenów, które pozostają możliwe do wyboru, oraz siłę, z jaką różnice prawdopodobieństwa wpływają na każdą decyzję.
Model domowy może konsekwentnie odpowiadać na jedno pytanie faktyczne, a jednocześnie stawać się powtarzalny podczas długiej sesji głosowej lub niestabilny przy kreatywnym pisaniu. Wagi pozostają niezmienione — dekoder za każdym krokiem inaczej wybiera z ich rozkładu prawdopodobieństwa. Temperatura, obcinanie rozkładu, kary za powtórzenia, ziarno losowości i kontekst wspólnie decydują o tym, czy wynik zapętli się w znajomych sekwencjach, czy zboczy w kierunku kontynuacji o niskim prawdopodobieństwie.
Temperatura przeskalowuje pewność przed wyborem tokena
Na każdym kroku model przypisuje logity możliwym tokenom. Temperatura przeskalowuje te logity przed normalizacją: niższe wartości wyostrzają różnice i faworyzują liderów, natomiast wyższe je spłaszczają i przyznają słabszym kandydatom większe prawdopodobieństwo. Dekodowanie zachłanne pomija losowanie i zawsze wybiera aktualnie najbardziej prawdopodobny token.
Wyjaśnienie techniczne rozróżnia temperaturę i filtry tokenów: temperatura zmienia względne prawdopodobieństwa w całym rozkładzie, top-k zachowuje stałą liczbę kandydatów, a top-p zachowuje najmniejszy zbiór osiągający określoną masę prawdopodobieństwa. Te mechanizmy są powiązane, ale nie można ich stosować zamiennie.
Niska losowość może stabilizować formatowanie i sformułowania faktograficzne, lecz może też wielokrotnie wybierać tę samą lokalnie atrakcyjną kontynuację. Wysoka losowość może pomóc wyrwać się z takiego schematu, ale jednocześnie dopuszcza błędy. Stabilność oznacza więc kontrolowaną zmienność dopasowaną do zadania, a nie po prostu najniższą temperaturę.
Dynamiczne filtry zmieniają zbiór kandydatów wraz ze zmianą pewności
Top-p wykorzystuje skumulowane prawdopodobieństwo, dlatego liczba kandydatów rośnie, gdy model jest niepewny, i maleje, gdy jeden token wyraźnie dominuje. Min-p ustawia natomiast próg względem najbardziej prawdopodobnego tokena, dostosowując punkt odcięcia do poziomu pewności bez dążenia do określonej stałej skumulowanej masy.
Badania nad losowaniem min-p wskazują na lepszą jakość i różnorodność treści kreatywnych niż w przypadku top-p w testowanych ustawieniach z wysoką temperaturą. Mechanizm ma znaczenie lokalnie, ponieważ małe lub skwantyzowane modele mogą tworzyć rozkłady ostrzejsze albo bardziej zaszumione niż te, które zakładają domyślne ustawienia hostowanego interfejsu.
Filtry działają przed losowaniem, natomiast kary modyfikują wyniki na podstawie wcześniejszych tokenów. Połączenie agresywnego obcinania z silną karą za powtórzenia może pozostawić niezręczne alternatywy, przez co wynik wygląda niestabilnie, mimo że każde ustawienie z osobna wydawało się zachowawcze.
Gdzie większa losowość przestaje poprawiać naturalność
Różnorodność kreatywna i trafność rozumowania nie zmieniają się w tym samym kierunku. Wysoka temperatura może prowadzić do zróżnicowanych historii, ale pogarszać arytmetykę, kod, zgodność z cytowaniami i ustrukturyzowane dane wyjściowe. Z kolei dekodowanie zachłanne może być odpowiednie przy ekstrakcji z ograniczeniami, choć w rozmowie może brzmieć sztywno.
Badania nad selektywnym losowaniem pokazują, że wybory przy wysokiej temperaturze mogą pogarszać rozumowanie w wrażliwych pozycjach tokenów, co przemawia za losowością selektywną zamiast jednolitej. Jedno globalne ustawienie nie może optymalizować każdej części każdego zadania. To rozróżnienie zmienia wynikową decyzję podejmowaną w domu.
Granica niepowodzenia pojawia się, gdy wynik narusza ograniczenie zadania: zawiera nieprawidłowy JSON, niepoparte twierdzenia, uszkodzony kod lub powtarzające się pętle. Losowanie nie naprawi słabego promptu, brakującego kontekstu, nieodpowiedniego modelu ani uszkodzonej historii rozmowy; zmienia jedynie wybór spośród dostępnych prawdopodobieństw.
Zbuduj powtarzalną siatkę testów losowania
Wybierz trzy reprezentatywne prompty: deterministyczną ekstrakcję, zwykłą rozmowę i generowanie otwarte. Zachowaj ten sam plik modelu, kwantyzację, prompt, kontekst i maksymalną liczbę tokenów. Uruchom każdy przypadek w małej siatce wartości temperatury i jednej metody obcinania, używając zarówno stałego ziarna losowości, jak i kilku losowych ziaren.
Śledź nieprawidłowe wyniki, dokładne powtórzenia fraz, stosunek unikatowych tokenów, trafność zadania i opóźnienie. Pozwala to odizolować dekodowanie od problemu spójności opisanego w artykule o spójności w długim kontekście, gdzie długi kontekst rozmowy może niezależnie obniżać jakość odpowiedzi. Ta granica pozostaje widoczna podczas późniejszej weryfikacji dowodów.
Wybierz osobne presety dla poszczególnych zastosowań, zamiast jednej uniwersalnej wartości. Odrzuć preset, jeśli poprawia różnorodność, ale nie spełnia twardych ograniczeń zadania, i ponownie uruchom siatkę po zmianie modelu, kwantyzacji, szablonu promptu lub kary za powtórzenia.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Wielojęzyczne reprezentacje wektorowe: jak jedna przestrzeń wektorowa łączy dokumenty domowe w różnych językach
Zobacz, jak wyrównane osadzenia łączą dokumenty w różnych językach, dlaczego jakość wyszukiwania różni się oraz jak lokalnie testować pokrycie dowodów między językami.

Konflikty pamięci agenta: dlaczego najnowsze poprawki mogą przegrywać z wielokrotnie powtarzanymi starszymi faktami
Dowiedz się, jak zduplikowane stare wspomnienia przytłaczają poprawki, gdzie zawodzą reguły pierwszeństwa najnowszych informacji oraz jak testować zastępowanie wpisów w prywatnym magazynie pamięci agenta.

Prywatne ponowne ustalanie rankingu wyszukiwania: jak drugi model zmienia ostateczną kolejność dowodów
Zobacz, dlaczego podobieństwo pierwszego etapu i trafność drugiego etapu się nie zgadzają, kiedy reranking pomaga w prywatnym RAG-u oraz jak oceniać ponownie uporządkowane dowody.

