Decoderingstellingen veranderen het gedrag van lokale LLM's door te bepalen welke volgende tokens in aanmerking komen en hoe sterk verschillen in waarschijnlijkheid elke selectie beïnvloeden.
Een model voor thuis kan een feitelijke vraag steeds consistent beantwoorden, maar repetitief worden tijdens een lange stemsessie of instabiel raken bij creatief schrijven. De gewichten blijven ongewijzigd; de decoder kiest bij elke stap anders uit de waarschijnlijkheidsverdeling. Temperatuur, truncatie, herhalingsstraffen, seed en context bepalen samen of de uitvoer vervalt in bekende lussen of afdwaalt naar vervolgingen met een lage waarschijnlijkheid.
Temperatuur schaalt de zekerheid opnieuw voordat een token wordt gekozen
Bij elke stap kent het model logits toe aan mogelijke tokens. Temperatuur schaalt die logits opnieuw voordat ze worden genormaliseerd: lagere waarden scherpen de verschillen aan en bevoordelen de koplopers, terwijl hogere waarden ze afvlakken en zwakkere kandidaten meer waarschijnlijkheid geven. Greedy-decodering slaat sampling over en kiest altijd het huidige maximum.
Een technische uitleg onderscheidt temperatuur- en tokenfilters: temperatuur verandert de relatieve waarschijnlijkheden in de verdeling, top-k houdt een vast aantal kandidaten over en top-p houdt de kleinste set die een bepaalde waarschijnlijkheidsmassa bereikt. Deze instellingen hangen samen, maar zijn niet uitwisselbaar.
Weinig willekeur kan opmaak en feitelijke formuleringen stabiliseren, maar kan er ook toe leiden dat steeds dezelfde lokaal aantrekkelijke vervolging wordt gekozen. Veel willekeur kan die sleur doorbreken, maar ook fouten toelaten. Stabiliteit betekent daarom gecontroleerde variatie passend bij de taak, niet simpelweg de laagst mogelijke temperatuur.
Dynamische filters veranderen de kandidaatset naarmate de zekerheid verandert
Top-p gebruikt cumulatieve waarschijnlijkheid, waardoor het aantal kandidaten toeneemt wanneer het model onzeker is en afneemt wanneer één token overheerst. Min-p stelt daarentegen een drempel in ten opzichte van het meest waarschijnlijke token. Zo wordt de afkapwaarde aangepast aan de zekerheid zonder een vaste cumulatieve massa na te streven.
Onderzoek naar min-p-sampling rapporteert betere creatieve kwaliteit en diversiteit dan top-p in geteste instellingen met hoge temperatuur. Het mechanisme is lokaal van belang, omdat kleine of gekwantiseerde modellen scherpere of ruisigere verdelingen kunnen hebben dan de standaardinstellingen van een gehoste interface veronderstellen.
Filters werken vóór de willekeurige trekking, terwijl straffen scores aanpassen op basis van eerdere tokens. Een agressieve truncatie combineren met een sterke herhalingsstraf kan onhandige alternatieven overhouden, waardoor de uitvoer instabiel lijkt, ook al leek elke instelling afzonderlijk behoudend.
Wanneer meer willekeur de natuurlijkheid niet langer verbetert
Creatieve diversiteit en redeneernauwkeurigheid bewegen niet gelijk op. Een hoge temperatuur kan gevarieerde verhalen opleveren, maar rekenwerk, code, brongetrouwheid en gestructureerde uitvoer schaden. Omgekeerd kan greedy-decodering geschikt zijn voor beperkte extractie, terwijl die in een gesprek star klinkt.
Onderzoek naar selectief samplen laat zien dat keuzes met een hoge temperatuur het redeneren op gevoelige tokenposities kunnen verslechteren. Dit pleit voor selectieve in plaats van uniforme willekeur. Eén algemene instelling kan niet elk onderdeel van elke taak optimaliseren. Dat onderscheid verandert de uiteindelijke beslissing voor thuisgebruik.
De grens van falen wordt zichtbaar wanneer de uitvoer de taakbeperking schendt: ongeldige JSON, onbewezen beweringen, defecte code of herhaalde lussen. Sampling kan een zwakke prompt, ontbrekende context, een ongeschikt model of beschadigde gespreksgeschiedenis niet herstellen; het verandert alleen de selectie uit de beschikbare waarschijnlijkheden.
Stel een reproduceerbaar samplingtestrooster op
Kies drie representatieve prompts: deterministische extractie, een normaal gesprek en open generatie. Houd het modelbestand, de kwantisering, de prompt, de context en het maximale aantal tokens gelijk. Voer elke prompt uit over een klein raster van temperatuurinstellingen en één truncatiemethode, met zowel een vaste seed als meerdere willekeurige seeds.
Houd ongeldige uitvoer, exacte fraseherhaling, de verhouding unieke tokens, taaknauwkeurigheid en latentie bij. Zo scheid je decodering van het coherentieprobleem dat wordt beschreven in coherentie bij lange contexten, waarbij een lange gesprekscontext de antwoordkwaliteit onafhankelijk kan verminderen. Deze grens blijft zichtbaar bij latere beoordeling van het bewijsmateriaal.
Selecteer afzonderlijke presets per werklast, in plaats van één universele waarde. Wijs een preset af als die de variatie verbetert maar niet aan de harde taakbeperkingen voldoet, en voer het raster opnieuw uit nadat je het model, de kwantisering, de prompttemplate of de herhalingsstraf hebt gewijzigd.
Tech & AI HUB
Meer om te lezen

Meertalige embeddings: hoe één vectorruimte documenten uit huishoudens in verschillende talen met elkaar verbindt
Ontdek hoe uitgelijnde embeddings documenten in verschillende talen met elkaar verbinden, waarom de kwaliteit van het ophalen varieert en hoe je de dekking van...

Conflicten in het agentgeheugen: waarom recente correcties het kunnen afleggen tegen herhaalde oudere feiten
Ontdek hoe dubbele oude herinneringen correcties overheersen, waar recentheidsregels tekortschieten en hoe je overschrijving in een privégeheugenopslag voor agents kunt testen.

Privézoekresultaten opnieuw rangschikken: hoe een tweede model de uiteindelijke volgorde van het bewijsmateriaal verandert
Ontdek waarom de gelijkenis in de eerste fase en de relevantie in de tweede fase van elkaar verschillen, wanneer herordening private RAG helpt en...

