Sampling van lokale LLM's: waarom decodeerinstellingen herhaling en stabiliteit veranderen

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Decoderingstellingen veranderen het gedrag van lokale LLM's door te bepalen welke volgende tokens in aanmerking komen en hoe sterk verschillen in waarschijnlijkheid elke selectie beïnvloeden.

Een model voor thuis kan een feitelijke vraag steeds consistent beantwoorden, maar repetitief worden tijdens een lange stemsessie of instabiel raken bij creatief schrijven. De gewichten blijven ongewijzigd; de decoder kiest bij elke stap anders uit de waarschijnlijkheidsverdeling. Temperatuur, truncatie, herhalingsstraffen, seed en context bepalen samen of de uitvoer vervalt in bekende lussen of afdwaalt naar vervolgingen met een lage waarschijnlijkheid.

Temperatuur schaalt de zekerheid opnieuw voordat een token wordt gekozen

Bij elke stap kent het model logits toe aan mogelijke tokens. Temperatuur schaalt die logits opnieuw voordat ze worden genormaliseerd: lagere waarden scherpen de verschillen aan en bevoordelen de koplopers, terwijl hogere waarden ze afvlakken en zwakkere kandidaten meer waarschijnlijkheid geven. Greedy-decodering slaat sampling over en kiest altijd het huidige maximum.

Een technische uitleg onderscheidt temperatuur- en tokenfilters: temperatuur verandert de relatieve waarschijnlijkheden in de verdeling, top-k houdt een vast aantal kandidaten over en top-p houdt de kleinste set die een bepaalde waarschijnlijkheidsmassa bereikt. Deze instellingen hangen samen, maar zijn niet uitwisselbaar.

Weinig willekeur kan opmaak en feitelijke formuleringen stabiliseren, maar kan er ook toe leiden dat steeds dezelfde lokaal aantrekkelijke vervolging wordt gekozen. Veel willekeur kan die sleur doorbreken, maar ook fouten toelaten. Stabiliteit betekent daarom gecontroleerde variatie passend bij de taak, niet simpelweg de laagst mogelijke temperatuur.

Dynamische filters veranderen de kandidaatset naarmate de zekerheid verandert

Top-p gebruikt cumulatieve waarschijnlijkheid, waardoor het aantal kandidaten toeneemt wanneer het model onzeker is en afneemt wanneer één token overheerst. Min-p stelt daarentegen een drempel in ten opzichte van het meest waarschijnlijke token. Zo wordt de afkapwaarde aangepast aan de zekerheid zonder een vaste cumulatieve massa na te streven.

Onderzoek naar min-p-sampling rapporteert betere creatieve kwaliteit en diversiteit dan top-p in geteste instellingen met hoge temperatuur. Het mechanisme is lokaal van belang, omdat kleine of gekwantiseerde modellen scherpere of ruisigere verdelingen kunnen hebben dan de standaardinstellingen van een gehoste interface veronderstellen.

Filters werken vóór de willekeurige trekking, terwijl straffen scores aanpassen op basis van eerdere tokens. Een agressieve truncatie combineren met een sterke herhalingsstraf kan onhandige alternatieven overhouden, waardoor de uitvoer instabiel lijkt, ook al leek elke instelling afzonderlijk behoudend.

Wanneer meer willekeur de natuurlijkheid niet langer verbetert

Creatieve diversiteit en redeneernauwkeurigheid bewegen niet gelijk op. Een hoge temperatuur kan gevarieerde verhalen opleveren, maar rekenwerk, code, brongetrouwheid en gestructureerde uitvoer schaden. Omgekeerd kan greedy-decodering geschikt zijn voor beperkte extractie, terwijl die in een gesprek star klinkt.

Onderzoek naar selectief samplen laat zien dat keuzes met een hoge temperatuur het redeneren op gevoelige tokenposities kunnen verslechteren. Dit pleit voor selectieve in plaats van uniforme willekeur. Eén algemene instelling kan niet elk onderdeel van elke taak optimaliseren. Dat onderscheid verandert de uiteindelijke beslissing voor thuisgebruik.

De grens van falen wordt zichtbaar wanneer de uitvoer de taakbeperking schendt: ongeldige JSON, onbewezen beweringen, defecte code of herhaalde lussen. Sampling kan een zwakke prompt, ontbrekende context, een ongeschikt model of beschadigde gespreksgeschiedenis niet herstellen; het verandert alleen de selectie uit de beschikbare waarschijnlijkheden.

-15% OFF
Single board computer zimaboard2

Stel een reproduceerbaar samplingtestrooster op

Kies drie representatieve prompts: deterministische extractie, een normaal gesprek en open generatie. Houd het modelbestand, de kwantisering, de prompt, de context en het maximale aantal tokens gelijk. Voer elke prompt uit over een klein raster van temperatuurinstellingen en één truncatiemethode, met zowel een vaste seed als meerdere willekeurige seeds.

Houd ongeldige uitvoer, exacte fraseherhaling, de verhouding unieke tokens, taaknauwkeurigheid en latentie bij. Zo scheid je decodering van het coherentieprobleem dat wordt beschreven in coherentie bij lange contexten, waarbij een lange gesprekscontext de antwoordkwaliteit onafhankelijk kan verminderen. Deze grens blijft zichtbaar bij latere beoordeling van het bewijsmateriaal.

Selecteer afzonderlijke presets per werklast, in plaats van één universele waarde. Wijs een preset af als die de variatie verbetert maar niet aan de harde taakbeperkingen voldoet, en voer het raster opnieuw uit nadat je het model, de kwantisering, de prompttemplate of de herhalingsstraf hebt gewijzigd.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.