Sampling av lokala LLM: Varför avkodningsinställningar påverkar upprepning och stabilitet

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

Avkodningsinställningar förändrar lokala LLM:ers beteende genom att omforma vilka nästa token som fortfarande kan väljas och hur starkt sannolikhetsskillnader påverkar varje val.

En hemmamodell kan besvara en faktabaserad fråga konsekvent men bli repetitiv under ett långt röstsamtal eller instabil vid kreativt skrivande. Vikterna är oförändrade; avkodaren väljer olika från sannolikhetsfördelningen i varje steg. Temperatur, trunkering, upprepningsstraff, seed och kontext avgör tillsammans om resultatet fastnar i välbekanta loopar eller vandrar mot fortsättningar med låg sannolikhet.

Temperatur skalar om säkerheten innan en token väljs

I varje steg tilldelar modellen logitvärden till möjliga token. Temperaturen skalar om dessa logitvärden före normaliseringen: lägre värden förstärker skillnaderna och gynnar de ledande kandidaterna, medan högre värden jämnar ut dem och ger svagare kandidater större sannolikhet. Girig avkodning hoppar över sampling och väljer alltid det aktuella maxvärdet.

En teknisk förklaring skiljer mellan temperatur och tokenfilter: temperatur förändrar de relativa sannolikheterna i fördelningen, top-k behåller ett fast antal kandidater och top-p behåller den minsta mängd kandidater som når en viss sannolikhetsmassa. Dessa reglage hänger ihop men är inte utbytbara.

Låg slumpmässighet kan stabilisera formatering och faktabaserade formuleringar, men kan också upprepade gånger välja samma lokalt attraktiva fortsättning. Hög slumpmässighet kan ta sig ur det spåret men även släppa igenom fel. Stabilitet innebär därför kontrollerad variation för uppgiften, inte bara lägsta möjliga temperatur.

Dynamiska filter ändrar kandidatgruppen när säkerheten förändras

Top-p använder kumulativ sannolikhet, så antalet kandidater ökar när modellen är osäker och minskar när en token dominerar. Min-p sätter i stället en tröskel i förhållande till den mest sannolika token och anpassar gränsen efter säkerheten utan att sikta på en fast kumulativ massa.

Forskning om min-p-sampling rapporterar bättre kreativ kvalitet och mångfald än top-p i testade miljöer med hög temperatur. Mekanismen har lokal betydelse eftersom små eller kvantiserade modeller kan ha skarpare eller brusigare fördelningar än de standardvärden som ett värdgränssnitt förutsätter.

Filter används före det slumpmässiga valet, medan straff modifierar poängen utifrån tidigare token. Om aggressiv trunkering kombineras med ett starkt upprepningsstraff kan obekväma alternativ återstå, vilket får resultatet att verka instabilt trots att varje inställning verkade försiktig var för sig.

Var mer slumpmässighet slutar förbättra det naturliga språket

Kreativ mångfald och noggrannhet i resonemang följs inte åt. Hög temperatur kan ge varierade berättelser men försämra aritmetik, kod, källtrohet och strukturerade resultat. Girig avkodning kan däremot passa för begränsad extraktion men låta stel i en konversation.

Forskning om selektiv sampling visar att val med hög temperatur kan försämra resonemanget vid känsliga tokenpositioner, vilket motiverar selektiv snarare än enhetlig slumpmässighet. En enda global inställning kan inte optimera alla delar av varje uppgift. Den skillnaden förändrar det efterföljande beslutet i hemmet.

Gränsen för när det misslyckas uppstår när resultatet bryter mot uppgiftens begränsningar: ogiltig JSON, obestyrkta påståenden, trasig kod eller upprepade loopar. Sampling kan inte reparera en svag prompt, saknad kontext, en olämplig modell eller skadad samtalshistorik; den ändrar bara valet bland tillgängliga sannolikheter.

-15% OFF
Single board computer zimaboard2

Bygg ett reproducerbart testgaller för sampling

Välj tre representativa prompter: deterministisk extraktion, vanlig konversation och öppen generering. Håll modellfil, kvantisering, prompt, kontext och maximalt antal token konstanta. Kör varje prompt genom ett litet rutnät av temperaturer och en trunkeringsmetod, med både en fast seed och flera slumpmässiga seeds.

Följ upp ogiltiga resultat, exakt frasupprepning, andelen unika token, uppgiftsnoggrannhet och fördröjning. Det isolerar avkodning från koherensproblemet som beskrivs i koherens i lång kontext, där en lång samtalskontext oberoende kan försämra svarskvaliteten. Denna gräns förblir synlig vid senare granskning av belägg.

Välj separata förinställningar efter arbetsbelastning, inte ett universellt värde. Avvisa en förinställning om den förbättrar variationen men inte klarar uppgiftens hårda begränsningar, och kör om testgallret efter ändringar av modell, kvantisering, promptmall eller upprepningsstraff.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.