Lokales LLM-Sampling: Warum Decodierungseinstellungen Wiederholungen und Stabilität verändern

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Decoding-Einstellungen verändern das Verhalten lokaler LLMs, indem sie neu bestimmen, welche nächsten Tokens zulässig bleiben und wie stark sich Wahrscheinlichkeitsunterschiede auf die jeweilige Auswahl auswirken.

Ein lokales Modell kann eine einzelne Faktenfrage zuverlässig gleich beantworten, während es sich während einer langen Sprachsitzung wiederholt oder beim kreativen Schreiben instabil wird. Die Gewichte bleiben unverändert; der Decoder wählt bei jedem Schritt anders aus ihrer Wahrscheinlichkeitsverteilung. Temperatur, Trunkierung, Wiederholungsstrafen, Seed und Kontext bestimmen gemeinsam, ob die Ausgabe in vertraute Schleifen verfällt oder in Fortsetzungen mit geringer Wahrscheinlichkeit abdriftet.

Die Temperatur skaliert die Konfidenz neu, bevor ein Token ausgewählt wird

Bei jedem Schritt weist das Modell möglichen Tokens Logits zu. Die Temperatur skaliert diese Logits vor der Normalisierung neu: Niedrigere Werte verstärken die Unterschiede und bevorzugen die führenden Kandidaten, während höhere Werte sie abflachen und schwächeren Kandidaten mehr Wahrscheinlichkeit geben. Greedy-Decoding überspringt das Sampling und nimmt immer das aktuell wahrscheinlichste Token.

Eine technische Erklärung unterscheidet zwischen Temperatur und Token-Filtern: Die Temperatur verändert die relativen Wahrscheinlichkeiten der gesamten Verteilung, Top-k behält eine feste Anzahl von Kandidaten bei, und Top-p behält die kleinste Menge bei, die eine bestimmte Wahrscheinlichkeitsmasse erreicht. Diese Steuerungen hängen zusammen, sind aber nicht austauschbar.

Geringe Zufälligkeit kann Formatierung und faktische Formulierungen stabilisieren, führt jedoch möglicherweise wiederholt zur Auswahl derselben lokal attraktiven Fortsetzung. Hohe Zufälligkeit kann dieses Muster durchbrechen, aber auch Fehler zulassen. Stabilität bedeutet daher eine für die Aufgabe kontrollierte Varianz und nicht einfach die niedrigste Temperatur.

Dynamische Filter verändern die Kandidatenmenge, wenn sich die Konfidenz ändert

Top-p verwendet kumulative Wahrscheinlichkeit. Daher erweitert sich die Anzahl der Kandidaten, wenn das Modell unsicher ist, und verringert sich, wenn ein Token dominiert. Min-p setzt stattdessen einen Schwellenwert relativ zum wahrscheinlichsten Token und passt den Grenzwert an die Konfidenz an, ohne eine feste kumulative Masse anzustreben.

Untersuchungen zum Min-p-Sampling berichten in getesteten Einstellungen mit hoher Temperatur von besserer kreativer Qualität und größerer Vielfalt als bei Top-p. Der Mechanismus ist lokal relevant, weil kleine oder quantisierte Modelle schärfere oder verrauschtere Verteilungen aufweisen können als die von einer gehosteten Schnittstelle vorausgesetzten Standardeinstellungen.

Filter werden vor der Zufallsauswahl angewendet, während Strafen die Bewertungen auf Grundlage vorheriger Tokens verändern. Die Kombination aus aggressiver Trunkierung und einer starken Wiederholungsstrafe kann nur noch unpassende Alternativen übrig lassen. Dadurch wirkt die Ausgabe instabil, obwohl jede Einstellung für sich genommen konservativ erschien.

Wo mehr Zufälligkeit die Natürlichkeit nicht mehr verbessert

Kreative Vielfalt und Genauigkeit beim Schlussfolgern entwickeln sich nicht gemeinsam. Eine hohe Temperatur kann abwechslungsreiche Geschichten erzeugen, aber Arithmetik, Code, Zitattreue und strukturierte Ausgaben beeinträchtigen. Umgekehrt kann Greedy-Decoding für eine eingeschränkte Extraktion geeignet sein, in einem Gespräch jedoch steif klingen.

Untersuchungen zum selektiven Sampling zeigen, dass Entscheidungen bei hoher Temperatur an empfindlichen Token-Positionen die Qualität des Schlussfolgerns beeinträchtigen können. Das spricht für selektive statt gleichmäßig verteilte Zufälligkeit. Eine globale Einstellung kann nicht jeden Teil jeder Aufgabe optimieren. Diese Unterscheidung verändert die daraus resultierende Entscheidung im Haushalt.

Die Fehlergrenze zeigt sich, wenn die Ausgabe die Aufgabenanforderung verletzt: ungültiges JSON, unbelegte Behauptungen, fehlerhafter Code oder wiederholte Schleifen. Sampling kann einen schwachen Prompt, fehlenden Kontext, ein ungeeignetes Modell oder einen beschädigten Gesprächsverlauf nicht beheben; es verändert lediglich die Auswahl aus den verfügbaren Wahrscheinlichkeiten.

-15% OFF

Erstelle ein reproduzierbares Sampling-Testgitter

Wähle drei repräsentative Prompts: deterministische Extraktion, ein gewöhnliches Gespräch und eine offene Generierung. Halte Modelldatei, Quantisierung, Prompt, Kontext und maximale Token-Anzahl konstant. Führe jeden Prompt in einem kleinen Raster aus Temperatur und einer Trunkierungsmethode aus, sowohl mit einem festen Seed als auch mit mehreren zufälligen Seeds.

Erfasse ungültige Ausgaben, die exakte Wiederholung von Formulierungen, das Verhältnis einzigartiger Tokens, die Aufgabengenauigkeit und die Latenz. Dadurch lässt sich Decoding vom Kohärenzproblem abgrenzen, das in langem Kontext beschrieben wird und bei dem ein langer Gesprächskontext die Antwortqualität unabhängig davon verringern kann. Diese Abgrenzung bleibt auch bei der späteren Beweisauswertung sichtbar.

Wähle getrennte Presets je nach Arbeitslast statt eines universellen Werts. Verwirf ein Preset, wenn es zwar die Vielfalt erhöht, aber die harten Anforderungen der Aufgabe verletzt, und führe das Raster erneut aus, nachdem du Modell, Quantisierung, Prompt-Vorlage oder Wiederholungsstrafe geändert hast.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.