Campionamento degli LLM locali: perché le impostazioni di decodifica modificano la ripetizione e la stabilità

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

Le impostazioni di decodifica modificano il comportamento degli LLM locali ridefinendo quali token successivi rimangono idonei e quanto le differenze di probabilità influenzano ogni selezione.

Un modello domestico può rispondere in modo coerente a una domanda fattuale, ma diventare ripetitivo durante una lunga sessione vocale o instabile nella scrittura creativa. I pesi non cambiano: è il decoder a scegliere ogni volta in modo diverso dalla loro distribuzione di probabilità. Temperatura, troncamento, penalità di ripetizione, seed e contesto determinano insieme se l’output collassa in cicli familiari o si avventura verso continuazioni a bassa probabilità.

La temperatura ridimensiona il livello di sicurezza prima della scelta di un token

A ogni passaggio, il modello assegna dei logit ai token possibili. La temperatura ridimensiona questi logit prima della normalizzazione: i valori più bassi accentuano le differenze e favoriscono i candidati principali, mentre quelli più alti le appiattiscono e assegnano maggiore probabilità ai candidati più deboli. La decodifica greedy evita il campionamento e sceglie sempre il massimo corrente.

Una spiegazione tecnica distingue temperatura e filtri dei token: la temperatura modifica le probabilità relative nell’intera distribuzione, top-k mantiene un numero fisso di candidati e top-p conserva l’insieme più piccolo che raggiunge una determinata massa di probabilità. Questi controlli sono correlati, ma non intercambiabili.

Una casualità ridotta può stabilizzare la formattazione e la formulazione dei fatti, ma può anche scegliere ripetutamente la stessa continuazione localmente allettante. Una casualità elevata può uscire da quel solco, ma ammettere anche degli errori. La stabilità significa quindi una varianza controllata in base al compito, non semplicemente la temperatura più bassa.

I filtri dinamici modificano l’insieme dei candidati al variare della sicurezza

Top-p utilizza la probabilità cumulativa, quindi il numero di candidati aumenta quando il modello è incerto e diminuisce quando un token domina. Min-p, invece, imposta una soglia relativa al token più probabile, adattando il limite al livello di sicurezza senza puntare a una massa cumulativa fissa.

La ricerca sul campionamento min-p riporta una qualità creativa e una diversità migliori rispetto a top-p nelle impostazioni ad alta temperatura analizzate. Il meccanismo è importante a livello locale perché i modelli più piccoli o quantizzati possono avere distribuzioni più accentuate o rumorose rispetto a quelle presupposte da un’interfaccia ospitata.

I filtri operano prima dell’estrazione casuale, mentre le penalità modificano i punteggi in base ai token precedenti. Combinare un troncamento aggressivo con una penalità di ripetizione elevata può lasciare alternative poco naturali, facendo apparire instabile l’output anche se ogni impostazione sembrava prudente considerata singolarmente.

Dove una maggiore casualità smette di migliorare la naturalezza

La diversità creativa e l’accuratezza del ragionamento non procedono di pari passo. Una temperatura elevata può produrre storie varie, ma compromettere l’aritmetica, il codice, la fedeltà delle citazioni e l’output strutturato. Al contrario, la decodifica greedy può essere adatta all’estrazione vincolata, pur risultando rigida nella conversazione.

La ricerca sul campionamento selettivo rileva che le scelte ad alta temperatura possono compromettere il ragionamento in corrispondenza di posizioni sensibili dei token, motivando una casualità selettiva anziché uniforme. Un’unica impostazione globale non può ottimizzare ogni parte di ogni compito. Questa distinzione modifica la decisione domestica risultante.

Il limite di fallimento compare quando l’output viola il vincolo del compito: JSON non valido, affermazioni non supportate, codice danneggiato o cicli ripetuti. Il campionamento non può correggere un prompt debole, un contesto mancante, un modello inadatto o una cronologia della conversazione danneggiata; modifica soltanto la selezione tra le probabilità disponibili.

-15% OFF

Costruisci una griglia di test del campionamento riproducibile

Scegli tre prompt rappresentativi: estrazione deterministica, conversazione ordinaria e generazione aperta. Mantieni fissi il file del modello, la quantizzazione, il prompt, il contesto e il numero massimo di token. Esegui ciascuno su una piccola griglia di temperatura e un metodo di troncamento, usando sia un seed fisso sia diversi seed casuali.

Monitora gli output non validi, la ripetizione esatta delle frasi, il rapporto di token unici, l’accuratezza del compito e la latenza. In questo modo separi la decodifica dal problema di coerenza descritto nella coerenza nei contesti lunghi, in cui un contesto conversazionale esteso può ridurre autonomamente la qualità delle risposte. Questo limite rimane visibile durante la successiva revisione delle evidenze.

Seleziona preset distinti in base al carico di lavoro, invece di usare un unico valore universale. Rifiuta un preset se migliora la varietà ma non rispetta i vincoli rigidi del compito, quindi ripeti la griglia dopo aver modificato il modello, la quantizzazione, il modello di prompt o la penalità di ripetizione.

Hub Tecnologico e AI

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.