Le impostazioni di decodifica modificano il comportamento degli LLM locali ridefinendo quali token successivi rimangono idonei e quanto le differenze di probabilità influenzano ogni selezione.
Un modello domestico può rispondere in modo coerente a una domanda fattuale, ma diventare ripetitivo durante una lunga sessione vocale o instabile nella scrittura creativa. I pesi non cambiano: è il decoder a scegliere ogni volta in modo diverso dalla loro distribuzione di probabilità. Temperatura, troncamento, penalità di ripetizione, seed e contesto determinano insieme se l’output collassa in cicli familiari o si avventura verso continuazioni a bassa probabilità.
La temperatura ridimensiona il livello di sicurezza prima della scelta di un token
A ogni passaggio, il modello assegna dei logit ai token possibili. La temperatura ridimensiona questi logit prima della normalizzazione: i valori più bassi accentuano le differenze e favoriscono i candidati principali, mentre quelli più alti le appiattiscono e assegnano maggiore probabilità ai candidati più deboli. La decodifica greedy evita il campionamento e sceglie sempre il massimo corrente.
Una spiegazione tecnica distingue temperatura e filtri dei token: la temperatura modifica le probabilità relative nell’intera distribuzione, top-k mantiene un numero fisso di candidati e top-p conserva l’insieme più piccolo che raggiunge una determinata massa di probabilità. Questi controlli sono correlati, ma non intercambiabili.
Una casualità ridotta può stabilizzare la formattazione e la formulazione dei fatti, ma può anche scegliere ripetutamente la stessa continuazione localmente allettante. Una casualità elevata può uscire da quel solco, ma ammettere anche degli errori. La stabilità significa quindi una varianza controllata in base al compito, non semplicemente la temperatura più bassa.
I filtri dinamici modificano l’insieme dei candidati al variare della sicurezza
Top-p utilizza la probabilità cumulativa, quindi il numero di candidati aumenta quando il modello è incerto e diminuisce quando un token domina. Min-p, invece, imposta una soglia relativa al token più probabile, adattando il limite al livello di sicurezza senza puntare a una massa cumulativa fissa.
La ricerca sul campionamento min-p riporta una qualità creativa e una diversità migliori rispetto a top-p nelle impostazioni ad alta temperatura analizzate. Il meccanismo è importante a livello locale perché i modelli più piccoli o quantizzati possono avere distribuzioni più accentuate o rumorose rispetto a quelle presupposte da un’interfaccia ospitata.
I filtri operano prima dell’estrazione casuale, mentre le penalità modificano i punteggi in base ai token precedenti. Combinare un troncamento aggressivo con una penalità di ripetizione elevata può lasciare alternative poco naturali, facendo apparire instabile l’output anche se ogni impostazione sembrava prudente considerata singolarmente.
Dove una maggiore casualità smette di migliorare la naturalezza
La diversità creativa e l’accuratezza del ragionamento non procedono di pari passo. Una temperatura elevata può produrre storie varie, ma compromettere l’aritmetica, il codice, la fedeltà delle citazioni e l’output strutturato. Al contrario, la decodifica greedy può essere adatta all’estrazione vincolata, pur risultando rigida nella conversazione.
La ricerca sul campionamento selettivo rileva che le scelte ad alta temperatura possono compromettere il ragionamento in corrispondenza di posizioni sensibili dei token, motivando una casualità selettiva anziché uniforme. Un’unica impostazione globale non può ottimizzare ogni parte di ogni compito. Questa distinzione modifica la decisione domestica risultante.
Il limite di fallimento compare quando l’output viola il vincolo del compito: JSON non valido, affermazioni non supportate, codice danneggiato o cicli ripetuti. Il campionamento non può correggere un prompt debole, un contesto mancante, un modello inadatto o una cronologia della conversazione danneggiata; modifica soltanto la selezione tra le probabilità disponibili.
Costruisci una griglia di test del campionamento riproducibile
Scegli tre prompt rappresentativi: estrazione deterministica, conversazione ordinaria e generazione aperta. Mantieni fissi il file del modello, la quantizzazione, il prompt, il contesto e il numero massimo di token. Esegui ciascuno su una piccola griglia di temperatura e un metodo di troncamento, usando sia un seed fisso sia diversi seed casuali.
Monitora gli output non validi, la ripetizione esatta delle frasi, il rapporto di token unici, l’accuratezza del compito e la latenza. In questo modo separi la decodifica dal problema di coerenza descritto nella coerenza nei contesti lunghi, in cui un contesto conversazionale esteso può ridurre autonomamente la qualità delle risposte. Questo limite rimane visibile durante la successiva revisione delle evidenze.
Seleziona preset distinti in base al carico di lavoro, invece di usare un unico valore universale. Rifiuta un preset se migliora la varietà ma non rispetta i vincoli rigidi del compito, quindi ripeti la griglia dopo aver modificato il modello, la quantizzazione, il modello di prompt o la penalità di ripetizione.
Hub Tecnologico e AI
Altro da leggere

Embedding multilingue: come un unico spazio vettoriale collega i documenti domestici tra lingue diverse
Scopri come gli embedding allineati collegano documenti in lingue diverse, perché la qualità del recupero varia e come testare localmente la copertura delle evidenze...

Conflitti nella memoria dell’agente: perché le correzioni recenti possono soccombere a fatti più vecchi ripetuti
Scopri come i vecchi ricordi duplicati prevalgono sulle correzioni, dove le regole di recenza falliscono e come testare la sostituzione in un archivio di...

Riordinamento privato della ricerca: come un secondo modello modifica l’ordine finale delle evidenze
Scopri perché la similarità della prima fase e la rilevanza della seconda fase non concordano, quando il reranking aiuta il RAG privato e come...

