Échantillonnage des LLM locaux : pourquoi les paramètres de décodage modifient la répétition et la stabilité

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Les paramètres de décodage modifient le comportement des LLM locaux en redéfinissant les prochains tokens admissibles et l’influence des écarts de probabilité sur chaque sélection.

Un modèle local peut répondre systématiquement à une question factuelle, puis devenir répétitif au cours d’une longue session vocale ou instable lors d’une rédaction créative. Les poids restent inchangés ; c’est le décodeur qui sélectionne différemment, à chaque étape, dans leur distribution de probabilités. La température, la troncature, les pénalités de répétition, la valeur de départ et le contexte déterminent ensemble si la sortie se fige dans des boucles familières ou s’aventure vers des continuations à faible probabilité.

La température redimensionne la confiance avant la sélection d’un token

À chaque étape, le modèle attribue des logits aux tokens possibles. La température redimensionne ces logits avant la normalisation : les valeurs faibles accentuent les écarts et favorisent les candidats en tête, tandis que les valeurs élevées les aplanissent et accordent davantage de probabilité aux candidats plus faibles. Le décodage glouton évite l’échantillonnage et sélectionne toujours le maximum actuel.

Une explication technique distingue la température et les filtres de tokens : la température modifie les probabilités relatives dans la distribution, top-k conserve un nombre fixe de candidats et top-p conserve le plus petit ensemble atteignant une masse de probabilité donnée. Ces contrôles sont liés, mais ne sont pas interchangeables.

Une faible part d’aléatoire peut stabiliser le formatage et les formulations factuelles, mais elle peut aussi sélectionner à répétition la même continuation localement séduisante. Une forte part d’aléatoire peut sortir de cette ornière, mais aussi laisser passer des erreurs. La stabilité signifie donc une variance maîtrisée en fonction de la tâche, et non simplement la température la plus basse.

Les filtres dynamiques modifient l’ensemble des candidats lorsque la confiance évolue

Top-p utilise la probabilité cumulée : le nombre de candidats augmente lorsque le modèle est incertain et diminue lorsqu’un token domine. Min-p définit plutôt un seuil relatif au token le plus probable, en adaptant le seuil à la confiance sans viser une masse cumulative fixe.

Les recherches sur l’échantillonnage min-p font état d’une meilleure qualité créative et d’une plus grande diversité que top-p dans les configurations à température élevée testées. Le mécanisme compte localement, car les petits modèles ou les modèles quantifiés peuvent produire des distributions plus marquées ou plus bruitées que celles supposées par défaut par une interface hébergée.

Les filtres s’appliquent avant le tirage aléatoire, tandis que les pénalités modifient les scores en fonction des tokens précédents. Combiner une troncature agressive avec une forte pénalité de répétition peut ne laisser que des alternatives maladroites, donnant l’impression d’une sortie instable alors que chaque paramètre semblait prudent pris isolément.

Quand davantage d’aléatoire cesse d’améliorer le naturel

La diversité créative et la précision du raisonnement n’évoluent pas de concert. Une température élevée peut produire des histoires variées, mais nuire à l’arithmétique, au code, à la fidélité des citations et aux sorties structurées. À l’inverse, le décodage glouton peut convenir à une extraction contrainte tout en paraissant rigide dans une conversation.

Les recherches sur l’échantillonnage sélectif montrent que les choix à température élevée peuvent dégrader le raisonnement à certaines positions sensibles des tokens, ce qui motive un aléatoire sélectif plutôt qu’un aléatoire uniforme. Un seul paramètre global ne peut pas optimiser chaque partie de toutes les tâches. Cette distinction modifie la décision finale du foyer.

La limite d’échec apparaît lorsque la sortie enfreint la contrainte de la tâche : JSON invalide, affirmations non étayées, code défectueux ou boucles répétitives. L’échantillonnage ne peut pas corriger un prompt faible, un contexte incomplet, un modèle inadapté ou un historique de conversation corrompu ; il ne fait que modifier la sélection parmi les probabilités disponibles.

-15% OFF

Construire une grille de test d’échantillonnage reproductible

Choisissez trois prompts représentatifs : extraction déterministe, conversation ordinaire et génération ouverte. Gardez le fichier du modèle, la quantification, le prompt, le contexte et le nombre maximal de tokens constants. Exécutez chacun sur une petite grille de températures et avec une méthode de troncature, en utilisant à la fois une valeur de départ fixe et plusieurs valeurs de départ aléatoires.

Suivez les sorties invalides, la répétition exacte de phrases, le ratio de tokens uniques, la précision de la tâche et la latence. Cela permet d’isoler le décodage du problème de cohérence décrit dans la cohérence à long contexte, où un long contexte conversationnel peut réduire indépendamment la qualité des réponses. Cette limite reste visible lors de l’examen ultérieur des éléments probants.

Choisissez des préréglages distincts selon la charge de travail, plutôt qu’une valeur universelle. Rejetez un préréglage s’il améliore la variété tout en ne respectant plus les contraintes strictes de la tâche, puis relancez la grille après avoir modifié le modèle, la quantification, le modèle de prompt ou la pénalité de répétition.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.