Muestreo de LLM locales: por qué los ajustes de decodificación cambian la repetición y la estabilidad

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

La configuración de decodificación cambia el comportamiento de los LLM locales al redefinir qué tokens siguientes siguen siendo elegibles y cuánto influyen las diferencias de probabilidad en cada selección.

Un modelo doméstico puede responder de forma constante a una pregunta factual y, sin embargo, volverse repetitivo durante una sesión de voz larga o inestable al escribir de forma creativa. Los pesos no cambian; el decodificador elige de manera diferente en cada paso a partir de su distribución de probabilidad. La temperatura, la truncación, las penalizaciones por repetición, la semilla y el contexto determinan conjuntamente si la salida cae en bucles conocidos o se desvía hacia continuaciones de baja probabilidad.

La temperatura reajusta la confianza antes de elegir un token

En cada paso, el modelo asigna logits a los tokens posibles. La temperatura reajusta esos logits antes de la normalización: los valores más bajos acentúan las diferencias y favorecen a los candidatos principales, mientras que los más altos las suavizan y otorgan más probabilidad a los candidatos débiles. La decodificación codiciosa omite el muestreo y siempre elige el máximo actual.

Una explicación técnica distingue entre la temperatura y los filtros de tokens: la temperatura cambia las probabilidades relativas de toda la distribución, top-k conserva un número fijo de candidatos y top-p conserva el conjunto más pequeño que alcanza una determinada masa de probabilidad. Estos controles están relacionados, pero no son intercambiables.

Una aleatoriedad baja puede estabilizar el formato y la redacción factual, pero también puede elegir repetidamente la misma continuación atractiva a nivel local. Una aleatoriedad alta puede escapar de ese patrón, pero también admitir errores. Por tanto, la estabilidad implica una variación controlada para la tarea, no simplemente la temperatura más baja.

Los filtros dinámicos cambian el conjunto de candidatos a medida que cambia la confianza

Top-p utiliza la probabilidad acumulada, por lo que el número de candidatos aumenta cuando el modelo no está seguro y disminuye cuando domina un token. Min-p establece, en cambio, un umbral relativo al token más probable y adapta el corte a la confianza sin dirigirse a una masa acumulada fija.

La investigación sobre el muestreo min-p informa de una mejor calidad creativa y diversidad que top-p en los ajustes de alta temperatura evaluados. El mecanismo importa a nivel local porque los modelos pequeños o cuantizados pueden tener distribuciones más pronunciadas o ruidosas que las que dan por supuestas las interfaces alojadas.

Los filtros actúan antes de la selección aleatoria, mientras que las penalizaciones modifican las puntuaciones según los tokens anteriores. Combinar una truncación agresiva con una penalización fuerte por repetición puede dejar alternativas poco naturales, haciendo que la salida parezca inestable aunque cada ajuste pareciera conservador por separado.

Cuándo una mayor aleatoriedad deja de mejorar la naturalidad

La diversidad creativa y la precisión del razonamiento no evolucionan al mismo ritmo. Una temperatura alta puede producir historias variadas, pero perjudicar la aritmética, el código, la fidelidad de las citas y la salida estructurada. Por el contrario, la decodificación codiciosa puede ser adecuada para una extracción limitada, aunque suene rígida en una conversación.

La investigación sobre el muestreo selectivo concluye que las elecciones con temperatura alta pueden degradar el razonamiento en posiciones de tokens sensibles, lo que motiva una aleatoriedad selectiva en lugar de uniforme. Un único ajuste global no puede optimizar todas las partes de cada tarea. Esa distinción cambia la decisión doméstica resultante.

El límite del fallo aparece cuando la salida infringe la restricción de la tarea: JSON no válido, afirmaciones sin respaldo, código defectuoso o bucles repetidos. El muestreo no puede reparar un prompt débil, la falta de contexto, un modelo inadecuado ni un historial de conversación dañado; solo cambia la selección entre las probabilidades disponibles.

-15% OFF

Construye una cuadrícula de pruebas de muestreo reproducible

Elige tres prompts representativos: extracción determinista, conversación habitual y generación abierta. Mantén fijos el archivo del modelo, la cuantización, el prompt, el contexto y el número máximo de tokens. Ejecuta cada uno en una cuadrícula pequeña de temperaturas y un método de truncación, utilizando tanto una semilla fija como varias semillas aleatorias.

Registra las salidas no válidas, la repetición exacta de frases, la proporción de tokens únicos, la precisión de la tarea y la latencia. Esto aísla la decodificación del problema de coherencia descrito en la coherencia con contextos largos, donde un contexto conversacional extenso puede reducir la calidad de las respuestas de forma independiente. Este límite sigue siendo visible durante la revisión posterior de las evidencias.

Selecciona ajustes preestablecidos separados según la carga de trabajo, en lugar de un único valor universal. Descarta un ajuste preestablecido si mejora la variedad, pero incumple las restricciones estrictas de la tarea, y repite la cuadrícula después de cambiar el modelo, la cuantización, la plantilla del prompt o la penalización por repetición.

Centro de Tecnología e IA

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.