¿Por qué los modelos locales cuantizados pierden precisión al seguir instrucciones en prompts estructurados largos?

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

Los modelos locales cuantizados pueden perder precisión al seguir instrucciones cuando los prompts estructurados largos amplifican pequeños errores numéricos a través de muchas restricciones y decisiones de tokens que interactúan entre sí.

Una solicitud breve puede pedir un dato o formato, mientras que un prompt estructurado largo puede combinar reglas de rol, esquemas anidados, requisitos de orden, exclusiones, ejemplos, evidencia recuperada y comprobaciones de salida en varios pasos. La cuantización reduce la memoria del modelo aproximando los pesos, las activaciones o el estado de ejecución, pero esa aproximación no afecta a todos los comportamientos por igual. El modelo puede seguir siendo fluido y, aun así, omitir un campo, incumplir una instrucción tardía, confundir la jerarquía o desviarse de un contrato de respuesta exacto. Las secciones siguientes relacionan la representación de pocos bits con estos fallos visibles al seguir instrucciones.

La cuantización modifica los valores internos sin cambiar el prompt

La cuantización posterior al entrenamiento asigna valores de mayor precisión a un número menor de niveles representables. Los tokens del prompt permanecen idénticos, pero las activaciones ocultas y los cálculos de probabilidad utilizados para interpretarlos se modifican ligeramente.

Una evaluación amplia entre distintas familias de modelos descubrió que los efectos de la cuantización varían según las familias de modelos, los objetivos numéricos y las categorías de tareas, en lugar de producir una única pérdida de precisión universal.

La prosa abierta puede tolerar pequeños cambios en la probabilidad de los tokens porque varias continuaciones siguen siendo aceptables. Las instrucciones estructuradas son menos indulgentes cuando solo un nombre de campo, delimitador, orden o condición de rechazo satisface el contrato.

El seguimiento de instrucciones puede degradarse antes que la fluidez general

Un modelo cuantizado aún puede escribir párrafos coherentes y responder preguntas conocidas, mientras se vuelve menos consistente al satisfacer restricciones explícitas.

Trabajos recientes estudian específicamente la pérdida de seguimiento de instrucciones después de la cuantización y la consideran un comportamiento que puede requerir una recuperación específica, en lugar de una optimización ordinaria de la perplejidad.

Esto crea un resultado engañoso en las pruebas locales: la respuesta parece competente, pero falta una clave obligatoria, aparece una sección prohibida o el modelo sigue un ejemplo con más fuerza que la regla real.

Por tanto, la validación debe puntuar por separado el cumplimiento del contrato, la legibilidad y la corrección temática.

Los prompts largos hacen más importantes la posición y la competencia entre restricciones

Los prompts estructurados suelen distribuir las instrucciones al principio, en el centro y al final del contexto. Los documentos recuperados y los ejemplos pueden insertar miles de tokens competidores entre la regla y la salida.

Las investigaciones sobre contextos largos muestran un uso sensible a la posición de la información incluso antes de introducir la cuantización.

La cuantización puede reducir el margen que separa la interpretación correcta de una alternativa cercana. Una regla ya débilmente representada debido a su posición o al contexto competidor se vuelve más fácil de pasar por alto.

Repetir todas las instrucciones no es una solución limpia. Aumenta la longitud del prompt y puede crear conflictos adicionales si la jerarquía no está explícita.

-15% OFF

Los datos de calibración quizá no representen el comportamiento ante prompts estructurados

Muchos métodos posteriores al entrenamiento eligen las escalas o el comportamiento de recorte a partir de una muestra de calibración. Una muestra dominada por prosa ordinaria puede no conservar los mismos patrones de activación que los esquemas JSON, los bloques de código, las tablas o las instrucciones largas divididas en varias partes.

Las herramientas de cuantización distinguen los métodos que requieren datos de calibración de los enfoques dinámicos o conscientes del entrenamiento.

Un conjunto de calibración puede conservar el comportamiento lingüístico promedio y, al mismo tiempo, representar insuficientemente el flujo de trabajo exacto que importa en el servidor doméstico.

Utiliza muestras que contengan las plantillas de prompts, los idiomas, los separadores, los esquemas y los estilos de documentos reales que el modelo desplegado debe seguir.

La precisión de la caché KV puede afectar a las partes posteriores de una respuesta larga

Algunos entornos de ejecución cuantizan no solo los pesos del modelo, sino también la caché de valores clave que almacena el estado de atención del contexto activo.

Google Research describe la cuantización de la caché KV como una forma de reducir el coste de memoria del contexto de largo alcance y conservar el rendimiento de generación.

La caché representa los tokens anteriores del prompt y de la salida. La aproximación puede afectar a la forma en que la decodificación posterior presta atención a requisitos anidados o a estructuras emitidas previamente.

Por tanto, las configuraciones que cuantizan solo los pesos y las que cuantizan los pesos y la caché deben evaluarse por separado, en lugar de agruparse bajo una única etiqueta genérica de cantidad de bits.

La fiabilidad estructurada requiere pruebas del flujo de trabajo completo

Prueba exactamente el archivo cuantizado, el entorno de ejecución, la longitud de contexto, el formato de caché, los ajustes de muestreo y el analizador de salida utilizados en producción. Un benchmark del modelo base no puede certificar una conversión local diferente.

NVIDIA recomienda evaluar las compensaciones específicas del modelo, porque la memoria, el rendimiento y la calidad cambian según la técnica de inferencia y la ruta de hardware seleccionadas.

Los límites del despliegue local de ZimaSpace también distinguen entre que un modelo se cargue y que siga siendo fiable con el contexto y la concurrencia previstos.

Crea pruebas estructuradas adversariales con objetos anidados, campos opcionales, restricciones tardías, texto repetitivo, ejemplos contradictorios y casos de rechazo. La cuantización adecuada es el formato más pequeño que aún supera el umbral de precisión al seguir instrucciones exigido por el flujo de trabajo.

Preguntas frecuentes

¿Una perplejidad menor garantiza un mejor seguimiento de instrucciones?

No. La perplejidad mide el ajuste predictivo sobre secuencias de tokens, mientras que la precisión al seguir instrucciones puede depender de restricciones exactas, la validez del esquema y el comportamiento de rechazo.

¿Un modelo cuantizado más grande seguirá siempre mejor las instrucciones que un modelo más pequeño de precisión completa?

No. La capacidad del modelo, la alineación, el método de cuantización, la longitud del prompt, el entorno de ejecución y el contrato de la tarea influyen en el resultado.

¿La reescritura del prompt puede solucionar todos los fallos de cuantización?

No. Una jerarquía clara y prompts más cortos pueden ayudar, pero los fallos persistentes pueden requerir un formato de mayor precisión, otro cuantizador u otro modelo.

Centro de Tecnología e IA

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.