La tasa de aceptación de la decodificación especulativa mide con qué frecuencia la verificación del modelo objetivo conserva los tokens propuestos por el modelo borrador, lo que determina directamente el trabajo útil obtenido en cada pasada de verificación.
Un modelo borrador más pequeño puede proponer varios tokens futuros mientras un modelo local más grande los verifica en paralelo. Si la mayoría de las propuestas sobrevive, una sola pasada costosa del modelo objetivo hace avanzar la respuesta varias posiciones; si el rechazo ocurre pronto, gran parte del trabajo del modelo borrador se descarta. Por tanto, la tasa es una señal de eficiencia dependiente de la carga de trabajo, no una puntuación de precisión independiente ni una garantía de aceleración de extremo a extremo.
La aceptación mide el progreso verificado del modelo borrador
En el muestreo especulativo estándar, la distribución del modelo borrador propone un bloque y el modelo objetivo evalúa esas posiciones conjuntamente. Los tokens se aceptan en orden hasta el primer rechazo; después, el algoritmo muestrea una corrección e inicia otra ronda especulativa.
El artículo original sobre decodificación especulativa define una probabilidad de aceptación a partir de la relación entre las distribuciones del modelo borrador y del modelo objetivo, preservando al mismo tiempo la distribución de salida del modelo objetivo. El progreso aceptado, no la similitud visual entre las respuestas de los modelos, es la magnitud operativa.
Las implementaciones pueden informar de los tokens aceptados divididos entre los tokens propuestos, de la longitud media aceptada o de la probabilidad de aceptación. Estas métricas están relacionadas, pero no son idénticas, por lo que las comparaciones necesitan la misma definición y longitud del modelo borrador. Esta distinción sigue siendo visible durante las pruebas posteriores en el hogar.
La calidad del modelo borrador y la política de muestreo modifican la tasa
Un modelo borrador más cercano al modelo objetivo en el idioma, dominio y prompt actuales tiende a proponer más continuaciones aceptables. La temperatura, top-p, la alineación del tokenizador, la longitud del modelo borrador y la confianza del modelo objetivo también cambian la frecuencia con la que sobrevive un bloque.
Online Speculative Decoding adapta el modelo borrador a partir de la retroalimentación del modelo objetivo e informa de que mejorar la tasa de aceptación de tokens puede reducir la latencia en distribuciones de solicitudes cambiantes. El resultado demuestra que la aceptación puede variar con la carga de trabajo, en lugar de ser una propiedad fija de un par de modelos.
Un modelo borrador más grande puede aumentar la aceptación, pero cuesta más ejecutarlo; uno más pequeño es barato, pero puede sufrir rechazos frecuentes. La elección útil equilibra el progreso aceptado con el tiempo de generación de propuestas y de verificación. El resultado intermedio debe seguir siendo inspeccionable antes de que la automatización continúe.
Una aceptación alta es necesaria, pero no suficiente para lograr aceleración
La mejora de extremo a extremo también depende de la capacidad del modelo objetivo para verificar un bloque de forma eficiente, de la latencia del modelo borrador, del tráfico de memoria, de la sincronización, del tamaño del lote y del coste del trabajo rechazado. Una proporción alta en bloques cortos puede ahorrar menos pasos secuenciales que una proporción moderada en bloques de tamaño adecuado.
Medusa sustituye un modelo borrador independiente por múltiples cabezas de decodificación que proponen varias continuaciones a partir de la representación del modelo objetivo. Su diseño muestra que la arquitectura de propuestas y la verificación determinan el mismo equilibrio de rendimiento. Ese límite debe medirse por separado en condiciones operativas realistas.
El límite de fallo aparece con una carga de trabajo en la que el coste de generar propuestas más verificar equivale al de la decodificación ordinaria. El código, el texto multilingüe, el muestreo creativo o los cambios de dominio pueden reducir la longitud aceptada lo suficiente como para que la especulación consuma memoria adicional sin reducir la latencia.
Mide el progreso aceptado por milisegundo
Para cada clase de prompt, registra los tokens propuestos, los tokens aceptados, la longitud del prefijo aceptado, el tiempo de generación de propuestas, el tiempo de verificación del modelo objetivo, la posición del rechazo, la latencia total, los tokens por segundo, la memoria y las comprobaciones de equivalencia de salida. La consecuencia práctica aparece cuando varias fuentes compiten por un contexto limitado.
Relaciona la carga de trabajo con la política de muestreo. Varía la longitud del modelo borrador y la configuración de muestreo mientras mantienes fijos el modelo objetivo y la distribución solicitada; después, compara los resultados con la decodificación autorregresiva ordinaria. Esta dependencia debe seguir siendo explícita en la interfaz final.
Activa la especulación solo cuando el progreso aceptado por milisegundo total mejore. Si la aceptación parece alta, pero la latencia no disminuye, optimiza la sobrecarga de generación de propuestas y verificación en lugar de tratar la proporción como la métrica de rendimiento definitiva. Por tanto, el resultado debe comprobarse con respecto a la evidencia original.
Centro de Tecnología e IA
Más para leer

¿Qué es la deriva de las incrustaciones y cuándo es necesario reconstruir un índice de búsqueda privado?
Decodifica el desplazamiento del modelo, el preprocesamiento, el corpus y las consultas; distingue entre la monitorización y la incompatibilidad; y decide cuándo es necesario...

¿Qué es la compatibilidad del tokenizador y por qué puede hacer que el cambio de modelo falle?
Descifra la identidad del vocabulario, la semántica de los tokens especiales, las plantillas de chat, los tokens en caché, los adaptadores y las comprobaciones...

¿Qué es la permanencia del modelo y cuándo debe un servicio de IA local mantener las ponderaciones cargadas?
Descubre la permanencia de los pesos, los niveles de caché, los arranques en frío, la expulsión, la multiplexación, la presión de memoria y cuándo...

