Le taux d’acceptation du décodage spéculatif mesure la fréquence à laquelle la vérification par le modèle cible conserve les jetons proposés par le modèle brouillon, influençant directement le travail utile réalisé à chaque passe de vérification.
Un modèle brouillon plus petit peut proposer plusieurs jetons à venir, tandis qu’un modèle local plus grand les vérifie en parallèle. Si la plupart des propositions sont conservées, une seule passe coûteuse du modèle cible fait progresser la réponse de plusieurs positions ; si un rejet survient rapidement, une grande partie du travail du modèle brouillon est abandonnée. Le taux constitue donc un indicateur d’efficacité dépendant de la charge de travail, et non un score de précision autonome ni une garantie d’accélération de bout en bout.
L’acceptation mesure la progression vérifiée du modèle brouillon
Dans l’échantillonnage spéculatif standard, la distribution du modèle brouillon propose un bloc et le modèle cible évalue ces positions ensemble. Les jetons sont acceptés dans l’ordre jusqu’au premier rejet, après quoi l’algorithme échantillonne une correction et démarre un nouveau tour spéculatif.
L’article original sur le décodage spéculatif définit une probabilité d’acceptation à partir de la relation entre les distributions du modèle brouillon et du modèle cible, tout en préservant la distribution de sortie du modèle cible. La progression acceptée, et non la similarité visuelle entre les réponses des modèles, est la grandeur déterminante.
Les implémentations peuvent indiquer le nombre de jetons acceptés divisé par le nombre de jetons proposés, la longueur moyenne acceptée ou la probabilité d’acceptation. Ces métriques sont liées, mais pas identiques ; les comparaisons nécessitent donc la même définition et la même longueur de proposition. Cette distinction reste visible lors des tests domestiques ultérieurs.
La qualité du modèle brouillon et la stratégie d’échantillonnage font varier le taux
Un modèle brouillon plus proche du modèle cible pour le langage, le domaine et l’invite utilisés a tendance à proposer davantage de continuations acceptables. La température, top-p, l’alignement des tokeniseurs, la longueur des propositions et la confiance du modèle cible modifient également la fréquence à laquelle un bloc est conservé.
Online Speculative Decoding adapte le modèle brouillon à partir des retours du modèle cible et indique qu’une amélioration du taux d’acceptation des jetons peut réduire la latence pour des distributions de requêtes variables. Le résultat montre que l’acceptation peut évoluer selon la charge de travail, plutôt que rester une propriété fixe d’une paire de modèles.
Un modèle brouillon plus grand peut augmenter l’acceptation, mais coûte davantage à exécuter ; un modèle brouillon plus petit est économique, mais peut être souvent rejeté. Le choix pertinent équilibre la progression acceptée avec le temps de proposition et de vérification. Le résultat intermédiaire doit rester inspectable avant que l’automatisation ne poursuive.
Un taux d’acceptation élevé est nécessaire, mais ne suffit pas à garantir une accélération
Le gain de bout en bout dépend également de la capacité du modèle cible à vérifier efficacement un bloc, de la latence du modèle brouillon, du trafic mémoire, de la synchronisation, de la taille des lots et du coût du travail rejeté. Une forte proportion sur des blocs courts peut économiser moins d’étapes séquentielles qu’une proportion moyenne sur des blocs de taille adaptée.
Medusa remplace un modèle brouillon distinct par plusieurs têtes de décodage qui proposent plusieurs continuations à partir de la représentation du modèle cible. Sa conception montre que l’architecture des propositions et la vérification déterminent le même compromis de débit. Cette limite doit être mesurée séparément dans des conditions d’utilisation réalistes.
La limite d’intérêt apparaît lorsque la proposition et la vérification coûtent autant que le décodage ordinaire. Le code, les textes multilingues, l’échantillonnage créatif ou les changements de domaine peuvent réduire suffisamment la longueur acceptée pour que la spéculation consomme de la mémoire supplémentaire sans réduire la latence.
Mesurer la progression acceptée par milliseconde
Pour chaque catégorie d’invite, consignez les jetons proposés, les jetons acceptés, la longueur du préfixe accepté, le temps de proposition, le temps de vérification par le modèle cible, la position du rejet, la latence totale, le nombre de jetons par seconde, la mémoire et les contrôles d’équivalence de sortie. La conséquence pratique apparaît lorsque plusieurs sources se disputent un contexte limité.
Reliez la charge de travail à la stratégie d’échantillonnage. Faites varier la longueur des propositions et les paramètres d’échantillonnage tout en conservant le même modèle cible et la même distribution demandée, puis comparez les résultats au décodage autorégressif ordinaire. Cette dépendance doit rester explicite dans l’interface finale.
N’activez la spéculation que lorsque la progression acceptée par milliseconde totale s’améliore. Si l’acceptation semble élevée, mais que la latence ne diminue pas, optimisez les surcoûts liés aux propositions et à la vérification au lieu de considérer le ratio comme la métrique de performance finale. Le résultat doit donc être vérifié par rapport aux éléments probants d’origine.
Centre Tech & IA
Plus à lire

Qu’est-ce que la dérive des représentations vectorielles, et quand faut-il reconstruire un index de recherche privé ?
Décoder la dérive du modèle, du prétraitement, du corpus et des requêtes ; distinguer la surveillance de l’incompatibilité ; et déterminer quand un index...

Qu’est-ce que la compatibilité des tokeniseurs et pourquoi peut-elle perturber le changement de modèle ?
Décodez l’identité du vocabulaire, la sémantique des tokens spéciaux, les modèles de chat, les tokens mis en cache, les adaptateurs et les vérifications de...

Qu’est-ce que la résidence d’un modèle et quand un service d’IA local doit-il conserver les poids chargés ?
Comprendre la persistance des poids, les niveaux de cache, les démarrages à froid, l’éviction, le multiplexage, la pression mémoire et les situations où un...

