Il tasso di accettazione del decoding speculativo misura la frequenza con cui la verifica del modello target mantiene i token proposti, determinando direttamente il lavoro utile ottenuto per ogni passaggio di verifica.
Un modello draft più piccolo può proporre diversi token futuri mentre un modello locale più grande li verifica in parallelo. Se la maggior parte delle proposte supera la verifica, un singolo costoso passaggio del modello target fa avanzare la risposta di più posizioni; se il rifiuto avviene presto, gran parte del lavoro del draft viene scartata. Il tasso è quindi un indicatore di efficienza dipendente dal carico di lavoro, non un punteggio di accuratezza autonomo né una garanzia di accelerazione end-to-end.
L'accettazione misura l'avanzamento verificato del draft
Nel campionamento speculativo standard, il draft propone un blocco e il target valuta insieme quelle posizioni. I token vengono accettati in ordine fino al primo rifiuto; dopodiché l'algoritmo campiona una correzione e avvia un altro ciclo speculativo.
Il paper originale sul decoding speculativo definisce una probabilità di accettazione in base alla relazione tra le distribuzioni del draft e del target, preservando al contempo la distribuzione di output del modello target. L'avanzamento accettato, non la somiglianza visiva tra le risposte dei modelli, è la quantità operativa.
Le implementazioni possono riportare i token accettati divisi per i token proposti, la lunghezza media accettata o la probabilità di accettazione. Queste metriche sono correlate ma non identiche, quindi i confronti richiedono la stessa definizione e la stessa lunghezza del draft. Questa distinzione resta visibile anche durante i successivi test domestici.
La qualità del draft e la politica di campionamento modificano il tasso
Un draft più vicino al target rispetto alla lingua, al dominio e al prompt correnti tende a proporre più continuazioni accettabili. Anche la temperatura, top-p, l'allineamento dei tokenizer, la lunghezza del draft e la fiducia del target modificano la frequenza con cui un blocco supera la verifica.
Lo Speculative Decoding online adatta il draft in base al feedback del target e riporta che migliorare il tasso di accettazione dei token può ridurre la latenza al variare della distribuzione delle richieste. Il risultato dimostra che l'accettazione può variare con il carico di lavoro, invece di rimanere una proprietà fissa della coppia di modelli.
Un draft più grande può aumentare l'accettazione, ma richiede più tempo di esecuzione; un draft più piccolo è economico, ma può essere rifiutato spesso. La scelta utile bilancia l'avanzamento accettato con il tempo di generazione del draft e di verifica. Il risultato intermedio deve rimanere ispezionabile prima che l'automazione proceda.
Un'accettazione elevata è necessaria ma non sufficiente per ottenere un'accelerazione
Il vantaggio end-to-end dipende anche dalla capacità del target di verificare efficientemente un blocco, dalla latenza del draft, dal traffico di memoria, dalla sincronizzazione, dalla dimensione del batch e dal costo del lavoro rifiutato. Un'elevata percentuale su blocchi brevi può risparmiare meno passaggi seriali rispetto a una percentuale moderata su blocchi di dimensioni adeguate.
Medusa sostituisce un modello draft separato con più teste di decoding che propongono più continuazioni a partire dalla rappresentazione del target. Il suo design dimostra che l'architettura delle proposte e la verifica determinano lo stesso compromesso in termini di throughput. Questo limite deve essere misurato separatamente in condizioni operative realistiche.
Il limite di convenienza si presenta in un carico di lavoro in cui il costo combinato della generazione del draft e della verifica equivale a quello del decoding ordinario. Codice, testo multilingue, campionamento creativo o cambiamenti di dominio possono ridurre la lunghezza accettata al punto che la speculazione consuma memoria aggiuntiva senza ridurre la latenza.
Misurare l'avanzamento accettato per millisecondo
Per ogni categoria di prompt, registra i token proposti, i token accettati, la lunghezza del prefisso accettato, il tempo del draft, il tempo di verifica del target, la posizione del rifiuto, la latenza totale, i token al secondo, la memoria e i controlli di equivalenza dell'output. La conseguenza pratica emerge quando più fonti competono per un contesto limitato.
Collega il carico di lavoro alla politica di campionamento. Varia la lunghezza del draft e le impostazioni di campionamento mantenendo fissi il modello target e la distribuzione richiesta, quindi confronta i risultati con il decoding autoregressivo ordinario. Questa dipendenza deve rimanere esplicita nell'interfaccia finale.
Abilita la speculazione solo quando l'avanzamento accettato per millisecondo totale migliora. Se l'accettazione appare elevata ma la latenza non diminuisce, ottimizza l'overhead delle proposte e della verifica invece di considerare il rapporto la metrica finale delle prestazioni. Il risultato deve quindi essere verificato rispetto alle evidenze originali.
Hub Tecnologico e AI
Altro da leggere

Che cos’è la deriva degli embedding e quando è necessario ricostruire un indice di ricerca privato?
Decodifica il modello, il preprocessing, il corpus e il drift delle query; distingui il monitoraggio dall'incompatibilità e decidi quando è necessario ricostruire un indice...

Che cos'è la compatibilità dei tokenizzatori e perché può compromettere il passaggio da un modello all'altro?
Decodifica l'identità del vocabolario, la semantica dei token speciali, i modelli di chat, i token memorizzati nella cache, gli adattatori e i controlli di...

Che cos'è la permanenza del modello e quando un servizio di IA locale dovrebbe mantenere i pesi caricati?
Comprendi la permanenza dei pesi, i livelli della cache, gli avvii a freddo, l'espulsione, il multiplexing, la pressione sulla memoria e quando un servizio...

