Una finestra di contesto scorrevole limita la memoria dell’attenzione attiva escludendo lo stato dei token più vecchi quando la finestra conservata raggiunge il limite configurato.
L’attenzione causale completa conserva chiavi e valori dell’intera sequenza attiva, quindi la memoria KV cresce man mano che una conversazione, un documento o una risposta generata diventa più lunga. L’attenzione a finestra scorrevole modifica questo rapporto: ogni token presta attenzione direttamente solo a una regione recente delimitata, consentendo di sovrascrivere o omettere le voci della cache più vecchie quando l’implementazione supporta l’archiviazione circolare. Il modello può gestire un flusso lungo con un insieme di lavoro più prevedibile, ma la cronologia eliminata non è più disponibile attraverso lo stesso percorso di attenzione diretta.
L’attenzione completa continua ad ampliare la cronologia KV attiva
Con l’inferenza ordinaria a contesto completo, ogni token conservato contribuisce ai tensori di chiavi e valori in tutti i livelli di attenzione del modello. Una conversazione più lunga aumenta quindi la cache che deve rimanere accessibile.
Mistral 7B ha introdotto l’attenzione a finestra scorrevole come metodo per ridurre i costi di inferenza durante l’elaborazione di sequenze lunghe.
La memoria dei pesi non cambia con la lunghezza della conversazione, ma cambia la memoria di runtime disponibile per la cache KV, gli utenti e le operazioni temporanee.
Una finestra fissa può limitare la crescita della cache dopo il riscaldamento
Se ogni livello conserva solo la finestra di token più recente, le vecchie voci KV possono uscire dall’insieme di lavoro attivo quando arrivano nuovi token. La memoria tende quindi verso un limite massimo determinato dalla dimensione della finestra anziché dalla lunghezza totale del flusso.
Longformer formalizza l’attenzione locale a finestra, il cui calcolo cresce in base all’area circostante selezionata invece che a ogni coppia di token.
Un buffer KV circolare può riutilizzare gli slot fisici quando la finestra è piena, rendendo più stabile l’uso della memoria durante una chat locale prolungata o un flusso di trascrizione.
Questo vantaggio dipende dal fatto che il runtime elimini o sovrascriva effettivamente lo stato al di fuori della finestra. Un’architettura del modello che utilizza l’attenzione locale non garantisce che ogni motore di serving allochi la cache nello stesso modo.
I livelli sovrapposti possono trasportare informazioni oltre una singola finestra locale
A un determinato livello, un token legge un’area circostante recente dal livello precedente. I livelli più profondi ricevono rappresentazioni che contengono già informazioni combinate da aree circostanti precedenti.
L’architettura Mistral spiega questo campo recettivo sovrapposto: l’informazione può propagarsi più lontano di una singola finestra attraverso diversi livelli del trasformatore.
La propagazione indiretta non equivale a conservare l’accesso diretto e preciso a ogni vecchio token. Il modello riceve rappresentazioni trasformate, non una tabella di ricerca illimitata dell’intera cronologia.
L’eliminazione dello stato KV più vecchio modifica ciò che il modello può recuperare direttamente
Quando un token iniziale esce da ogni finestra di attenzione pertinente, i token successivi non possono più prestare attenzione alla sua chiave e al suo valore originali attraverso il normale percorso dell’attenzione locale.
StreamingLLM mostra che l’eliminazione dei token recenti può compromettere il comportamento del modello quando la sequenza supera la dimensione della cache.
Sink di attenzione, token globali, riepiloghi, recupero delle informazioni o livelli ibridi specifici dell’architettura possono preservare alcune informazioni a lungo raggio mantenendo limitata la maggior parte della memoria della cache.
Il risparmio di memoria ha quindi un limite semantico: i dettagli più vecchi potrebbero dover essere riepilogati, recuperati nuovamente o conservati intenzionalmente al di fuori della normale regione scorrevole.
La dimensione della finestra deve essere testata con il runtime e il flusso di lavoro effettivi
Stima il limite massimo della cache in base alla dimensione della finestra, al numero di teste KV, alla dimensione delle teste, al numero di livelli, alla precisione, alla dimensione del batch e agli utenti attivi. Verifica poi il comportamento osservato dell’allocatore invece di presumere che il limite teorico venga raggiunto pienamente.
L’analisi di Kimi K3 di ZimaSpace distingue lo stato fisso da quello che cresce con i token quando tratta la memoria dei contesti lunghi. Design di attenzione diversi possono imporre limiti differenti anche quando dichiarano una lunghezza massima del contesto simile.
Testa chat brevi, flussi più lunghi della finestra, informazioni collocate all’inizio, diversi utenti simultanei e un riavvio pulito. Registra la memoria di picco, la latenza del primo token, la velocità di generazione e verifica se le informazioni iniziali rimangono disponibili.
Una finestra più piccola è utile quando libera memoria sufficiente per migliorare affidabilità o concorrenza senza rimuovere informazioni che il flusso di lavoro locale deve conservare.
Domande frequenti
Una finestra scorrevole equivale a eliminare la conversazione?
No. L’applicazione può continuare a memorizzare la trascrizione completa, ma il modello potrebbe prestare attenzione direttamente solo alla finestra recente, a meno che il contenuto precedente non venga riepilogato o recuperato nuovamente.
L’attenzione a finestra scorrevole utilizza sempre una memoria costante?
Può limitare la cache dell’attenzione per una singola sequenza, ma la memoria totale include comunque i pesi, gli altri livelli, gli utenti attivi, i buffer temporanei e le riserve del runtime.
Un modello può ricordare informazioni più vecchie della sua finestra?
A volte attraverso rappresentazioni propagate, attenzione globale, riepiloghi, recupero delle informazioni o memoria dell’applicazione, ma l’accesso diretto allo stato originale dei token è limitato dall’architettura.
Hub Tecnologico e AI
Altro da leggere

Quali funzionalità consentono di creare un confine di fiducia per l’IA domestica attorno ai file sensibili?
Un confine di fiducia per l’IA domestica combina la crittografia dei dati inattivi, autorizzazioni con il principio del privilegio minimo, sandboxing in fase di...

Cosa fa sì che i risultati di ricerca privati favoriscano i file modificati frequentemente?
I file modificati frequentemente ottengono vantaggi nel ranking quando ogni aggiornamento aggiunge segnali di freschezza, segmenti, versioni o interazioni senza normalizzarli in base alla...

Cosa porta i modelli di rilevamento della presenza nelle smart home a confondere gli ospiti con i residenti?
Gli ospiti possono sembrare residenti quando il sistema osserva i modelli di attività domestica, ma non dispone di un segnale d’identità stabile per la...

