Une fenêtre de contexte glissante plafonne la mémoire d’attention active en excluant l’état des anciens tokens une fois que la fenêtre conservée atteint sa limite configurée.
L’attention causale complète conserve les clés et les valeurs de toute la séquence active, de sorte que la mémoire KV augmente à mesure qu’une conversation, un document ou une réponse générée s’allonge. L’attention à fenêtre glissante modifie cette relation : chaque token ne porte directement son attention que sur une région récente et limitée, ce qui permet d’écraser ou d’omettre les anciennes entrées du cache lorsque l’implémentation prend en charge un stockage circulaire. Le modèle peut traiter un flux long avec un ensemble de travail plus prévisible, mais l’historique supprimé n’est plus disponible par le même chemin d’attention directe.
L’attention complète continue d’étendre l’historique KV actif
Avec une inférence classique à contexte complet, chaque token conservé contribue aux tenseurs de clés et de valeurs de toutes les couches d’attention du modèle. Une conversation plus longue augmente donc le cache qui doit rester adressable.
Mistral 7B a introduit l’attention à fenêtre glissante afin de réduire le coût d’inférence lors du traitement de séquences longues.
La mémoire occupée par les poids ne change pas avec la longueur de la conversation, mais la mémoire d’exécution disponible pour le cache KV, les utilisateurs et les tâches temporaires, elle, évolue.
Une fenêtre fixe peut plafonner la croissance du cache après la phase de montée en régime
Si chaque couche ne conserve que la fenêtre de tokens la plus récente, les anciennes entrées KV peuvent quitter l’ensemble de travail actif à mesure que de nouveaux tokens arrivent. La mémoire tend alors vers un plafond déterminé par la taille de la fenêtre plutôt que par la longueur totale du flux.
Longformer formalise l’attention à fenêtre locale, dont le calcul évolue en fonction du voisinage sélectionné plutôt que de chaque paire de tokens.
Un tampon KV circulaire peut réutiliser les emplacements physiques une fois la fenêtre pleine, ce qui stabilise davantage l’utilisation de la mémoire pendant une conversation locale ou un flux de transcription prolongé.
Ce bénéfice dépend du fait que l’environnement d’exécution supprime ou écrase réellement l’état situé hors de la fenêtre. Une architecture de modèle utilisant l’attention locale ne garantit pas que chaque moteur de service alloue le cache de la même manière.
Les couches empilées peuvent transporter des informations au-delà d’une seule fenêtre locale
À une couche donnée, un token lit un voisinage récent de la couche précédente. Les couches plus profondes reçoivent des représentations qui contiennent déjà des informations mélangées provenant de voisinages antérieurs.
L’architecture Mistral explique ce champ réceptif empilé : l’information peut se propager plus loin qu’une seule fenêtre à travers plusieurs couches Transformer.
La propagation indirecte n’équivaut pas à conserver un accès direct exact à chaque ancien token. Le modèle reçoit des représentations transformées plutôt qu’une table de recherche illimitée contenant tout l’historique.
La suppression de l’ancien état KV modifie ce que le modèle peut récupérer directement
Lorsqu’un token ancien quitte toutes les fenêtres d’attention pertinentes, les tokens suivants ne peuvent plus accéder à sa clé et à sa valeur d’origine par le chemin normal de l’attention locale.
StreamingLLM montre que l’éviction des tokens récents peut dégrader le comportement du modèle une fois que la séquence dépasse la taille du cache.
Les tokens puits d’attention, les tokens globaux, les résumés, la récupération d’informations ou des couches hybrides propres à l’architecture peuvent préserver certaines informations à longue portée tout en maintenant la majeure partie de la mémoire du cache dans des limites définies.
L’économie de mémoire possède donc une limite sémantique : les anciens détails devront peut-être être résumés, récupérés de nouveau ou conservés intentionnellement en dehors de la région glissante habituelle.
La taille de la fenêtre doit être testée avec l’environnement d’exécution et le flux de travail réels
Estimez le plafond du cache à partir de la taille de la fenêtre, du nombre de têtes KV, de la dimension des têtes, du nombre de couches, de la précision, de la taille du lot et du nombre d’utilisateurs actifs. Vérifiez ensuite le comportement réel de l’allocateur au lieu de supposer que la limite théorique est pleinement atteinte.
L’analyse de Kimi K3 par ZimaSpace distingue l’état fixe de l’état qui augmente avec le nombre de tokens lorsqu’elle traite de la mémoire des contextes longs. Des conceptions d’attention différentes peuvent imposer des limites différentes, même lorsqu’elles annoncent une longueur maximale de contexte similaire.
Testez les conversations courtes, les flux dépassant la taille de la fenêtre, les faits placés au début, plusieurs utilisateurs simultanés et un redémarrage complet. Relevez la mémoire maximale, la latence avant le premier token, la vitesse de génération et la persistance des informations initiales.
Une fenêtre plus petite est utile lorsqu’elle libère suffisamment de mémoire pour améliorer la fiabilité ou la concurrence sans supprimer les informations que le flux de travail local doit préserver.
FAQ
Une fenêtre glissante revient-elle à supprimer la conversation ?
Non. L’application peut toujours stocker la transcription complète, mais le modèle peut ne porter directement son attention que sur la fenêtre récente, sauf si le contenu ancien est à nouveau résumé ou récupéré.
L’attention à fenêtre glissante utilise-t-elle toujours une mémoire constante ?
Elle peut plafonner le cache d’attention pour une séquence, mais la mémoire totale comprend toujours les poids, les autres couches, les utilisateurs actifs, les tampons temporaires et les réservations de l’environnement d’exécution.
Un modèle peut-il se souvenir de faits antérieurs à sa fenêtre ?
Parfois, grâce aux représentations propagées, à l’attention globale, aux résumés, à la récupération d’informations ou à la mémoire de l’application, mais l’accès direct à l’état des tokens d’origine reste limité par l’architecture.
Centre Tech & IA
Plus à lire

Quelles fonctionnalités permettent de créer une frontière de confiance pour l’IA domestique autour des fichiers sensibles ?
Une frontière de confiance pour l’IA à domicile combine le chiffrement des données au repos, des autorisations selon le principe du moindre privilège, un...

Pourquoi les résultats de recherche privés privilégient-ils les fichiers fréquemment modifiés ?
Les fichiers fréquemment modifiés bénéficient d’un meilleur classement lorsque chaque mise à jour ajoute des signaux de fraîcheur, des segments, des versions ou des...

Qu’est-ce qui pousse les modèles de détection de présence pour maison intelligente à confondre les invités avec les résidents ?
Les invités peuvent être pris pour des résidents lorsque le système observe des habitudes d’activité du foyer, mais ne dispose d’aucun signal d’identité stable...

