Ein gleitendes Kontextfenster begrenzt den aktiven Aufmerksamkeits-Speicher, indem ältere Token-Zustände ausgeschlossen werden, sobald das beibehaltene Fenster seine konfigurierte Grenze erreicht.
Die vollständige kausale Aufmerksamkeit behält Schlüssel und Werte für die gesamte aktive Sequenz bei. Dadurch wächst der KV-Speicher, wenn eine Unterhaltung, ein Dokument oder eine generierte Antwort länger wird. Die Aufmerksamkeit mit gleitendem Fenster verändert dieses Verhältnis: Jedes Token richtet seine direkte Aufmerksamkeit nur auf einen begrenzten aktuellen Bereich. Dadurch können ältere Cache-Einträge überschrieben oder weggelassen werden, sofern die Implementierung einen rollierenden Speicher unterstützt. Das Modell kann einen langen Datenstrom mit einem besser vorhersehbaren Arbeitssatz verarbeiten, aber verworfene Historie ist über denselben direkten Aufmerksamkeitsweg nicht mehr verfügbar.
Die vollständige Aufmerksamkeit erweitert den aktiven KV-Verlauf kontinuierlich
Bei gewöhnlicher Inferenz mit vollständigem Kontext trägt jedes beibehaltene Token Schlüssel- und Werttensoren über alle Aufmerksamkeitslayer des Modells hinweg bei. Eine längere Unterhaltung vergrößert daher den Cache, der adressierbar bleiben muss.
Mistral 7B führte die Aufmerksamkeit mit gleitendem Fenster ein, um die Inferenzkosten bei der Verarbeitung langer Sequenzen zu senken.
Der Gewichtsspeicher ändert sich mit der Unterhaltungslänge nicht, wohl aber der zur Laufzeit verfügbare Speicher für den KV-Cache, Benutzer und temporäre Arbeitsspeicher.
Ein festes Fenster kann das Cache-Wachstum nach der Aufwärmphase begrenzen
Wenn jeder Layer nur das jüngste Tokenfenster behält, können alte KV-Einträge den aktiven Arbeitssatz verlassen, sobald neue Tokens eintreffen. Der Speicher nähert sich dann einer Obergrenze, die von der Fenstergröße und nicht von der Gesamtlänge des Datenstroms abhängt.
Longformer formalisiert die lokale Fensteraufmerksamkeit, deren Rechenaufwand mit der ausgewählten Nachbarschaft statt mit jedem Tokenpaar skaliert.
Ein rollierender KV-Puffer kann physische Speicherplätze wiederverwenden, sobald das Fenster voll ist, und so den Speicherverbrauch während eines längeren lokalen Chats oder Transkriptionsdatenstroms stabiler halten.
Dieser Vorteil hängt davon ab, dass die Laufzeit den Zustand außerhalb des Fensters tatsächlich verwirft oder überschreibt. Eine Modellarchitektur mit lokaler Aufmerksamkeit garantiert nicht, dass jede Inferenz-Engine den Cache identisch reserviert.
Gestapelte Layer können Informationen über ein einzelnes lokales Fenster hinaus übertragen
Ein Token liest auf einer Layer-Ebene eine aktuelle Nachbarschaft aus der vorherigen Layer-Ebene. Tiefere Layer erhalten Repräsentationen, die bereits Informationen aus früheren Nachbarschaften enthalten.
Die Mistral-Architektur erklärt dieses gestapelte rezeptive Feld: Über mehrere Transformer-Layer können Informationen weiter als über ein einzelnes Fenster hinaus übertragen werden.
Indirekte Übertragung ist jedoch nicht dasselbe wie der Erhalt eines direkten, exakten Zugriffs auf jedes alte Token. Das Modell erhält transformierte Repräsentationen statt einer unbegrenzt durchsuchbaren Tabelle mit dem vollständigen Verlauf.
Das Verwerfen alter KV-Zustände verändert, worauf das Modell direkt zugreifen kann
Sobald ein frühes Token jedes relevanten Aufmerksamkeitsfensters verlässt, können spätere Tokens über den normalen Weg der lokalen Aufmerksamkeit nicht mehr auf seinen ursprünglichen Schlüssel und Wert zugreifen.
StreamingLLM zeigt, dass eine naive Auslagerung älterer Tokens das Modellverhalten beeinträchtigen kann, sobald die Sequenz die Cache-Größe überschreitet.
Aufmerksamkeitsanker, globale Tokens, Zusammenfassungen, Retrieval oder architekturspezifische hybride Layer können ausgewählte Informationen über große Distanzen hinweg bewahren und gleichzeitig den Großteil des Cache-Speichers begrenzen.
Die Speichereinsparung hat daher eine semantische Grenze: Alte Details müssen möglicherweise zusammengefasst, erneut abgerufen oder bewusst außerhalb des gewöhnlichen gleitenden Bereichs gespeichert werden.
Die Fenstergröße muss mit der tatsächlichen Laufzeit und dem konkreten Arbeitsablauf getestet werden
Schätze die Cache-Obergrenze anhand der Fenstergröße, der KV-Heads, der Head-Dimension, der Layer-Anzahl, der Präzision, der Batch-Größe und der aktiven Benutzer. Überprüfe anschließend das beobachtete Verhalten des Speicher-Allokators, statt davon auszugehen, dass die theoretische Grenze vollständig erreicht wird.
Die Kimi-K3-Analyse von ZimaSpace unterscheidet zwischen festem und mit der Token-Anzahl wachsendem Zustand, wenn sie den Speicher bei langen Kontexten behandelt. Unterschiedliche Aufmerksamkeitsdesigns können unterschiedliche Grenzen vorgeben, selbst wenn sie eine ähnliche maximale Kontextlänge angeben.
Teste kurze Chats, Datenströme, die länger als das Fenster sind, Fakten am Anfang des Kontexts, mehrere gleichzeitige Benutzer und einen sauberen Neustart. Erfasse den Spitzenverbrauch, die Latenz bis zum ersten Token, die Ausgabegeschwindigkeit und ob frühe Informationen weiterhin verfügbar sind.
Ein kleineres Fenster ist sinnvoll, wenn es genügend Speicher für Zuverlässigkeit oder mehr parallele Benutzer freigibt, ohne Informationen zu entfernen, die der lokale Arbeitsablauf bewahren muss.
FAQ
Ist ein gleitendes Fenster dasselbe wie das Löschen der Unterhaltung?
Nein. Die Anwendung kann weiterhin das vollständige Transkript speichern, aber das Modell kann möglicherweise nur direkt auf das aktuelle Fenster zugreifen, sofern ältere Inhalte nicht zusammengefasst oder erneut abgerufen werden.
Verbraucht die Aufmerksamkeit mit gleitendem Fenster immer konstant viel Speicher?
Sie kann den Aufmerksamkeitscache für eine Sequenz begrenzen, aber der Gesamtspeicher umfasst weiterhin die Gewichte, andere Layer, aktive Benutzer, temporäre Puffer und Laufzeitreservierungen.
Kann sich ein Modell an Fakten erinnern, die älter als sein Fenster sind?
Manchmal über weitergeleitete Repräsentationen, globale Aufmerksamkeit, Zusammenfassungen, Retrieval oder den Anwendungsspeicher. Der direkte Zugriff auf den ursprünglichen Token-Zustand ist jedoch durch die Architektur begrenzt.
Tech- & KI-Zentrum
Mehr zum Lesen

Welche Funktionen ermöglichen eine vertrauenswürdige Grenze für die KI-Verarbeitung sensibler Dateien zu Hause?
Eine Vertrauensgrenze für heimische KI kombiniert Verschlüsselung ruhender Daten, Berechtigungen nach dem Prinzip der geringsten Privilegien, Sandboxing zur Laufzeit und gezielte Datenabfragen – keine...

Warum werden häufig bearbeitete Dateien in privaten Suchergebnissen bevorzugt?
Häufig bearbeitete Dateien erhalten Ranking-Vorteile, wenn jedes Update Aktualität, Chunks, Versionen oder Interaktionssignale hinzufügt, ohne nach der Quelle zu normalisieren.

Wodurch verwechseln Smart-Home-Anwesenheitsmodelle Gäste mit Bewohnern?
Gäste können wie Bewohner erscheinen, wenn das System Aktivitätsmuster im Haushalt beobachtet, aber kein stabiles Identitätssignal für die Person besitzt, die diese Aktivitäten verursacht.

