Die Planung der Beschleuniger beeinflusst die Nutzung von Heim-KI durch mehrere Personen, indem sie festlegt, welche Anfragen starten, sich jede Iteration teilen, ihren Speicherzustand behalten oder hinter anderen Aufgaben warten.
Mehrere Personen im Haushalt können Anfragen mit sehr unterschiedlichen Kosten senden: eine kurze Frage zur Lichtsteuerung, ein langes Dokument, ein Bild, eine Sprachanfrage oder einen Agenten, der zahlreiche Aufrufe erzeugt. Der Beschleuniger kann die Bedeutung für den Haushalt nicht allein anhand des Eingangszeitpunkts erkennen. Ein Scheduler muss Warteschlangenreihenfolge, Token-Budgets, Batching, Prioritäten, Speicherfreigabe und den Verbleib von Modellen im Speicher kombinieren, während die Ausgaben unvorhersehbar bleiben. Die folgenden Abschnitte erklären, warum sich dieselbe Hardware je nach diesen Entscheidungen fair, schnell oder unbrauchbar anfühlen kann.
FIFO behandelt den Eingangszeitpunkt als einzige Priorität
Eine Warteschlange nach dem Prinzip „First In, First Out“ ist einfach, aber ein langer Prompt oder eine lange Antwort kann viele später eingegangene kurze Anfragen verzögern.
LLM-Anfragen haben ungleiche Token-Kosten. Daher kann Fairness, die nur auf der Anzahl der Anfragen basiert, einem Nutzer deutlich mehr Zeit auf dem Beschleuniger geben als einem anderen.
FIFO ist bei geringer Auslastung vorhersehbar, führt bei heterogenen Workloads im Haushalt jedoch zu einer Blockierung am Anfang der Warteschlange.
Kontinuierliches Batching teilt Iterationen zwischen Nutzern
Scheduler auf Iterationsebene können zwischen Dekodierungsschritten neue Sequenzen hinzufügen und abgeschlossene Sequenzen entfernen, ohne einen festen Batch vollständig neu zu erstellen.
Orcas Iterationsplanung verbessert die Auslastung und ermöglicht es mehreren Nutzern, gleichzeitig Fortschritte zu machen.
Gemeinsame Nutzung garantiert keine gleiche Geschwindigkeit. Ein Scheduler entscheidet weiterhin, wie viele Sequenzen aufgenommen werden, wie häufig jede Sequenz Fortschritte macht und ob ein neues Prefill aktive Dekodierungen unterbricht.
Prioritätsrichtlinien schützen latenzempfindliche Anfragen
Sprachsteuerung und kurze interaktive Chats können eine schnellere Aufnahme verdienen als Hintergrundzusammenfassungen, Embeddings oder Bildgenerierung.
Llumnix behandelt Latenzprioritäten für heterogene LLM-Anfragen.
Prioritäten müssen Alterung oder Kontingente berücksichtigen, damit Hintergrundaufgaben letztlich ausgeführt werden und ein bevorzugter Nutzer den Rest des Haushalts nicht verdrängen kann.
Die Speicherfreigabe kann eine Anfrage vor der Berechnung blockieren
Eine Anfrage benötigt zusätzlich zu den Modellgewichten einen KV-Cache und Arbeitsbereich. Der Scheduler kann die Aufnahme verzögern, obwohl Recheneinheiten scheinbar frei sind, weil nicht genügend Speicherreserven vorhanden sind.
Der Leitfaden von ZimaSpace zu Speicherdruck bei mehreren Nutzern erklärt, warum längere Kontexte die Anzahl der gleichzeitig aktiven Gespräche verringern.
Durch die Unterbrechung einer Sequenz wird Kapazität frei, aber ihr Zustand muss später möglicherweise neu berechnet oder wiederhergestellt werden. Dadurch wird die Speicherverwaltung zu einer zusätzlichen Latenzquelle.
Prefill und Dekodierung benötigen unterschiedliche Planungsstrategien
Lange Prefills beanspruchen die Rechenleistung stark, während die Token-Dekodierung wiederholt auf Gewichte und Cache-Zustand zugreift. Werden beide Vorgänge ohne Steuerung gemeinsam ausgeführt, kann die gestreamte Ausgabe ins Stocken geraten.
Sarathi-Serve nutzt störungsfreie Planung und segmentiertes Prefill, um den Durchsatz zu verbessern und gleichzeitig die Beeinträchtigung der Latenz zu begrenzen.
Ein Heim-Scheduler kann Dekodierungsmöglichkeiten für aktive Gespräche reservieren und umfangreiche Dokument-Prefills aufteilen, anstatt eine einzelne Anfrage eine lange Iteration lang zu monopolisieren.
Fairness muss anhand der für Nutzer spürbaren Kriterien gemessen werden
Die aggregierte Tokenrate pro Sekunde kann steigen, während ein Nutzer deutlich länger wartet als ein anderer. Erfassen Sie die Wartezeit in der Warteschlange, die Zeit bis zum ersten Token, die Verzögerung zwischen Tokens, die Abschlusszeit und den Nutzungsanteil je Nutzer oder Workload-Klasse.
Der Virtual Token Counter definiert tokenbasierte Fairness, anstatt jede Anfrage gleich zu zählen.
Verwenden Sie eigene Klassen für Sprache, interaktiven Chat, Agenten, Embeddings und Wartungsaufgaben. Testen Sie anschließend überlappende lange und kurze Anfragen, um sicherzustellen, dass die gewählte Richtlinie den Erwartungen des Haushalts entspricht.
Scheduling kann keine zusätzliche Beschleunigerkapazität schaffen. Es kann jedoch entscheiden, ob sich ein Engpass als faire Verlangsamung, starke Tail-Latenz oder als ein Nutzer äußert, der alle anderen blockiert.
Tech- & KI-Zentrum
Mehr zum Lesen

Welche Funktionen ermöglichen eine vertrauenswürdige Grenze für die KI-Verarbeitung sensibler Dateien zu Hause?
Eine Vertrauensgrenze für heimische KI kombiniert Verschlüsselung ruhender Daten, Berechtigungen nach dem Prinzip der geringsten Privilegien, Sandboxing zur Laufzeit und gezielte Datenabfragen – keine...

Warum werden häufig bearbeitete Dateien in privaten Suchergebnissen bevorzugt?
Häufig bearbeitete Dateien erhalten Ranking-Vorteile, wenn jedes Update Aktualität, Chunks, Versionen oder Interaktionssignale hinzufügt, ohne nach der Quelle zu normalisieren.

Wodurch verwechseln Smart-Home-Anwesenheitsmodelle Gäste mit Bewohnern?
Gäste können wie Bewohner erscheinen, wenn das System Aktivitätsmuster im Haushalt beobachtet, aber kein stabiles Identitätssignal für die Person besitzt, die diese Aktivitäten verursacht.

