Welche Funktionen ermöglichen Kostenlimits pro Anfrage in einem gemeinsam genutzten KI-Dienst für zu Hause?

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Anfragebezogene Kostenlimits funktionieren, wenn das Gateway Richtlinien in durchsetzbare Budgets für Tokens, Zeit, Arbeitsspeicher, Tools, Wiederholungsversuche und in der Warteschlange befindliche Aufgaben umwandelt.

Eine einfache Suche eines Familienmitglieds kann unerwartet eine lange Modellantwort, drei Abrufe, OCR und mehrere Agent-Tools auf einem gemeinsam genutzten Heimserver auslösen. Lokale Inferenz verursacht zwar keine Cloud-Rechnung pro Token, verbraucht aber dennoch knappe Beschleunigerzeit, Strom, RAM und interaktive Kapazität. Der Dienst benötigt Vorabschätzungen, eine laufende Erfassung, Abbruchpunkte und ein klares Verhalten, wenn ein Budget ausgeschöpft ist.

Aufnahmeschätzungen reservieren ein begrenztes Ressourcenpaket

Vor der Ausführung schätzt das Gateway Eingabetokens, maximale Ausgabe, Modellklasse, KV-Cache-Speicher, Abruftiefe, Tool-Anzahl und Deadline. Benutzer-, Endpunkt- und Workflow-Richtlinien werden zu einem unveränderlichen Anfragebudget zusammengeführt, das nachgelagerte Dienste nicht unbemerkt erhöhen können.

Planung auf Iterationsebene plant die Generierung auf Iterationsebene und bündelt dynamisch Anfragen mit unterschiedlichen Längen. Das Design zeigt, warum der tatsächliche Dekodierungsaufwand Token für Token sichtbar wird, anstatt aus dem anfänglichen Prompt vollständig bekannt zu sein. Dieser Unterschied bleibt auch bei späteren Tests im Haushalt sichtbar.

Schätzungen sollten daher eine Obergrenze reservieren, ohne jede Anfrage so abzurechnen, als würde sie diese Obergrenze erreichen. Große, aber risikoarme Hintergrundaufgaben können in eine Warteschlange aufgenommen werden, während interaktive Arbeit frühzeitig abgewiesen werden kann, wenn ihr Worst-Case-Speicher eine bestehende Reservierung sprengen würde.

Laufzeitmesser setzen Token-, Zeit-, Speicher- und Tool-Limits durch

Jeder Dienst meldet standardisierte Nutzung anhand der Anfrage-ID: Prompt- und generierte Tokens, GPU-Millisekunden, Spitzenarbeitsspeicher, CPU-Zeit, gelesene Bytes, Tool-Aufrufe, Wiederholungsversuche und externe Vorgänge. Ein zentrales Register zieht die Nutzung atomar ab, damit parallele Zweige nicht jeweils das gesamte verbleibende Budget ausgeben können.

Chunked-Prefill-Planung untersucht segmentiertes Prefill und unterbrechungsfreie Planung, um Durchsatz und Dekodierungslatenz auszubalancieren. Dies veranschaulicht, wie ein langer Prompt Dienstkapazität in Schüben verbrauchen kann, sofern die Arbeit nicht in durchsetzbare Einheiten aufgeteilt wird. Das Zwischenergebnis muss überprüfbar bleiben, bevor die Automatisierung fortfährt.

Tool-Budgets benötigen semantische Kategorien, nicht nur Zählwerte. Zehn schreibgeschützte Metadatenaufrufe unterscheiden sich von einer einzelnen Nachricht oder einer rekursiven Dateisuche. Daher kann die Richtlinie Nebenwirkungsklasse, Zielbereich, Ausgabebytes und kumulative Ausführungszeit unabhängig voneinander begrenzen.

Abbruch und Teilergebnisse definieren die Budgetgrenze

Kooperatives Abbrechen wird durch Abrufe, Generierung und Tools weitergegeben, und jede Phase prüft vor dem Start aufwendiger Arbeit die Deadline oder das verbleibende Budget. Idempotenzschlüssel verhindern, dass ein abgebrochener Wiederholungsversuch eine externe Nebenwirkung erneut ausführt. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.

faire GPU-Planung teilt Beschleunigerzyklen zeitlich auf, um eine Aushungerung von Anfragen zu verhindern, und untersucht die Kosten der Auslagerung von Inferenzkontext. Die Arbeit zeigt, dass Fairnesskontrollen sowohl Rechenzeit als auch Speicherzustand berücksichtigen müssen. Die praktische Folge zeigt sich, wenn mehrere Quellen um begrenzten Kontext konkurrieren.

Die Fehlergrenze liegt bei einer Erfassung ohne Durchsetzung. Ein Dashboard kann Überschreitungen melden, während eine Anfrage weiterhin die GPU monopolisiert. Sobald ein Limit erreicht ist, muss das System an einem sicheren Prüfpunkt anhalten, ein ausdrücklich gekennzeichnetes Teilergebnis zurückgeben und die Erschöpfung des Budgets von einem Modell- oder Tool-Fehler unterscheiden.

-15% OFF

Budgets mit adversarialen Anfrageformen testen

Erstelle Anfragen mit riesigen Eingaben, Prompts für unbegrenzte Ausgaben, rekursiven Tool-Plänen, parallelen Zweigen, Wiederholungsschleifen, langsamen Tools, Cache-Fehltreffern und Abbrüchen während Nebenwirkungen. Weise zwei Benutzern und einem Hintergrunddienst unterschiedliche Budgets zu. Diese Abhängigkeit sollte in der finalen Benutzeroberfläche ausdrücklich sichtbar bleiben.

Verwende die Pro-Benutzer-QoS-Grenze aus der Ressourcenrichtlinie pro Benutzer, um reservierte und tatsächliche Tokens, GPU-Zeit, Spitzenarbeitsspeicher, Wartezeit in der Warteschlange, Tool-Vorgänge, Anzahl der Wiederholungsversuche, Abbruchverzögerung und Qualität der Teilergebnisse zu erfassen. Bestätige, dass untergeordnete Spans das Budget des übergeordneten Elements übernehmen, anstatt es zurückzusetzen.

Der Test ist nur bestanden, wenn jede aufwendige Aktion zugeordnet wird und keine Anfrage ein hartes Limit über die dokumentierte Bereinigungsarbeit hinaus überschreitet. Wenn eine genaue Schätzung unmöglich ist, nimm Anfragen konservativ an und erstatte ungenutzte Kapazität, statt nachgelagerten Diensten das Erfinden neuer Budgets zu erlauben.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.