Hur många samtidiga användare kan en AI-modell för hemmet betjäna innan fördröjningen blir instabil?

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

En AI-modell hemma kan pålitligt betjäna en till flera interaktiva användare, men den stabila gränsen beror på tokenbehov, batchning och latensmål.

En modell som producerar 30 token per sekund kan kännas snabb i en kort chatt med en användare, men stanna upp när fyra personer skickar långa promptar samtidigt. Samtidighet förbrukar KV-cacheminne, delar på avkodningskapaciteten och skapar köbildningstoppar. Den korrekta gränsen är den högsta belastning som fortfarande uppfyller ett definierat mål för p95-tid till första token och tokenhastighet under normal familjeanvändning.

Samtidighet omvandlar genomströmning till väntetid

En grov kapacitetsuppskattning dividerar den varaktiga genereringsgenomströmningen med det genomsnittliga antalet token som begärs per sekund över aktiva sessioner. När efterfrågan närmar sig tjänstens kapacitet skapar små toppar långa köer. Användare är inte identiska enheter; ett svar på 50 token och ett svar på 2 000 token belastar servern på olika sätt.

En analys av latens och genomströmning förklarar att batchning förbättrar den sammanlagda genomströmningen, samtidigt som den ofta innebär en avvägning mot individuell svarslatens. Denna avvägning avgör om ytterligare sessioner känns stabila.

Promptförladdning kan också blockera avkodningsarbete, beroende på schemaläggaren. Två användare som klistrar in stora dokument kan påverka alla mer än sex användare som ställer korta frågor. Ett användarantal utan fördelningar för promptar och utdata är därför inte överförbart.

KV-cache och schemaläggning skapar en andra gräns

Varje aktiv sekvens lagrar uppmärksamhetsnycklar och värden för sitt kontext. Längre historik och större batchar ökar användningen av KV-cache tills förfrågningar avvisas, växlas ut eller fördröjs. Kontinuerlig batchning kan släppa in nytt arbete mellan avkodningsiterationer, vilket förbättrar utnyttjandet men inte skapar något gratisminne.

En teknisk förklaring av kontinuerlig batchning visar hur schemaläggning på iterationsnivå fyller annars lediga batchplatser. Fördelen beror på arbetsbelastningen och kan något öka konkurrensen per förfrågan.

Latensen blir instabil nära mättnad eftersom kölängden reagerar kraftigt på variationer i ankomsttakten. Den genomsnittliga latensen kan öka gradvis medan p95- och maximal latens skjuter i höjden. Den stabila kapaciteten bör ligga under denna brytpunkt, inte vid benchmarkens högsta tokenhastighet.

När ett användarantal slutar förutsäga upplevelsen

Samma server kan stödja fler användare för autokomplettering än för RAG, verktygsanvändning eller lång innehållsgenerering. Kallstarter, termisk strypning, informationshämtning och talsyntes lägger till steg utanför modellserveringen. En samtidighetssiffra för enbart modellen kan inte garantera responsivitet i hela applikationen.

En serveringsguide om serveringsminne beskriver minne, kontext, batchning och parallellism som samverkande begränsningar. Om någon av dem ändras kan kapacitetens brytpunkt förflyttas.

Förutsägelsen fallerar också om familjens förfrågningar kommer i synkroniserade toppar i stället för oberoende. Fyra användare som sällan överlappar kan vara enkla att hantera, medan två automatiserade agenter kan mätta modellen kontinuerligt. Mät erbjudet arbete, inte registrerade konton.

Hitta samtidighetens brytpunkt med ett belastningstest

Spela upp realistiska korta, medellånga och långa förfrågningar med en, två, fyra och åtta samtidiga sessioner. Håll modell, kvantisering, kontextgräns och sampling konstanta. Registrera kötid, latens till första token, latens mellan token, slutförandegrad, användning av KV-cache samt p50-, p95- och maxvärden.

Använd arkitekturen för delade modellsessioner som testkontext när flera hushållssessioner delar på en modell. Håll RAG- och verktygsstegen antingen avstängda eller mät dem separat.

Definiera den stabila gränsen som den högsta samtidigheten där p95-latensen till första token håller sig inom hushållets mål, utan en ökande kötrend eller minnesfel. Behåll 20–30 procent genomströmningsmarginal för toppar. Testa på nytt varje gång kontextlängd, modell eller schemaläggare ändras.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.