En AI-modell hemma kan pålitligt betjäna en till flera interaktiva användare, men den stabila gränsen beror på tokenbehov, batchning och latensmål.
En modell som producerar 30 token per sekund kan kännas snabb i en kort chatt med en användare, men stanna upp när fyra personer skickar långa promptar samtidigt. Samtidighet förbrukar KV-cacheminne, delar på avkodningskapaciteten och skapar köbildningstoppar. Den korrekta gränsen är den högsta belastning som fortfarande uppfyller ett definierat mål för p95-tid till första token och tokenhastighet under normal familjeanvändning.
Samtidighet omvandlar genomströmning till väntetid
En grov kapacitetsuppskattning dividerar den varaktiga genereringsgenomströmningen med det genomsnittliga antalet token som begärs per sekund över aktiva sessioner. När efterfrågan närmar sig tjänstens kapacitet skapar små toppar långa köer. Användare är inte identiska enheter; ett svar på 50 token och ett svar på 2 000 token belastar servern på olika sätt.
En analys av latens och genomströmning förklarar att batchning förbättrar den sammanlagda genomströmningen, samtidigt som den ofta innebär en avvägning mot individuell svarslatens. Denna avvägning avgör om ytterligare sessioner känns stabila.
Promptförladdning kan också blockera avkodningsarbete, beroende på schemaläggaren. Två användare som klistrar in stora dokument kan påverka alla mer än sex användare som ställer korta frågor. Ett användarantal utan fördelningar för promptar och utdata är därför inte överförbart.
KV-cache och schemaläggning skapar en andra gräns
Varje aktiv sekvens lagrar uppmärksamhetsnycklar och värden för sitt kontext. Längre historik och större batchar ökar användningen av KV-cache tills förfrågningar avvisas, växlas ut eller fördröjs. Kontinuerlig batchning kan släppa in nytt arbete mellan avkodningsiterationer, vilket förbättrar utnyttjandet men inte skapar något gratisminne.
En teknisk förklaring av kontinuerlig batchning visar hur schemaläggning på iterationsnivå fyller annars lediga batchplatser. Fördelen beror på arbetsbelastningen och kan något öka konkurrensen per förfrågan.
Latensen blir instabil nära mättnad eftersom kölängden reagerar kraftigt på variationer i ankomsttakten. Den genomsnittliga latensen kan öka gradvis medan p95- och maximal latens skjuter i höjden. Den stabila kapaciteten bör ligga under denna brytpunkt, inte vid benchmarkens högsta tokenhastighet.
När ett användarantal slutar förutsäga upplevelsen
Samma server kan stödja fler användare för autokomplettering än för RAG, verktygsanvändning eller lång innehållsgenerering. Kallstarter, termisk strypning, informationshämtning och talsyntes lägger till steg utanför modellserveringen. En samtidighetssiffra för enbart modellen kan inte garantera responsivitet i hela applikationen.
En serveringsguide om serveringsminne beskriver minne, kontext, batchning och parallellism som samverkande begränsningar. Om någon av dem ändras kan kapacitetens brytpunkt förflyttas.
Förutsägelsen fallerar också om familjens förfrågningar kommer i synkroniserade toppar i stället för oberoende. Fyra användare som sällan överlappar kan vara enkla att hantera, medan två automatiserade agenter kan mätta modellen kontinuerligt. Mät erbjudet arbete, inte registrerade konton.
Hitta samtidighetens brytpunkt med ett belastningstest
Spela upp realistiska korta, medellånga och långa förfrågningar med en, två, fyra och åtta samtidiga sessioner. Håll modell, kvantisering, kontextgräns och sampling konstanta. Registrera kötid, latens till första token, latens mellan token, slutförandegrad, användning av KV-cache samt p50-, p95- och maxvärden.
Använd arkitekturen för delade modellsessioner som testkontext när flera hushållssessioner delar på en modell. Håll RAG- och verktygsstegen antingen avstängda eller mät dem separat.
Definiera den stabila gränsen som den högsta samtidigheten där p95-latensen till första token håller sig inom hushållets mål, utan en ökande kötrend eller minnesfel. Behåll 20–30 procent genomströmningsmarginal för toppar. Testa på nytt varje gång kontextlängd, modell eller schemaläggare ändras.
Teknik- och AI-hubb
Mer att läsa

Så mäter du kvaliteten på lokal RAG-hämtning och tolkar återkallning, precision och källhänvisningstäckning
Bygg ett lokalt RAG-testset, beräkna centrala återhämtningsmått, tolka deras avvägningar och granska om svarens påståenden stöds av citerade belägg.

Varför blir beräkning av smarta hem-funktioner viktigare när antalet sensorer ökar vid samma samplingsfrekvens?
Spåra beräkningar per sensor och mellan sensorer när antalet enheter ökar, identifiera icke-linjära kostnader för fusion och benchmarka funktionspipelinen innan automatiseringarna börjar släpa efter.

Varför blir kostnaden för RAG-utvärdering viktigare när dokumentbiblioteket växer trots samma frågevolym?
Förstå varför en växande korpus ökar utvärderingsarbetet för RAG utan fler användarfrågor och hur stratifierade tester håller kostnaden kopplad till risken.

