Modellresidens innebär att modellvikter behålls i värd- eller acceleratorminnet mellan förfrågningar, så att nästa inferens helt eller delvis slipper laddningsarbetet.
En hemassistent som används med några minuters mellanrum upplevs mycket annorlunda när en modell på åtta gigabyte finns kvar i GPU-minnet jämfört med när den läses från lagringen varje gång. Residens kan finnas på flera nivåer: filsystemscache, mappade värdsidor, låst RAM eller VRAM som är redo för kärnor. Att hålla vikterna varma minskar startfördröjningen, men reserverar knappt minne och kan hindra andra modeller eller arbetsbelastningar från att köras.
Residens beskriver var återanvändbart modellstatus finns kvar
En kall modell finns endast på lagringen och måste läsas in, allokeras, transformeras och kopieras före inferens. Värdresidente vikter undviker läsningar från lagringen, medan acceleratorresidente vikter även undviker överföringen från värd till enhet och körningens initieringsväg. Denna skillnad förblir synlig under senare tester i hemmet.
NVIDIAs analys av modellströmning separerar modellens laddningsväg från överförings- och initieringsarbetet, vilket visar varför viktplaceringen dominerar många kallstarter. En varm process kan fortfarande behöva initiera tokeniserare, graf, adapter eller cache. Mellanresultatet måste förbli granskningsbart innan automatiseringen följer efter.
Residens är inte samma sak som en aktiv förfrågan. En modell kan förbli inläst utan KV-cache eller användardata och vara redo att svara samtidigt som den förbrukar minne och vissa bakgrundsresurser. Denna gräns bör mätas separat under realistiska driftsförhållanden.
Värme finns över en minneshierarki
Operativsystemet kan behålla modellsidor i sin sidcache även efter att en process avslutats, minnesmappning kan läsa in sidor fördröjt, och en serverprocess kan behålla tensorer i RAM eller VRAM. Varje varmare nivå minskar vanligtvis fördröjningen samtidigt som den förbrukar en mer begränsad resurs.
ServerlessLLM undersöker hierarkisk modellinläsning över lagring, värdminne och GPU-minne och schemalägger inläsningen för att minska kallstartskostnaden. Hierarkin förklarar varför en till synes urladdad modell kan starta om snabbt tills cachetryck avlägsnar dess sidor.
Kvantisering minskar antalet byte som krävs för residens och kan göra det möjligt för flera specialiserade modeller att samexistera. Den kan också ändra körningskärnor och kvalitet, så minnesbesparingar bör inte räknas som en kostnadsfri kapacitetsökning. Den praktiska konsekvensen märks när flera källor konkurrerar om begränsat kontextminne.
Utkastningspolicyn omvandlar minnestryck till startfördröjning
En tjänst kan behålla ofta använda modeller residenta och kasta ut kallare modeller baserat på senaste användning, förutspådd efterfrågan, prioritet eller laddningskostnad. Routning med flera modeller behöver antagningsregler så att bakgrundsarbete inte tränger undan röstmodellen som måste svara omedelbart.
FlexGen demonstrerar avlastning av vikter mellan GPU, CPU och lagring för inferens under begränsade resurser. Även om metoden är inriktad på genomströmning tydliggör den den centrala avvägningen: att flytta vikter mellan nivåer sparar knappt minne men medför överförings- och schemaläggningskostnader.
Felgränsen utgörs av minnestryck som utlöser växling, OOM-omstarter eller utkastningsöverbelastning. Att hålla för många vikter inlästa kan göra varje modell långsammare och mindre tillförlitlig än att medvetet värma en mindre arbetsmängd. Detta beroende bör förbli tydligt i det slutliga gränssnittet.
Ställ in residens utifrån återanvändningsavstånd och minnesmarginal
Mät kall, värdvarm och acceleratorvarm starttid för varje modell och registrera sedan förfrågningsintervall, laddningsmängd i byte, VRAM- och RAM-avtryck, tomgångsförbrukning, antal utkastningar och efterfrågan från konkurrerande arbetsbelastningar. Resultatet måste därför kontrolleras mot det ursprungliga underlaget.
Jämför startmekanismen med minnesmappad start. Spela upp en veckas ankomster med olika kandidater för kvarhållningsfönster och prioriteringar, inklusive toppar, långa inaktiva perioder och samtidiga modellförfrågningar. Denna skillnad förblir synlig under senare tester i hemmet.
Behåll en modell resident när den undvikna laddningsfördröjningen och återanvändningsfrekvensen motiverar det skyddade minnet. Kasta ut den när den reserverade kapaciteten orsakar köbildning eller överbelastning, och behåll en nödreserv för KV-cache och tillfälliga allokeringar.
Teknik- och AI-hubb
Mer att läsa

Vad är embeddingdrift, och när behöver ett privat sökindex byggas om?
Avkoda modell-, förbehandlings-, korpus- och frågeförskjutning; skilj övervakning från inkompatibilitet och avgör när ett privat index behöver byggas om.

Vad är tokeniseringskompatibilitet, och varför kan den göra att modellbyte slutar fungera?
Avkoda ordförrådsidentitet, semantik för specialtoken, chattmallar, cachade token, adaptrar och kompatibilitetskontroller för lokal modellväxling.

Vad är acceptansgraden för spekulativ avkodning, och varför spelar den roll?
Fastställ acceptanskriteriet, utforma verifieringen, avvisningsbeteendet, gränserna för prestandaökning, variationen i arbetsbelastning och mätningen för lokal inferens.

