Så lagrar du lokala LLM-modeller utan att fylla arbetsstationens SSD

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

Behåll en liten het uppsättning på arbetsstationens NVMe-enhet, placera det större modellbiblioteket på delad lagring och se till att varje körning använder explicita sökvägar.

Den här layouten fungerar när modellvikter huvudsakligen läses in vid uppstart, nätverket kan leverera acceptabla laddningstider och oersättliga finjusteringar skyddas separat från nedladdningsbara filer. Den fungerar inte när varje cache tyst faller tillbaka till start-SSD:n eller när en saknad NAS får inferenstjänsten att ladda ned modeller igen till en ny lokal katalog.

Klassificera modelfiler efter arbetsmängd och kostnad för återskapande

Börja med en inventering i stället för att flytta en enda enorm cachekatalog. Basvikter och kvantiserade varianter kan laddas ned igen, men adaptrar, finjusteringar, promptmallar, manifest, utvärderingsresultat och lokalt konverterade filer kan vara unika. Märk varje objekt som hett, varmt, kallt eller oersättligt och notera sedan vilken applikation som äger dess sökväg.

Den heta uppsättningen innehåller modeller som används varje dag och bör rymmas inom en fast budget på arbetsstationen. Varma modeller kan ligga på NAS:en och kopieras lokalt inför ett projekt. Kalla experiment kan finnas kvar endast i det delade biblioteket. Oersättliga utdata behöver versionshanterad säkerhetskopiering även om den överordnade modellen kan laddas ned igen.

Den här klassificeringen förhindrar två vanliga misstag: att säkerhetskopiera hundratals gigabyte som är enkla att återskapa och att radera en liten adapter eller ett manifest som inte kan återskapas billigt. Den ger också den första kapacitetssiffran: storleken på den heta uppsättningen plus ledigt utrymme för en inkommande modell, inte storleken på alla modeller du någonsin kan tänkas testa.

Tilldela roller för lokal NVMe, delad lagring och arkiv

Ett AI-kluster i verkligheten lagrade modelfiler på en NAS och läste in dem över 10GbE, vilket visar att mönstret fungerar när nätverket och lagringsvägen är utformade för stora läsningar. Den användbara lärdomen från det här NAS-baserade arbetsflödet för modellservering är rollseparering: det delade biblioteket är källan, medan beräkning och minne finns kvar på inferensnoden.

Lagringsroll Rekommenderat innehåll Felbeteende Kontroll
Het nivå på arbetsstationens NVMe Aktuella modeller, tokenizerfiler, aktiv körningscache Inferensen fortsätter om NAS:en inte är tillgänglig Hård storlekskvot och rensning efter minst nyligen använd
NAS-modellbibliotek Godkända vikter, kvantiseringar, delade revisioner Nya inläsningar pausas; den aktiva modellen i minnet kan fortsätta Skrivskyddad delning och kontrollsummor
Skyddad projektlagring Finjusteringar, adaptrar, manifest, utvärderingsresultat Återskapandet beror på säkerhetskopian Ögonblicksbilder plus oberoende säkerhetskopia
Arbetsutrymme Ofullständiga nedladdningar, konverteringar, temporära delar Säkert att radera Separat sökväg med automatisk utgång

Peka inte alla körningsmiljöer mot samma skrivbara nätverksmapp. En misslyckad konvertering, ett rensningsjobb eller en versionsändring kan ändra filer som används av ett annat verktyg. Håll det kanoniska biblioteket huvudsakligen skrivskyddat, mellanlagra ändringar i arbetsutrymmet, verifiera dem och publicera färdiga artefakter medvetet.

Bygg en förutsägbar modellsökväg och cachepolicy

Välj en kanonisk monteringspunkt, till exempel /srv/models på Linux eller en stabil enhetsbokstav i Windows, och gör den tillgänglig innan Ollama, vLLM, LM Studio eller utvecklingscontainrar startar. Mappa varje verktygs modell- och cacheinställning explicit. En symbolisk länk är acceptabel endast när monteringskontrollen körs först och målet aldrig ändras mellan omstarter.

Användare i communityn som överväger en separat NAS identifierar upprepade gånger modellinläsningstiden som gränsen. I en diskussion om AI-arbetsstationer och NAS rekommenderade deltagarna att behålla ofta använda modeller på lokal NVMe, eftersom stora vikter kan ta flera minuter att överföra via en långsammare länk.

Använd en tillåtelselista för den lokala heta cachen i stället för att spegla hela NAS:en. Efter en lyckad inläsning eller kopiering verifierar du filstorlek eller kontrollsumma och uppdaterar sedan ett atomiskt alias som current/model-name. Avlägsna endast modeller som varken körs eller är fastnålade. Behåll minst det större av 15 procent ledigt utrymme eller en maximalt förväntad modellnedladdning, så att en uppdatering inte kan fylla startvolymen halvvägs.

Skydda manifest och finjusteringar, inte varje nedladdning

Säkerhetskopiera informationen som behövs för att återskapa biblioteket: käll-URL eller förråds-ID, exakt revision, filnamn, kvantisering, kontrollsumma, licensanteckningar, körningskonfiguration och sökvägen som används i produktion. Det manifestet är litet, sökbart och mer användbart vid återställning än en katalog full av tvetydigt namngivna filer.

Säkerhetskopiera unika adaptrar, sammanslagna modeller, kalibreringsdata och utvärderingsresultat med normal versionsbaserad lagringstid. För offentliga basvikter avgör du om återställningstiden motiverar ytterligare en kopia. En långsam internetanslutning eller en modell som kan försvinna kan göra utvalda vikter värda att skydda, men att spegla varje experiment slösar vanligtvis med säkerhetskopieringskapacitet.

Om det bredare AI-fillagret fortfarande är oklart är ZimaSpaces jämförelse av personligt moln och lokal PC-lagring för AI-filer nästa planeringssteg. Den skiljer beständiga källdata och index från maskinen som utför inferensen.

Validera laddningstid, offlinebeteende och utlösaren för utbyggnad

Testa tre scenarier med modelltjänsten stoppad: en het lokal inläsning, en kall NAS-inläsning och ett NAS-avbrott. Registrera tiden tills det första användbara svaret, maximal nätverkshastighet, arbetsstationens lediga utrymme före och efter samt om något verktyg skapar en reservkatalog på startdisken. Upprepa efter en omstart så att monteringsordningen testas i stället för att antas.

Konfigurationen är godkänd när dagliga modeller läses in lokalt inom förväntad tid, kalla modeller kan mellanlagras utan manuella ändringar av sökvägar, unika artefakter kan återställas från säkerhetskopia och en saknad NAS ger ett tydligt fel i stället för en tyst ny nedladdning. Lägg till snabbare nätverk eller en större lokal nivå först när uppmätt fördröjning vid kall inläsning stör arbetet; lägg till NAS-kapacitet när det kanoniska biblioteket närmar sig sin definierade gräns för ledigt utrymme.

Sluta använda direkta nätverksläsningar för arbetsbelastningar som upprepade gånger gör hoppvisa läsningar över modellfragment, kräver förutsägbart låg uppstartsfördröjning eller måste fungera när NAS:en är offline. Behåll i så fall NAS:en som bibliotek och kopiera kompletta modeller till en större dedikerad lokal SSD före start.

Slutlig installationsregel

Behåll det kanoniska modellbiblioteket på delad lagring, fastnåla den dagliga arbetsmängden på lokal NVMe, isolera förbrukningsbara cacher och skydda endast de artefakter och manifest som inte kan återskapas. Bygg ut först när uppmätt laddningstid eller kapacitet överskrider en skriftlig tröskel.

NAS- och serverinstallation

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.