Lokaal LLM-modellen opslaan zonder de SSD van je werkstation vol te laten lopen

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Houd een kleine actieve set op de NVMe van het werkstation, plaats de grotere modellencollectie op gedeelde opslag en zorg dat elke runtime expliciete paden gebruikt.

Deze indeling werkt wanneer modelgewichten tijdens het opstarten voornamelijk worden gelezen, het netwerk acceptabele laadtijden kan leveren en onvervangbare fine-tunes afzonderlijk worden beschermd tegen downloadbare bestanden. Ze faalt wanneer elke cache stilletjes terugvalt op de opstart-SSD of wanneer een ontbrekende NAS ervoor zorgt dat de inferentieservice modellen opnieuw downloadt naar een nieuwe lokale map.

Deel modelbestanden in op basis van actieve set en herbouwkosten

Begin met een inventarisatie in plaats van één enorme cachemap te verplaatsen. Basisgewichten en gekwantiseerde varianten kunnen opnieuw worden gedownload, maar adapters, fine-tunes, promptsjablonen, manifests, evaluatieresultaten en lokaal geconverteerde bestanden kunnen uniek zijn. Markeer elk item als actief, warm, koud of onvervangbaar en noteer vervolgens welke applicatie eigenaar is van het pad.

De actieve set bevat modellen die dagelijks worden gebruikt en moet binnen een vast werkstationbudget passen. Warme modellen kunnen op de NAS staan en vóór een project lokaal worden gekopieerd. Koude experimenten kunnen uitsluitend in de gedeelde bibliotheek blijven. Onvervangbare uitvoer heeft versiebeheer en back-ups nodig, zelfs als het bovenliggende model opnieuw kan worden gedownload.

Deze classificatie voorkomt twee veelgemaakte fouten: honderden gigabytes back-uppen die eenvoudig opnieuw kunnen worden gemaakt, en een kleine adapter of manifest verwijderen dat niet goedkoop kan worden gereconstrueerd. Ze levert ook het eerste capaciteitscijfer op: de omvang van de actieve set plus vrije ruimte voor één binnenkomend model, niet de omvang van elk model dat je ooit zou kunnen testen.

Wijs rollen toe aan lokale NVMe, gedeelde opslag en archief

Een lokale AI-cluster uit de praktijk sloeg modelbestanden op een NAS op en laadde ze via 10GbE, wat laat zien dat dit patroon haalbaar is wanneer het netwerk- en opslagpad zijn ontworpen voor grote leesbewerkingen. De nuttige les uit die NAS-ondersteunde model-servingworkflow is scheiding van rollen: de gedeelde bibliotheek is de bron, terwijl rekenkracht en geheugen op de inferentieknoop blijven.

Opslagrol Aanbevolen inhoud Gedrag bij storingen Beheer
Lokale NVMe-actieve laag van het werkstation Huidige modellen, tokenizerbestanden, actieve runtime-cache Inferentie gaat door als de NAS niet beschikbaar is Harde groottequota en opschoning volgens minst recent gebruik
NAS-modellenbibliotheek Goedgekeurde gewichten, kwantiseringen, gedeelde revisies Nieuwe laadacties pauzeren; het actieve model in het geheugen kan doorgaan Overwegend alleen-lezen share en checksums
Beschermde projectopslag Fine-tunes, adapters, manifests, evaluatieresultaten Herbouw hangt af van de back-up Snapshots plus onafhankelijke back-up
Scratchruimte Gedeeltelijke downloads, conversies, tijdelijke shards Veilig te verwijderen Afzonderlijk pad met automatische vervaldatum

Wijs niet elke runtime naar dezelfde schrijfbare netwerkmap. Een mislukte conversie, opschoontaak of versiewijziging kan bestanden wijzigen die door een andere tool worden gebruikt. Houd de canonieke bibliotheek overwegend alleen-lezen, voer wijzigingen uit in de scratchruimte, controleer ze en promoveer voltooide artefacten bewust.

Bouw één voorspelbaar modelpad en cachebeleid

Kies één canoniek mountpunt, zoals /srv/models op Linux of een stabiele stationsletter op Windows, en maak dit beschikbaar voordat Ollama, vLLM, LM Studio of ontwikkelcontainers starten. Stel de model- en cache-instellingen van elke tool expliciet in. Een symlink is aanvaardbaar, maar alleen wanneer eerst wordt gecontroleerd of het mountpunt beschikbaar is en de bestemming tussen herstarts niet verandert.

Communitybeheerders die een afzonderlijke NAS overwegen, noemen herhaaldelijk de laadtijd van modellen als grens. In een discussie over een AI-werkstation en NAS adviseerden deelnemers om veelgebruikte modellen op lokale NVMe te houden, omdat grote gewichten er minuten over kunnen doen om via een tragere verbinding te worden overgebracht.

Gebruik een allowlist voor de lokale actieve cache in plaats van de volledige NAS te spiegelen. Controleer na een succesvolle laadactie of kopie de bestandsgrootte of checksum en werk vervolgens een atomische alias bij, zoals current/model-name. Verwijder alleen modellen die niet actief zijn en niet zijn vastgezet. Houd minstens de grootste waarde aan van 15 procent vrije ruimte of één maximaal verwachte modeldownload, zodat een update het opstartvolume niet halverwege kan vullen.

Bescherm manifests en fine-tunes, niet elke download

Maak een back-up van de informatie die nodig is om de bibliotheek opnieuw op te bouwen: bron-URL of repository-ID, exacte revisie, bestandsnaam, kwantisering, checksum, licentieopmerkingen, runtimeconfiguratie en het pad dat in productie wordt gebruikt. Dat manifest is klein, doorzoekbaar en nuttiger tijdens herstel dan een map vol bestanden met dubbelzinnige namen.

Back-up unieke adapters, samengevoegde modellen, kalibratiegegevens en evaluatieresultaten met normaal versiebeheer en bewaarbeleid. Bepaal voor openbare basisgewichten of de hersteltijd een extra kopie rechtvaardigt. Een trage internetverbinding of een model dat mogelijk verdwijnt, kan geselecteerde gewichten het beschermen waard maken, maar elke experimentkopie spiegelen verspilt doorgaans back-upcapaciteit.

Als de bredere AI-bestandslaag nog niet is bepaald, is de vergelijking van ZimaSpace tussen een persoonlijke cloud en lokale pc-opslag voor AI-bestanden de volgende planningsstap. Deze scheidt permanente brongegevens en indexen van de machine die de inferentie uitvoert.

Valideer laadtijd, offlinegedrag en de uitbreidingsdrempel

Test drie paden terwijl de modelservice is gestopt: een lokale laadactie van een actief model, een NAS-laadactie van een koud model en een NAS-storing. Noteer de tijd tot het eerste bruikbare antwoord, de maximale netwerkdoorvoer, de vrije ruimte op het werkstation voor en na de test en of een tool een terugvalmap op de opstartschijf aanmaakt. Herhaal dit na een herstart, zodat de volgorde van het mounten wordt getest in plaats van verondersteld.

De opstelling slaagt wanneer dagelijkse modellen binnen de verwachte tijd lokaal laden, koude modellen zonder handmatige padwijzigingen kunnen worden klaargezet, unieke artefacten vanuit een back-up kunnen worden hersteld en een ontbrekende NAS een duidelijke fout oplevert in plaats van een stille herdownload. Voeg sneller netwerk of een grotere lokale laag pas toe wanneer de gemeten laadtijd van koude modellen het werk onderbreekt; voeg NAS-capaciteit toe wanneer de canonieke bibliotheek de vastgelegde grens voor vrije ruimte nadert.

Gebruik geen directe netwerklezingen voor een workload die herhaaldelijk door modelshards springt, voorspelbaar lage opstartlatentie vereist of moet werken terwijl de NAS offline is. Bewaar in dat geval de NAS als bibliotheek en kopieer complete modellen vóór de start naar een grotere, speciaal daarvoor bestemde lokale SSD.

Laatste regel voor de configuratie

Houd de canonieke modellenbibliotheek op gedeelde opslag, zet de dagelijkse actieve set vast op lokale NVMe, isoleer wegwerpbare caches en bescherm alleen de artefacten en manifests die niet opnieuw kunnen worden gemaakt. Breid uit nadat de gemeten laadtijd of capaciteit een schriftelijk vastgelegde drempel overschrijdt.

NAS- en serverconfiguratie

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.