Houd een kleine actieve set op de NVMe van het werkstation, plaats de grotere modellencollectie op gedeelde opslag en zorg dat elke runtime expliciete paden gebruikt.
Deze indeling werkt wanneer modelgewichten tijdens het opstarten voornamelijk worden gelezen, het netwerk acceptabele laadtijden kan leveren en onvervangbare fine-tunes afzonderlijk worden beschermd tegen downloadbare bestanden. Ze faalt wanneer elke cache stilletjes terugvalt op de opstart-SSD of wanneer een ontbrekende NAS ervoor zorgt dat de inferentieservice modellen opnieuw downloadt naar een nieuwe lokale map.
Deel modelbestanden in op basis van actieve set en herbouwkosten
Begin met een inventarisatie in plaats van één enorme cachemap te verplaatsen. Basisgewichten en gekwantiseerde varianten kunnen opnieuw worden gedownload, maar adapters, fine-tunes, promptsjablonen, manifests, evaluatieresultaten en lokaal geconverteerde bestanden kunnen uniek zijn. Markeer elk item als actief, warm, koud of onvervangbaar en noteer vervolgens welke applicatie eigenaar is van het pad.
De actieve set bevat modellen die dagelijks worden gebruikt en moet binnen een vast werkstationbudget passen. Warme modellen kunnen op de NAS staan en vóór een project lokaal worden gekopieerd. Koude experimenten kunnen uitsluitend in de gedeelde bibliotheek blijven. Onvervangbare uitvoer heeft versiebeheer en back-ups nodig, zelfs als het bovenliggende model opnieuw kan worden gedownload.
Deze classificatie voorkomt twee veelgemaakte fouten: honderden gigabytes back-uppen die eenvoudig opnieuw kunnen worden gemaakt, en een kleine adapter of manifest verwijderen dat niet goedkoop kan worden gereconstrueerd. Ze levert ook het eerste capaciteitscijfer op: de omvang van de actieve set plus vrije ruimte voor één binnenkomend model, niet de omvang van elk model dat je ooit zou kunnen testen.
Wijs rollen toe aan lokale NVMe, gedeelde opslag en archief
Een lokale AI-cluster uit de praktijk sloeg modelbestanden op een NAS op en laadde ze via 10GbE, wat laat zien dat dit patroon haalbaar is wanneer het netwerk- en opslagpad zijn ontworpen voor grote leesbewerkingen. De nuttige les uit die NAS-ondersteunde model-servingworkflow is scheiding van rollen: de gedeelde bibliotheek is de bron, terwijl rekenkracht en geheugen op de inferentieknoop blijven.
| Opslagrol | Aanbevolen inhoud | Gedrag bij storingen | Beheer |
|---|---|---|---|
| Lokale NVMe-actieve laag van het werkstation | Huidige modellen, tokenizerbestanden, actieve runtime-cache | Inferentie gaat door als de NAS niet beschikbaar is | Harde groottequota en opschoning volgens minst recent gebruik |
| NAS-modellenbibliotheek | Goedgekeurde gewichten, kwantiseringen, gedeelde revisies | Nieuwe laadacties pauzeren; het actieve model in het geheugen kan doorgaan | Overwegend alleen-lezen share en checksums |
| Beschermde projectopslag | Fine-tunes, adapters, manifests, evaluatieresultaten | Herbouw hangt af van de back-up | Snapshots plus onafhankelijke back-up |
| Scratchruimte | Gedeeltelijke downloads, conversies, tijdelijke shards | Veilig te verwijderen | Afzonderlijk pad met automatische vervaldatum |
Wijs niet elke runtime naar dezelfde schrijfbare netwerkmap. Een mislukte conversie, opschoontaak of versiewijziging kan bestanden wijzigen die door een andere tool worden gebruikt. Houd de canonieke bibliotheek overwegend alleen-lezen, voer wijzigingen uit in de scratchruimte, controleer ze en promoveer voltooide artefacten bewust.
Bouw één voorspelbaar modelpad en cachebeleid
Kies één canoniek mountpunt, zoals /srv/models op Linux of een stabiele stationsletter op Windows, en maak dit beschikbaar voordat Ollama, vLLM, LM Studio of ontwikkelcontainers starten. Stel de model- en cache-instellingen van elke tool expliciet in. Een symlink is aanvaardbaar, maar alleen wanneer eerst wordt gecontroleerd of het mountpunt beschikbaar is en de bestemming tussen herstarts niet verandert.
Communitybeheerders die een afzonderlijke NAS overwegen, noemen herhaaldelijk de laadtijd van modellen als grens. In een discussie over een AI-werkstation en NAS adviseerden deelnemers om veelgebruikte modellen op lokale NVMe te houden, omdat grote gewichten er minuten over kunnen doen om via een tragere verbinding te worden overgebracht.
Gebruik een allowlist voor de lokale actieve cache in plaats van de volledige NAS te spiegelen. Controleer na een succesvolle laadactie of kopie de bestandsgrootte of checksum en werk vervolgens een atomische alias bij, zoals current/model-name. Verwijder alleen modellen die niet actief zijn en niet zijn vastgezet. Houd minstens de grootste waarde aan van 15 procent vrije ruimte of één maximaal verwachte modeldownload, zodat een update het opstartvolume niet halverwege kan vullen.
Bescherm manifests en fine-tunes, niet elke download
Maak een back-up van de informatie die nodig is om de bibliotheek opnieuw op te bouwen: bron-URL of repository-ID, exacte revisie, bestandsnaam, kwantisering, checksum, licentieopmerkingen, runtimeconfiguratie en het pad dat in productie wordt gebruikt. Dat manifest is klein, doorzoekbaar en nuttiger tijdens herstel dan een map vol bestanden met dubbelzinnige namen.
Back-up unieke adapters, samengevoegde modellen, kalibratiegegevens en evaluatieresultaten met normaal versiebeheer en bewaarbeleid. Bepaal voor openbare basisgewichten of de hersteltijd een extra kopie rechtvaardigt. Een trage internetverbinding of een model dat mogelijk verdwijnt, kan geselecteerde gewichten het beschermen waard maken, maar elke experimentkopie spiegelen verspilt doorgaans back-upcapaciteit.
Als de bredere AI-bestandslaag nog niet is bepaald, is de vergelijking van ZimaSpace tussen een persoonlijke cloud en lokale pc-opslag voor AI-bestanden de volgende planningsstap. Deze scheidt permanente brongegevens en indexen van de machine die de inferentie uitvoert.
Valideer laadtijd, offlinegedrag en de uitbreidingsdrempel
Test drie paden terwijl de modelservice is gestopt: een lokale laadactie van een actief model, een NAS-laadactie van een koud model en een NAS-storing. Noteer de tijd tot het eerste bruikbare antwoord, de maximale netwerkdoorvoer, de vrije ruimte op het werkstation voor en na de test en of een tool een terugvalmap op de opstartschijf aanmaakt. Herhaal dit na een herstart, zodat de volgorde van het mounten wordt getest in plaats van verondersteld.
De opstelling slaagt wanneer dagelijkse modellen binnen de verwachte tijd lokaal laden, koude modellen zonder handmatige padwijzigingen kunnen worden klaargezet, unieke artefacten vanuit een back-up kunnen worden hersteld en een ontbrekende NAS een duidelijke fout oplevert in plaats van een stille herdownload. Voeg sneller netwerk of een grotere lokale laag pas toe wanneer de gemeten laadtijd van koude modellen het werk onderbreekt; voeg NAS-capaciteit toe wanneer de canonieke bibliotheek de vastgelegde grens voor vrije ruimte nadert.
Gebruik geen directe netwerklezingen voor een workload die herhaaldelijk door modelshards springt, voorspelbaar lage opstartlatentie vereist of moet werken terwijl de NAS offline is. Bewaar in dat geval de NAS als bibliotheek en kopieer complete modellen vóór de start naar een grotere, speciaal daarvoor bestemde lokale SSD.
Laatste regel voor de configuratie
Houd de canonieke modellenbibliotheek op gedeelde opslag, zet de dagelijkse actieve set vast op lokale NVMe, isoleer wegwerpbare caches en bescherm alleen de artefacten en manifests die niet opnieuw kunnen worden gemaakt. Breid uit nadat de gemeten laadtijd of capaciteit een schriftelijk vastgelegde drempel overschrijdt.
NAS- en serverconfiguratie
Meer om te lezen

Een lokale RAG-configuratie voor onderzoeksartikelen, notities en privédocumenten
Houd originele documenten gezaghebbend, maak indexering herhaalbaar, vereis bronvermeldingen en scheid vervangbare modellen van private brongegevens.

Waarom gebruiken ontwikkelaars een gateway-node voor private DNS, VPN en testapps?
Een gateway-node geeft privé-apps één gecontroleerde naam en toegangsroute, terwijl compute-nodes afgeschermd en vervangbaar blijven.

Een reproduceerbare applicatiestack bouwen met Compose-bestanden, geheimen en gescheiden persistente gegevens
Houd Compose-definities overdraagbaar, bescherm geheimen en maak zelfstandig back-ups van appgegevens, zodat de stack op een schone host opnieuw kan worden opgebouwd.

