Come archiviare i modelli LLM in locale senza riempire l'SSD della workstation

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

Mantieni un piccolo set attivo sull'unità NVMe della workstation, colloca la libreria di modelli più ampia nello storage condiviso e fai in modo che ogni runtime utilizzi percorsi espliciti.

Questa configurazione funziona quando i pesi dei modelli vengono letti principalmente durante l'avvio, la rete garantisce tempi di caricamento accettabili e i fine-tuning non sostituibili sono protetti separatamente dai file scaricabili. Non funziona quando ogni cache ricade silenziosamente sull'SSD di avvio o quando l'assenza del NAS fa sì che il servizio di inferenza scarichi nuovamente i modelli in una nuova directory locale.

Classifica i file dei modelli in base al set di lavoro e al costo di ricostruzione

Inizia da un inventario invece di spostare un'unica enorme directory di cache. I pesi di base e le varianti quantizzate possono essere scaricati di nuovo, ma adattatori, fine-tuning, modelli di prompt, manifest, risultati delle valutazioni e file convertiti localmente possono essere unici. Contrassegna ogni elemento come attivo, caldo, freddo o non sostituibile, quindi annota quale applicazione possiede il relativo percorso.

Il set attivo contiene i modelli usati ogni giorno e dovrebbe rientrare in un budget fisso della workstation. I modelli caldi possono risiedere sul NAS ed essere copiati localmente prima di un progetto. Gli esperimenti freddi possono rimanere solo nella libreria condivisa. Gli output non sostituibili richiedono un backup con versioning anche se il modello di origine può essere scaricato nuovamente.

Questa classificazione evita due errori comuni: eseguire il backup di centinaia di gigabyte facili da ricreare e cancellare un piccolo adattatore o manifest che non può essere ricreato a basso costo. Fornisce inoltre il primo dato di capacità: dimensione del set attivo più spazio libero per un modello in arrivo, non la dimensione di ogni modello che potresti testare.

Assegna i ruoli a NVMe locale, storage condiviso e archivio

Un cluster IA locale reale conservava i file dei modelli su un NAS e li caricava tramite 10GbE, dimostrando che questo schema è valido quando rete e storage sono progettati per letture di grandi dimensioni. La lezione utile di quel flusso di lavoro per la distribuzione di modelli basato su NAS è la separazione dei ruoli: la libreria condivisa è la fonte, mentre calcolo e memoria rimangono sul nodo di inferenza.

Ruolo dello storage Contenuti consigliati Comportamento in caso di guasto Controllo
Livello attivo NVMe della workstation Modelli correnti, file del tokenizer, cache attiva del runtime L'inferenza continua se il NAS non è disponibile Quota rigida e pulizia secondo il criterio meno utilizzato di recente
Libreria di modelli sul NAS Pesi approvati, quantizzazioni, revisioni condivise I nuovi caricamenti vengono sospesi; il modello già in memoria può continuare a funzionare Condivisione prevalentemente in sola lettura e checksum
Archivio di progetto protetto Fine-tuning, adattatori, manifest, risultati delle valutazioni La ricostruzione dipende dal backup Istantanee più backup indipendente
Spazio temporaneo Download parziali, conversioni, frammenti temporanei È sicuro eliminarlo Percorso separato con scadenza automatica

Non indirizzare ogni runtime verso la stessa cartella di rete scrivibile. Una conversione non riuscita, un processo di pulizia o una modifica di versione potrebbe alterare file utilizzati da un altro strumento. Mantieni la libreria canonica prevalentemente in sola lettura, prepara le modifiche nello spazio temporaneo, verificale e promuovi deliberatamente gli artefatti completati.

Crea un percorso dei modelli e una politica di cache prevedibili

Scegli un punto di mount canonico, come /srv/models su Linux o una lettera di unità stabile su Windows, e rendilo disponibile prima dell'avvio di Ollama, vLLM, LM Studio o dei container di sviluppo. Configura esplicitamente le impostazioni dei modelli e della cache di ogni strumento. Un link simbolico è accettabile solo quando il controllo del mount viene eseguito per primo e la destinazione non cambia tra un riavvio e l'altro.

Gli operatori della community che valutano un NAS separato individuano ripetutamente nei tempi di caricamento dei modelli il fattore decisivo. In una discussione su workstation IA e NAS, i partecipanti hanno consigliato di mantenere i modelli usati di frequente sull'NVMe locale, perché i pesi di grandi dimensioni possono richiedere minuti per attraversare un collegamento più lento.

Usa una lista consentita per la cache locale attiva invece di replicare l'intero NAS. Dopo un caricamento o una copia riusciti, verifica la dimensione del file o il checksum, quindi aggiorna un alias atomico come current/model-name. Rimuovi solo i modelli che non sono né in esecuzione né bloccati. Mantieni almeno il valore maggiore tra il 15 percento di spazio libero e un download del modello massimo previsto, così un aggiornamento non potrà riempire il volume di avvio a metà operazione.

Proteggi manifest e fine-tuning, non ogni download

Esegui il backup delle informazioni necessarie per ricostruire la libreria: URL di origine o ID del repository, revisione esatta, nome del file, quantizzazione, checksum, note sulla licenza, configurazione del runtime e percorso utilizzato in produzione. Questo manifest è piccolo, consultabile e più utile durante il ripristino rispetto a una directory piena di file dai nomi ambigui.

Esegui il backup di adattatori unici, modelli uniti, dati di calibrazione e risultati delle valutazioni con una normale conservazione versionata. Per i pesi di base pubblici, stabilisci se il tempo di ripristino giustifica una copia aggiuntiva. Una connessione Internet lenta o un modello che potrebbe scomparire possono rendere utile proteggere determinati pesi, ma replicare ogni esperimento di solito spreca capacità di backup.

Se il livello più ampio dei file IA non è ancora definito, il confronto di ZimaSpace tra cloud personale e storage locale sul PC per i file IA è il passaggio successivo nella pianificazione. Separa i dati sorgente persistenti e gli indici dalla macchina che esegue l'inferenza.

Convalida tempi di caricamento, comportamento offline e soglia di espansione

Testa tre percorsi con il servizio dei modelli arrestato: un caricamento locale del set attivo, un caricamento freddo dal NAS e un'interruzione del NAS. Registra il tempo fino alla prima risposta utilizzabile, il throughput di rete massimo, lo spazio libero della workstation prima e dopo e l'eventuale creazione, da parte di uno strumento, di una directory di fallback sul disco di avvio. Ripeti dopo un riavvio, così l'ordine dei mount viene verificato invece di essere dato per scontato.

La configurazione è valida quando i modelli quotidiani vengono caricati localmente entro il tempo previsto, i modelli freddi possono essere preparati senza modificare manualmente i percorsi, gli artefatti unici vengono ripristinati dal backup e l'assenza del NAS produce un errore chiaro invece di un download silenzioso. Aggiungi una rete più veloce o un livello locale più grande solo quando il ritardo misurato nel caricamento freddo interrompe il lavoro; aggiungi capacità al NAS quando la libreria canonica si avvicina al limite di spazio libero definito.

Smetti di usare letture dirette dalla rete per un carico di lavoro che esegue ripetutamente ricerche tra frammenti di modelli, richiede una latenza di avvio bassa e prevedibile o deve operare mentre il NAS è offline. In tal caso, conserva il NAS come libreria e copia i modelli completi su un SSD locale dedicato più grande prima dell'avvio.

Regola finale di configurazione

Mantieni la libreria canonica dei modelli nello storage condiviso, fissa il set di lavoro quotidiano sull'NVMe locale, isola le cache temporanee e proteggi solo gli artefatti e i manifest che non possono essere ricreati. Espandi la configurazione dopo che il tempo di caricamento o la capacità ha superato una soglia definita per iscritto.

Configurazione NAS e Server

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.