So speichern Sie lokale LLM-Modelle, ohne die SSD der Workstation zu füllen

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Halten Sie einen kleinen Hot-Bestand auf der NVMe des Arbeitsplatzrechners, legen Sie die größere Modellbibliothek auf dem gemeinsam genutzten Speicher ab und verwenden Sie in jeder Laufzeitumgebung explizite Pfade.

Dieses Layout funktioniert, wenn die Modellgewichte beim Start größtenteils nur gelesen werden, das Netzwerk akzeptable Ladezeiten ermöglicht und unersetzliche Fine-Tunes getrennt von herunterladbaren Dateien geschützt sind. Es scheitert, wenn jeder Cache stillschweigend auf die Boot-SSD zurückfällt oder ein fehlendes NAS den Inferenzdienst dazu bringt, Modelle erneut in ein neues lokales Verzeichnis herunterzuladen.

Ordnen Sie Modelldateien nach Arbeitssatz und Wiederherstellungsaufwand

Beginnen Sie mit einer Bestandsaufnahme, statt ein einziges riesiges Cache-Verzeichnis zu verschieben. Basisgewichte und quantisierte Varianten können möglicherweise erneut heruntergeladen werden, aber Adapter, Fine-Tunes, Prompt-Vorlagen, Manifeste, Evaluierungsergebnisse und lokal konvertierte Dateien können einzigartig sein. Kennzeichnen Sie jedes Element als heiß, warm, kalt oder unersetzlich und halten Sie anschließend fest, welcher Anwendung sein Pfad gehört.

Der Hot-Bestand enthält täglich verwendete Modelle und sollte in ein festgelegtes Budget des Arbeitsplatzrechners passen. Warme Modelle können auf dem NAS liegen und vor einem Projekt lokal kopiert werden. Kalte Experimente können ausschließlich in der gemeinsam genutzten Bibliothek verbleiben. Unersetzliche Ergebnisse benötigen eine versionierte Sicherung, selbst wenn ihr übergeordnetes Modell erneut heruntergeladen werden kann.

Diese Klassifizierung verhindert zwei häufige Fehler: Hunderte Gigabyte zu sichern, die leicht neu erstellt werden können, und einen kleinen Adapter oder ein Manifest zu löschen, der bzw. das sich nicht kostengünstig rekonstruieren lässt. Sie liefert außerdem die erste Kapazitätszahl: Größe des Hot-Bestands plus freier Speicher für ein eingehendes Modell, nicht die Größe jedes Modells, das Sie jemals testen könnten.

Weisen Sie lokaler NVMe, gemeinsam genutztem Speicher und Archiv Rollen zu

In einem realen lokalen KI-Cluster wurden Modelldateien auf einem NAS gespeichert und über 10GbE geladen. Das zeigt, dass dieses Muster funktioniert, wenn Netzwerk und Speicherpfad für große Lesevorgänge ausgelegt sind. Die wichtigste Erkenntnis aus diesem Workflow für die Modellbereitstellung mit NAS-Unterstützung ist die Trennung der Rollen: Die gemeinsam genutzte Bibliothek ist die Quelle, während Rechenleistung und Arbeitsspeicher auf dem Inferenzknoten verbleiben.

Speicherrolle Empfohlene Inhalte Fehlerverhalten Steuerung
Hot-Tier auf der Arbeitsplatz-NVMe Aktuelle Modelle, Tokenizer-Dateien, aktiver Laufzeit-Cache Die Inferenz läuft weiter, wenn das NAS nicht verfügbar ist Feste Größenbegrenzung und Bereinigung nach dem Least-Recently-Used-Prinzip
Modellbibliothek auf dem NAS Freigegebene Gewichte, Quantisierungen, gemeinsam genutzte Revisionen Neue Ladevorgänge pausieren; das aktive Modell im Arbeitsspeicher kann weiterlaufen Freigabe mit überwiegendem Lesezugriff und Prüfsummen
Geschützter Projektspeicher Fine-Tunes, Adapter, Manifeste, Evaluierungsergebnisse Die Wiederherstellung hängt von der Sicherung ab Snapshots plus unabhängige Sicherung
Arbeitsbereich Teilweise Downloads, Konvertierungen, temporäre Shards Kann sicher gelöscht werden Separater Pfad mit automatischem Ablauf

Richten Sie nicht jede Laufzeitumgebung auf denselben beschreibbaren Netzwerkordner. Eine fehlgeschlagene Konvertierung, ein Bereinigungsjob oder eine Versionsänderung könnte Dateien verändern, die von einem anderen Tool verwendet werden. Halten Sie die kanonische Bibliothek überwiegend schreibgeschützt, führen Sie Änderungen im Arbeitsbereich durch, überprüfen Sie sie und übernehmen Sie fertige Artefakte bewusst.

Erstellen Sie einen vorhersehbaren Modellpfad und eine klare Cache-Richtlinie

Wählen Sie einen kanonischen Einhängepunkt wie /srv/models unter Linux oder einen stabilen Laufwerksbuchstaben unter Windows und stellen Sie ihn bereit, bevor Ollama, vLLM, LM Studio oder Entwicklungscontainer starten. Konfigurieren Sie die Modell- und Cache-Einstellungen jedes Tools ausdrücklich. Ein symbolischer Link ist nur dann akzeptabel, wenn die Einhängeprüfung zuerst ausgeführt wird und sich das Ziel zwischen Neustarts niemals ändert.

Community-Betreiber, die ein separates NAS in Betracht ziehen, sehen die Ladezeit von Modellen wiederholt als entscheidenden Punkt. In einer Diskussion über KI-Arbeitsplätze und ein separates NAS für LLM-Speicher empfahlen Beteiligte, häufig verwendete Modelle auf lokaler NVMe zu halten, da das Übertragen großer Gewichte über eine langsamere Verbindung Minuten dauern kann.

Verwenden Sie eine Positivliste für den lokalen Hot-Cache, statt das gesamte NAS zu spiegeln. Überprüfen Sie nach einem erfolgreichen Laden oder Kopieren die Dateigröße oder Prüfsumme und aktualisieren Sie anschließend einen atomaren Alias wie current/model-name. Entfernen Sie nur Modelle, die weder ausgeführt noch angeheftet sind. Halten Sie mindestens den größeren Wert aus 15 Prozent freiem Speicher oder einem maximal erwarteten Modelldownload frei, damit ein Update das Boot-Volume nicht auf halbem Weg füllt.

Sichern Sie Manifeste und Fine-Tunes, nicht jeden Download

Sichern Sie die Informationen, die zum Wiederaufbau der Bibliothek erforderlich sind: Quell-URL oder Repository-ID, exakte Revision, Dateiname, Quantisierung, Prüfsumme, Lizenzhinweise, Laufzeitkonfiguration und den in der Produktion verwendeten Pfad. Dieses Manifest ist klein, durchsuchbar und bei der Wiederherstellung nützlicher als ein Verzeichnis voller mehrdeutig benannter Dateien.

Sichern Sie einzigartige Adapter, zusammengeführte Modelle, Kalibrierungsdaten und Evaluierungsergebnisse mit einer normalen versionierten Aufbewahrung. Entscheiden Sie bei öffentlichen Basisgewichten, ob die Wiederherstellungszeit eine weitere Kopie rechtfertigt. Eine langsame Internetverbindung oder ein Modell, das möglicherweise verschwindet, kann den Schutz ausgewählter Gewichte sinnvoll machen, aber das Spiegeln jedes Experiments verschwendet meist Sicherungskapazität.

Wenn die umfassendere KI-Dateiebene noch nicht festgelegt ist, ist der ZimaSpace-Vergleich einer persönlichen Cloud und lokalem PC-Speicher für KI-Dateien der nächste Planungsschritt. Er trennt dauerhafte Quelldaten und Indizes von der Maschine, die die Inferenz ausführt.

Überprüfen Sie Ladezeit, Offline-Verhalten und den Auslöser für eine Erweiterung

Testen Sie bei beendetem Modelldienst drei Pfade: das lokale Laden eines heißen Modells, das Laden eines kalten Modells vom NAS und einen NAS-Ausfall. Erfassen Sie die Zeit bis zur ersten nutzbaren Antwort, den maximalen Netzwerkdurchsatz, den freien Speicherplatz des Arbeitsplatzrechners vor und nach dem Vorgang sowie, ob ein Tool ein Ausweichverzeichnis auf der Boot-Festplatte erstellt. Wiederholen Sie den Test nach einem Neustart, damit die Reihenfolge der Einbindungen geprüft und nicht nur vorausgesetzt wird.

Die Einrichtung ist erfolgreich, wenn täglich verwendete Modelle innerhalb der erwarteten Zeit lokal geladen werden, kalte Modelle ohne manuelle Pfadänderungen bereitgestellt werden können, einzigartige Artefakte aus der Sicherung wiederhergestellt werden und ein fehlendes NAS einen klaren Fehler statt eines stillen erneuten Downloads verursacht. Fügen Sie nur dann ein schnelleres Netzwerk oder ein größeres lokales Tier hinzu, wenn die gemessene Verzögerung beim Laden kalter Modelle die Arbeit unterbricht. Erweitern Sie die NAS-Kapazität, wenn sich die kanonische Bibliothek ihrem festgelegten Mindestwert für freien Speicher nähert.

Verwenden Sie keine direkten Netzwerkzugriffe für eine Arbeitslast, die wiederholt über Modell-Shards hinweg zufällig zugreift, eine vorhersehbar niedrige Startlatenz erfordert oder funktionieren muss, während das NAS offline ist. Bewahren Sie in diesem Fall das NAS als Bibliothek auf und kopieren Sie vollständige Modelle vor dem Start auf eine größere dedizierte lokale SSD.

Abschließende Einrichtungsregel

Halten Sie die kanonische Modellbibliothek auf dem gemeinsam genutzten Speicher, heften Sie den täglichen Arbeitssatz auf der lokalen NVMe an, isolieren Sie wegwerfbare Caches und schützen Sie nur die Artefakte und Manifeste, die nicht neu erstellt werden können. Erweitern Sie erst, wenn die gemessene Ladezeit oder Kapazität einen schriftlich festgelegten Schwellenwert überschreitet.

NAS- und Servereinrichtung

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.