Cómo almacenar modelos LLM locales sin llenar el SSD de la estación de trabajo

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

Mantén un conjunto pequeño y frecuente en la unidad NVMe de la estación de trabajo, coloca la biblioteca de modelos más grande en el almacenamiento compartido y haz que cada entorno de ejecución use rutas explícitas.

Esta distribución funciona cuando los pesos de los modelos se leen principalmente durante el inicio, la red puede ofrecer tiempos de carga aceptables y los ajustes finos irremplazables están protegidos por separado de los archivos descargables. Falla cuando cada caché recurre silenciosamente al SSD de arranque o cuando la ausencia del NAS hace que el servicio de inferencia vuelva a descargar los modelos en un directorio local nuevo.

Clasifica los archivos de modelos por conjunto de trabajo y coste de reconstrucción

Empieza con un inventario en lugar de mover un único directorio de caché enorme. Los pesos base y las variantes cuantizadas pueden volver a descargarse, pero los adaptadores, ajustes finos, plantillas de prompts, manifiestos, resultados de evaluación y archivos convertidos localmente pueden ser únicos. Marca cada elemento como frecuente, templado, frío o irremplazable, y registra qué aplicación es propietaria de su ruta.

El conjunto frecuente contiene los modelos que se usan a diario y debería caber dentro de un presupuesto fijo de la estación de trabajo. Los modelos templados pueden vivir en el NAS y copiarse localmente antes de un proyecto. Los experimentos fríos pueden permanecer únicamente en la biblioteca compartida. Los resultados irremplazables necesitan copias de seguridad con versiones, aunque su modelo principal pueda volver a descargarse.

Esta clasificación evita dos errores comunes: hacer copias de seguridad de cientos de gigabytes fáciles de recrear y eliminar un adaptador o manifiesto pequeño que no puede recrearse de forma económica. También proporciona la primera cifra de capacidad: el tamaño del conjunto frecuente más espacio libre para un modelo entrante, no el tamaño de todos los modelos que puedas probar algún día.

Asigna funciones a la unidad NVMe local, el almacenamiento compartido y el archivo

Un clúster de IA local real almacenó archivos de modelos en un NAS y los cargó mediante 10GbE, demostrando que el patrón es viable cuando la red y la ruta de almacenamiento están diseñadas para lecturas grandes. La lección útil de ese flujo de servicio de modelos respaldado por NAS es la separación de funciones: la biblioteca compartida es la fuente, mientras que el cómputo y la memoria permanecen en el nodo de inferencia.

Función del almacenamiento Contenido recomendado Comportamiento ante fallos Control
Nivel frecuente de la NVMe de la estación de trabajo Modelos actuales, archivos de tokenización, caché activa del entorno de ejecución La inferencia continúa si el NAS no está disponible Cuota de tamaño estricta y limpieza de los elementos menos usados recientemente
Biblioteca de modelos del NAS Pesos aprobados, cuantizaciones, revisiones compartidas Las nuevas cargas se pausan; el modelo activo en memoria puede continuar Recurso compartido principalmente de solo lectura y sumas de comprobación
Almacén de proyectos protegido Ajustes finos, adaptadores, manifiestos, resultados de evaluación La reconstrucción depende de la copia de seguridad Instantáneas más una copia de seguridad independiente
Espacio temporal Descargas parciales, conversiones, fragmentos temporales Se puede eliminar sin riesgos Ruta independiente con caducidad automática

No dirijas todos los entornos de ejecución a la misma carpeta de red con permisos de escritura. Una conversión fallida, una tarea de limpieza o un cambio de versión podría modificar archivos utilizados por otra herramienta. Mantén la biblioteca canónica principalmente en modo de solo lectura, prepara los cambios en el espacio temporal, verifícalos y promociona deliberadamente los artefactos terminados.

Construye una ruta de modelos y una política de caché predecibles

Elige un punto de montaje canónico, como /srv/models en Linux o una letra de unidad estable en Windows, y haz que esté disponible antes de iniciar Ollama, vLLM, LM Studio o los contenedores de desarrollo. Configura explícitamente los ajustes de modelos y caché de cada herramienta. Un enlace simbólico es aceptable solo cuando la comprobación del montaje se ejecuta primero y el destino nunca cambia entre reinicios.

Los operadores de la comunidad que evalúan un NAS independiente identifican repetidamente el tiempo de carga de los modelos como el límite. En un debate sobre una estación de trabajo de IA y un NAS, los participantes recomendaron mantener los modelos usados con frecuencia en la NVMe local porque los pesos grandes pueden tardar minutos en atravesar un enlace más lento.

Usa una lista de permitidos para la caché local frecuente en lugar de replicar todo el NAS. Después de una carga o copia correcta, verifica el tamaño del archivo o la suma de comprobación y actualiza un alias atómico como current/model-name. Expulsa únicamente los modelos que no estén ejecutándose ni fijados. Mantén libre al menos el mayor valor entre el 15 por ciento del espacio o una descarga del modelo máximo esperado, para que una actualización no llene el volumen de arranque a mitad del proceso.

Protege los manifiestos y los ajustes finos, no todas las descargas

Haz copias de seguridad de la información necesaria para reconstruir la biblioteca: URL de origen o ID del repositorio, revisión exacta, nombre de archivo, cuantización, suma de comprobación, notas de licencia, configuración del entorno de ejecución y ruta utilizada en producción. Ese manifiesto es pequeño, fácil de buscar y más útil durante la recuperación que un directorio lleno de archivos con nombres ambiguos.

Haz copias de seguridad de los adaptadores únicos, modelos fusionados, datos de calibración y resultados de evaluación con una retención normal y versionada. En el caso de los pesos base públicos, decide si el tiempo de recuperación justifica conservar otra copia. Una conexión a Internet lenta o un modelo que pueda desaparecer pueden hacer que valga la pena proteger determinados pesos, pero replicar cada experimento suele desperdiciar capacidad de copia de seguridad.

Si la capa de archivos de IA más amplia todavía no está decidida, la comparación de ZimaSpace entre una nube personal y el almacenamiento local del PC para archivos de IA es el siguiente paso de planificación. Separa los datos de origen persistentes y los índices de la máquina que realiza la inferencia.

Valida el tiempo de carga, el comportamiento sin conexión y el desencadenante de ampliación

Prueba tres rutas con el servicio de modelos detenido: una carga local frecuente, una carga fría desde el NAS y una interrupción del NAS. Registra el tiempo hasta la primera respuesta utilizable, el rendimiento máximo de la red, el espacio libre de la estación de trabajo antes y después, y si alguna herramienta crea un directorio alternativo en el disco de arranque. Repite la prueba después de reiniciar para comprobar el orden de montaje en lugar de darlo por supuesto.

La configuración supera la prueba cuando los modelos diarios se cargan localmente dentro del tiempo esperado, los modelos fríos pueden prepararse sin editar manualmente las rutas, los artefactos únicos se restauran desde la copia de seguridad y la ausencia del NAS produce un fallo claro en lugar de una redescarga silenciosa. Añade una red más rápida o un nivel local más grande solo cuando el retraso medido de la carga fría interrumpa el trabajo; añade capacidad al NAS cuando la biblioteca canónica se acerque al límite definido de espacio libre.

Deja de usar lecturas directas de red para una carga de trabajo que realice búsquedas repetidas entre fragmentos de modelos, requiera una latencia de inicio baja y predecible o deba funcionar mientras el NAS está desconectado. En ese caso, conserva el NAS como biblioteca y copia los modelos completos en un SSD local dedicado de mayor tamaño antes del inicio.

Regla final de configuración

Mantén la biblioteca canónica de modelos en el almacenamiento compartido, fija el conjunto de trabajo diario en la NVMe local, aísla las cachés desechables y protege únicamente los artefactos y manifiestos que no puedan recrearse. Amplía la configuración después de que el tiempo de carga o la capacidad medida supere un umbral establecido por escrito.

Configuración de NAS y Servidor

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.