Como armazenar modelos LLM localmente sem encher o SSD da estação de trabalho

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

Mantenha um conjunto pequeno e ativo no NVMe da estação de trabalho, coloque a biblioteca de modelos maior no armazenamento partilhado e faça com que cada runtime utilize caminhos explícitos.

Este esquema funciona quando os pesos dos modelos são maioritariamente lidos durante o arranque, a rede consegue proporcionar tempos de carregamento aceitáveis e os fine-tunes insubstituíveis estão protegidos separadamente dos ficheiros descarregáveis. Falha quando todas as caches recuam silenciosamente para o SSD de arranque ou quando a ausência do NAS faz com que o serviço de inferência volte a descarregar os modelos para um novo diretório local.

Classifique os ficheiros de modelos por conjunto de trabalho e custo de reconstrução

Comece por fazer um inventário, em vez de mover um diretório de cache enorme. Os pesos base e as variantes quantizadas podem ser descarregados novamente, mas os adaptadores, fine-tunes, modelos de prompts, manifestos, resultados de avaliação e ficheiros convertidos localmente podem ser únicos. Marque cada item como ativo, morno, frio ou insubstituível e registe qual aplicação é responsável pelo respetivo caminho.

O conjunto ativo contém os modelos utilizados diariamente e deve caber num orçamento fixo da estação de trabalho. Os modelos mornos podem ficar no NAS e ser copiados localmente antes de um projeto. As experiências frias podem permanecer apenas na biblioteca partilhada. Os resultados insubstituíveis precisam de cópias de segurança com versões, mesmo que o modelo principal possa ser descarregado novamente.

Esta classificação evita dois erros comuns: fazer cópias de segurança de centenas de gigabytes fáceis de recriar e eliminar um pequeno adaptador ou manifesto que não pode ser recriado de forma económica. Também fornece o primeiro valor de capacidade: o tamanho do conjunto ativo mais espaço livre para um modelo recebido, e não o tamanho de todos os modelos que poderá testar.

Atribua funções ao NVMe local, ao armazenamento partilhado e ao arquivo

Um cluster de IA local real armazenou ficheiros de modelos num NAS e carregou-os através de 10GbE, demonstrando que o padrão é viável quando a rede e o percurso de armazenamento são concebidos para leituras grandes. A lição útil desse fluxo de disponibilização de modelos baseado em NAS é a separação de funções: a biblioteca partilhada é a fonte, enquanto a computação e a memória permanecem no nó de inferência.

Função do armazenamento Conteúdo recomendado Comportamento em caso de falha Controlo
Nível ativo do NVMe da estação de trabalho Modelos atuais, ficheiros de tokenização, cache ativa do runtime A inferência continua se o NAS estiver indisponível Quota de tamanho rígida e limpeza dos itens menos recentemente utilizados
Biblioteca de modelos no NAS Pesos aprovados, quantizações, revisões partilhadas Novos carregamentos são interrompidos; o modelo ativo em memória pode continuar Partilha maioritariamente só de leitura e somas de verificação
Armazenamento de projetos protegido Fine-tunes, adaptadores, manifestos, resultados de avaliação A reconstrução depende da cópia de segurança Snapshots e cópia de segurança independente
Espaço temporário Descargas parciais, conversões, fragmentos temporários É seguro eliminar Caminho separado com expiração automática

Não aponte todos os runtimes para a mesma pasta de rede com permissões de escrita. Uma conversão falhada, uma tarefa de limpeza ou uma alteração de versão poderia modificar ficheiros utilizados por outra ferramenta. Mantenha a biblioteca canónica maioritariamente só de leitura, prepare as alterações no espaço temporário, verifique-as e promova deliberadamente os artefactos concluídos.

Crie um caminho de modelos previsível e uma política de cache

Escolha uma montagem canónica, como /srv/models no Linux, ou uma letra de unidade estável no Windows, e disponibilize-a antes de iniciar o Ollama, o vLLM, o LM Studio ou os contentores de desenvolvimento. Configure explicitamente as definições de modelos e de cache de cada ferramenta. Um link simbólico é aceitável apenas quando a verificação da montagem é executada primeiro e o destino nunca muda entre reinícios.

Os operadores da comunidade que consideram um NAS separado identificam repetidamente o tempo de carregamento dos modelos como o fator decisivo. Numa discussão sobre uma estação de trabalho de IA e um NAS, os participantes recomendaram manter os modelos utilizados com frequência no NVMe local, porque os pesos grandes podem demorar minutos a atravessar uma ligação mais lenta.

Utilize uma lista de permissões para a cache local de modelos ativos, em vez de espelhar todo o NAS. Depois de um carregamento ou cópia bem-sucedidos, verifique o tamanho ou a soma de verificação do ficheiro e, em seguida, atualize um alias atómico, como current/model-name. Expulse apenas os modelos que não estejam em execução nem fixados. Mantenha pelo menos o maior valor entre 15 por cento de espaço livre e uma descarga do modelo máximo esperado, para que uma atualização não consiga encher o volume de arranque a meio do processo.

Proteja manifestos e fine-tunes, não todas as descargas

Faça cópias de segurança das informações necessárias para reconstruir a biblioteca: URL de origem ou ID do repositório, revisão exata, nome do ficheiro, quantização, soma de verificação, notas sobre a licença, configuração do runtime e caminho utilizado em produção. Esse manifesto é pequeno, pesquisável e mais útil durante a recuperação do que um diretório cheio de ficheiros com nomes ambíguos.

Faça cópias de segurança dos adaptadores únicos, modelos fundidos, dados de calibração e resultados de avaliação com uma retenção normalizada e baseada em versões. Para pesos base públicos, decida se o tempo de recuperação justifica outra cópia. Uma ligação à Internet lenta ou um modelo que possa desaparecer pode tornar certos pesos dignos de proteção, mas espelhar todas as experiências costuma desperdiçar capacidade de cópia de segurança.

Se a camada mais ampla de ficheiros de IA ainda não estiver decidida, a comparação da ZimaSpace entre uma nuvem pessoal e o armazenamento local no PC para ficheiros de IA é o próximo passo de planeamento. Separa os dados de origem persistentes e os índices da máquina que executa a inferência.

Valide o tempo de carregamento, o comportamento offline e o fator de expansão

Teste três percursos com o serviço de modelos parado: um carregamento local de um modelo ativo, um carregamento frio a partir do NAS e uma falha do NAS. Registe o tempo até à primeira resposta utilizável, o débito máximo da rede, o espaço livre na estação de trabalho antes e depois e se alguma ferramenta cria um diretório alternativo no disco de arranque. Repita depois de reiniciar, para testar a ordem de montagem em vez de a assumir.

A configuração é aprovada quando os modelos diários carregam localmente dentro do tempo esperado, os modelos frios podem ser preparados sem edições manuais dos caminhos, os artefactos únicos são restaurados a partir da cópia de segurança e a ausência do NAS produz uma falha clara em vez de uma nova descarga silenciosa. Adicione uma rede mais rápida ou um nível local maior apenas quando o atraso medido no carregamento frio interromper o trabalho; adicione capacidade ao NAS quando a biblioteca canónica se aproximar do limite de espaço livre definido.

Deixe de utilizar leituras diretas através da rede para uma carga de trabalho que procure repetidamente fragmentos de modelos, exija uma latência de arranque previsível e baixa ou tenha de funcionar enquanto o NAS estiver offline. Nesse caso, mantenha o NAS como biblioteca e copie modelos completos para um SSD local dedicado maior antes do arranque.

Regra final de configuração

Mantenha a biblioteca canónica de modelos no armazenamento partilhado, fixe o conjunto de trabalho diário no NVMe local, isole as caches descartáveis e proteja apenas os artefactos e manifestos que não possam ser recriados. Expanda depois de o tempo de carregamento ou a capacidade medida ultrapassar um limite definido por escrito.

Configuração de NAS e Servidor

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.