Mantenha um conjunto pequeno e ativo no NVMe da estação de trabalho, coloque a biblioteca de modelos maior no armazenamento partilhado e faça com que cada runtime utilize caminhos explícitos.
Este esquema funciona quando os pesos dos modelos são maioritariamente lidos durante o arranque, a rede consegue proporcionar tempos de carregamento aceitáveis e os fine-tunes insubstituíveis estão protegidos separadamente dos ficheiros descarregáveis. Falha quando todas as caches recuam silenciosamente para o SSD de arranque ou quando a ausência do NAS faz com que o serviço de inferência volte a descarregar os modelos para um novo diretório local.
Classifique os ficheiros de modelos por conjunto de trabalho e custo de reconstrução
Comece por fazer um inventário, em vez de mover um diretório de cache enorme. Os pesos base e as variantes quantizadas podem ser descarregados novamente, mas os adaptadores, fine-tunes, modelos de prompts, manifestos, resultados de avaliação e ficheiros convertidos localmente podem ser únicos. Marque cada item como ativo, morno, frio ou insubstituível e registe qual aplicação é responsável pelo respetivo caminho.
O conjunto ativo contém os modelos utilizados diariamente e deve caber num orçamento fixo da estação de trabalho. Os modelos mornos podem ficar no NAS e ser copiados localmente antes de um projeto. As experiências frias podem permanecer apenas na biblioteca partilhada. Os resultados insubstituíveis precisam de cópias de segurança com versões, mesmo que o modelo principal possa ser descarregado novamente.
Esta classificação evita dois erros comuns: fazer cópias de segurança de centenas de gigabytes fáceis de recriar e eliminar um pequeno adaptador ou manifesto que não pode ser recriado de forma económica. Também fornece o primeiro valor de capacidade: o tamanho do conjunto ativo mais espaço livre para um modelo recebido, e não o tamanho de todos os modelos que poderá testar.
Atribua funções ao NVMe local, ao armazenamento partilhado e ao arquivo
Um cluster de IA local real armazenou ficheiros de modelos num NAS e carregou-os através de 10GbE, demonstrando que o padrão é viável quando a rede e o percurso de armazenamento são concebidos para leituras grandes. A lição útil desse fluxo de disponibilização de modelos baseado em NAS é a separação de funções: a biblioteca partilhada é a fonte, enquanto a computação e a memória permanecem no nó de inferência.
| Função do armazenamento | Conteúdo recomendado | Comportamento em caso de falha | Controlo |
|---|---|---|---|
| Nível ativo do NVMe da estação de trabalho | Modelos atuais, ficheiros de tokenização, cache ativa do runtime | A inferência continua se o NAS estiver indisponível | Quota de tamanho rígida e limpeza dos itens menos recentemente utilizados |
| Biblioteca de modelos no NAS | Pesos aprovados, quantizações, revisões partilhadas | Novos carregamentos são interrompidos; o modelo ativo em memória pode continuar | Partilha maioritariamente só de leitura e somas de verificação |
| Armazenamento de projetos protegido | Fine-tunes, adaptadores, manifestos, resultados de avaliação | A reconstrução depende da cópia de segurança | Snapshots e cópia de segurança independente |
| Espaço temporário | Descargas parciais, conversões, fragmentos temporários | É seguro eliminar | Caminho separado com expiração automática |
Não aponte todos os runtimes para a mesma pasta de rede com permissões de escrita. Uma conversão falhada, uma tarefa de limpeza ou uma alteração de versão poderia modificar ficheiros utilizados por outra ferramenta. Mantenha a biblioteca canónica maioritariamente só de leitura, prepare as alterações no espaço temporário, verifique-as e promova deliberadamente os artefactos concluídos.
Crie um caminho de modelos previsível e uma política de cache
Escolha uma montagem canónica, como /srv/models no Linux, ou uma letra de unidade estável no Windows, e disponibilize-a antes de iniciar o Ollama, o vLLM, o LM Studio ou os contentores de desenvolvimento. Configure explicitamente as definições de modelos e de cache de cada ferramenta. Um link simbólico é aceitável apenas quando a verificação da montagem é executada primeiro e o destino nunca muda entre reinícios.
Os operadores da comunidade que consideram um NAS separado identificam repetidamente o tempo de carregamento dos modelos como o fator decisivo. Numa discussão sobre uma estação de trabalho de IA e um NAS, os participantes recomendaram manter os modelos utilizados com frequência no NVMe local, porque os pesos grandes podem demorar minutos a atravessar uma ligação mais lenta.
Utilize uma lista de permissões para a cache local de modelos ativos, em vez de espelhar todo o NAS. Depois de um carregamento ou cópia bem-sucedidos, verifique o tamanho ou a soma de verificação do ficheiro e, em seguida, atualize um alias atómico, como current/model-name. Expulse apenas os modelos que não estejam em execução nem fixados. Mantenha pelo menos o maior valor entre 15 por cento de espaço livre e uma descarga do modelo máximo esperado, para que uma atualização não consiga encher o volume de arranque a meio do processo.
Proteja manifestos e fine-tunes, não todas as descargas
Faça cópias de segurança das informações necessárias para reconstruir a biblioteca: URL de origem ou ID do repositório, revisão exata, nome do ficheiro, quantização, soma de verificação, notas sobre a licença, configuração do runtime e caminho utilizado em produção. Esse manifesto é pequeno, pesquisável e mais útil durante a recuperação do que um diretório cheio de ficheiros com nomes ambíguos.
Faça cópias de segurança dos adaptadores únicos, modelos fundidos, dados de calibração e resultados de avaliação com uma retenção normalizada e baseada em versões. Para pesos base públicos, decida se o tempo de recuperação justifica outra cópia. Uma ligação à Internet lenta ou um modelo que possa desaparecer pode tornar certos pesos dignos de proteção, mas espelhar todas as experiências costuma desperdiçar capacidade de cópia de segurança.
Se a camada mais ampla de ficheiros de IA ainda não estiver decidida, a comparação da ZimaSpace entre uma nuvem pessoal e o armazenamento local no PC para ficheiros de IA é o próximo passo de planeamento. Separa os dados de origem persistentes e os índices da máquina que executa a inferência.
Valide o tempo de carregamento, o comportamento offline e o fator de expansão
Teste três percursos com o serviço de modelos parado: um carregamento local de um modelo ativo, um carregamento frio a partir do NAS e uma falha do NAS. Registe o tempo até à primeira resposta utilizável, o débito máximo da rede, o espaço livre na estação de trabalho antes e depois e se alguma ferramenta cria um diretório alternativo no disco de arranque. Repita depois de reiniciar, para testar a ordem de montagem em vez de a assumir.
A configuração é aprovada quando os modelos diários carregam localmente dentro do tempo esperado, os modelos frios podem ser preparados sem edições manuais dos caminhos, os artefactos únicos são restaurados a partir da cópia de segurança e a ausência do NAS produz uma falha clara em vez de uma nova descarga silenciosa. Adicione uma rede mais rápida ou um nível local maior apenas quando o atraso medido no carregamento frio interromper o trabalho; adicione capacidade ao NAS quando a biblioteca canónica se aproximar do limite de espaço livre definido.
Deixe de utilizar leituras diretas através da rede para uma carga de trabalho que procure repetidamente fragmentos de modelos, exija uma latência de arranque previsível e baixa ou tenha de funcionar enquanto o NAS estiver offline. Nesse caso, mantenha o NAS como biblioteca e copie modelos completos para um SSD local dedicado maior antes do arranque.
Regra final de configuração
Mantenha a biblioteca canónica de modelos no armazenamento partilhado, fixe o conjunto de trabalho diário no NVMe local, isole as caches descartáveis e proteja apenas os artefactos e manifestos que não possam ser recriados. Expanda depois de o tempo de carregamento ou a capacidade medida ultrapassar um limite definido por escrito.
Configuração de NAS e Servidor
Mais para Ler

Uma configuração RAG local para artigos de investigação, notas e documentos privados
Mantenha os documentos originais como fonte de autoridade, torne a indexação repetível, exija citações e separe os modelos substituíveis dos dados de origem privados.

Porque estão os programadores a utilizar um nó de gateway para DNS privado, VPN e aplicações de teste?
Um nó de gateway dá às aplicações privadas um único nome e caminho de acesso controlados, enquanto os nós de computação permanecem não expostos...

Como criar uma pilha de aplicações reproduzível com ficheiros Compose, segredos e dados persistentes separados
Mantenha as definições do Compose portáteis, proteja os segredos e faça cópias de segurança independentes dos dados das aplicações para que a stack possa...

