Oui, les fragments d’un modèle peuvent être stockés sur un NAS tandis qu’un autre ordinateur domestique les exécute, à condition que l’environnement d’exécution puisse lire un point de contrôle complet et cohérent.
Une station de travail équipée d’un GPU n’a pas besoin d’héberger en permanence chaque fichier du modèle. Elle peut monter un partage NAS, charger le point de contrôle demandé dans la RAM ou la VRAM, puis effectuer l’inférence localement, tandis que le NAS reste la bibliothèque durable. La distinction importante concerne le moment où chaque ressource intervient : le stockage fournit les octets lors du chargement et des accès mémoire occasionnels, tandis que le processeur et l’accélérateur de l’ordinateur exécutent les opérations sur les tenseurs une fois ces octets adressables.
Les fragments répartissent le stockage, pas automatiquement le calcul
Un point de contrôle fragmenté répartit les tenseurs d’un modèle entre plusieurs fichiers afin qu’aucun fichier ne devienne ingérable. Un index indique quel tenseur appartient à quel fragment. Cela facilite le téléchargement, le stockage et le chargement, mais cela ne signifie pas que chaque disque NAS ou chaque ordinateur domestique exécute un fragment. La répartition au repos et l’exécution parallèle sont deux décisions architecturales distinctes.
Transformers peut charger des points de contrôle fragmentés en lisant l’index et en chargeant chaque fichier de poids dans le modèle. Le nœud de calcul doit toujours disposer d’une carte des périphériques indiquant où placer les tenseurs : sur le CPU, le GPU ou le disque. Le simple fait de placer les fichiers de fragments dans différents dossiers ne crée pas de parallélisme des tenseurs et ne combine pas la VRAM de plusieurs machines indépendantes.
Dans une installation domestique, il est préférable de considérer le NAS comme le référentiel des modèles et le point de référence de leur provenance. Conservez la configuration, les fichiers du tokenizer, les index de fragments, les sommes de contrôle et les métadonnées de licence à côté des poids. La station de travail est le nœud d’exécution. Cette séparation entre stockage et calcul apparaît également dans une architecture NAS et nœud de calcul, où les contenus multimédias ou les documents restent centralisés tandis qu’un matériel spécialisé gère l’inférence.
Le démarrage à froid dépend du transfert des octets sur le réseau
Avant l’inférence, le nœud de calcul doit lire suffisamment du point de contrôle pour créer la disposition d’exécution. Un modèle de 40 Go ne peut pas démarrer comme un petit fichier de configuration : ces octets doivent traverser le réseau local, sauf si un cache local valide existe déjà. Une liaison 1 GbE atteint théoriquement près de 125 Mo/s avant la prise en compte des surcharges de protocole ; le chargement à froid de fichiers volumineux peut donc prendre plusieurs minutes.
Les environnements d’exécution peuvent utiliser des fichiers de modèles mappés en mémoire, ce qui permet au système d’exploitation de récupérer les pages à la demande et de les conserver dans le cache de pages. Sur un système de fichiers réseau, un défaut de cache peut devenir une lecture réseau pendant l’inférence. Cela peut réduire le temps de chargement initial, mais aussi déplacer la latence vers les premiers prompts et rendre les performances sensibles à l’éviction du cache ou à la charge du NAS.
Un cache NVMe local améliore l’expérience sans dupliquer la source de référence. La station de travail peut copier une version vérifiée du modèle depuis le NAS une seule fois, l’exécuter depuis le stockage local, puis la supprimer ou l’actualiser selon un manifeste. Le NAS reste la source faisant autorité ; le cache absorbe les lectures répétées. Une bande passante réseau supérieure accélère le démarrage à froid, mais n’augmente pas la vitesse de génération des tokens une fois les poids actifs et le cache résidents.
La cohérence et la sémantique des fichiers définissent les limites de fiabilité
Un chargeur s’attend à ce que chaque fragment et son index décrivent la même révision du modèle. Si une tâche de synchronisation remplace des fichiers pendant qu’un autre ordinateur charge le modèle, le résultat peut combiner d’anciens et de nouveaux fragments ou échouer à la vérification de la somme de contrôle. Le verrouillage des fichiers, les échanges atomiques de répertoires, les dossiers de versions immuables et un manifeste finalisé empêchent les lecteurs d’observer un point de contrôle publié partiellement.
Les frameworks distribués tiennent explicitement compte de la coordination du stockage. L’API de points de contrôle distribués de PyTorch prend en charge les lecteurs de stockage et le repartitionnement au chargement pour les applications distribuées compatibles. Cela diffère du montage d’un partage générique en espérant que n’importe quel environnement d’exécution puisse interpréter les fragments d’entraînement. Les formats d’inférence, les noms des tenseurs, la quantification et le placement des périphériques doivent toujours correspondre au moteur sélectionné.
L’affirmation selon laquelle le NAS peut assurer l’exécution atteint ses limites lorsque l’environnement d’exécution exige des fichiers locaux, que les verrous réseau se comportent différemment de ce qui était prévu, qu’une liaison Wi-Fi se coupe pendant des défauts de page ou que l’ensemble de travail dépasse régulièrement la RAM. Elle échoue également lorsque les « fragments » sont liés à une topologie d’entraînement plutôt qu’à un point de contrôle d’inférence portable. Convertissez ou consolidez le modèle avant son déploiement au lieu de considérer toutes les dispositions de points de contrôle comme interchangeables.
Utilisez un test de stockage en trois exécutions
Mesurez une exécution réseau à froid après avoir vidé le cache de la station de travail, une exécution à chaud depuis le cache du système d’exploitation et une exécution depuis le cache local du SSD. Relevez le délai avant que le modèle soit prêt, le délai avant le premier token, le nombre de tokens par seconde en régime établi, le volume d’octets lus sur le réseau après le démarrage et l’impact d’autres charges NAS sur le résultat. Ces trois exécutions permettent de distinguer le temps de transfert de la vitesse d’exécution.
Une analyse dédiée du stockage au démarrage à froid des modèles explique pourquoi le format, le mappage mémoire, le cache de pages et les E/S concurrentes sont importants avant le début de la génération. Associez ce test au niveau du modèle à des sommes de contrôle des fichiers du référentiel. Un chargement rapide de la mauvaise révision est pire qu’un chargement plus lent, mais reproductible.
Utilisez l’exécution directe depuis le NAS lorsque les démarrages à froid sont rares, que le réseau est stable et que l’ensemble de travail reste en cache. Préférez la mise en cache locale lorsque les modèles démarrent souvent ou que la latence est importante. Si les lectures réseau continuent pendant la génération, réduisez la pression sur la pagination ou copiez le modèle localement avant de moderniser le réseau local. Le critère de réussite n’est pas que le modèle s’ouvre, mais que son chargement soit reproductible et qu’il ne dépende pas, en cours d’exécution, d’un accès fragile au stockage.
| Test | Ce qu’il mesure | Décision probable |
|---|---|---|
| Chargement à froid depuis le NAS | Débit du réseau local et du stockage | À accepter pour les démarrages peu fréquents |
| Chargement à chaud depuis le NAS | Bénéfice du cache de pages | Utile si le cache reste stable |
| Cache local sur SSD | Limite du stockage du nœud d’exécution | À privilégier lorsque le démarrage est important |
FAQ
Deux ordinateurs peuvent-ils utiliser les mêmes fichiers de modèle simultanément ?
Oui, s’ils ouvrent en lecture seule une version immuable du modèle. Chaque ordinateur charge néanmoins son propre état d’exécution et son propre cache KV. Les lecteurs simultanés ne partagent pas automatiquement la RAM, la VRAM ni le contexte généré.
Le 10GbE rend-il l’inférence plus rapide ?
Il peut réduire la durée des chargements à froid volumineux et les délais liés aux défauts de page. Une fois les poids résidents, la génération est généralement limitée par la puissance de calcul et la bande passante mémoire du nœud d’exécution plutôt que par le débit du NAS.
Les fichiers fractionnés GGUF sont-ils identiques aux fragments d’entraînement ?
Non. Les deux répartissent les données entre plusieurs fichiers, mais leurs métadonnées, leurs règles de chargement et leurs environnements d’exécution prévus diffèrent. Vérifiez que le moteur d’inférence prend en charge le format fractionné exact avant de considérer la copie du NAS comme exécutable.
Centre Tech & IA
Plus à lire

Comment mesurer la qualité de la récupération RAG locale et interpréter le rappel, la précision et la couverture des citations
Créez un jeu de test RAG local, calculez les principales métriques de récupération, interprétez leurs compromis et vérifiez si les affirmations des réponses sont...

Pourquoi le calcul des fonctionnalités de la maison intelligente devient-il plus important lorsque le nombre de capteurs augmente à fréquence d’échantillonnage constante ?
Suivez les calculs par capteur et intercapteurs à mesure que le nombre d’appareils augmente, identifiez les coûts de fusion non linéaires et évaluez les...

Pourquoi le coût de l’évaluation du RAG devient-il plus important à mesure que la bibliothèque de documents s’agrandit, pour un même volume de requêtes ?
Comprenez pourquoi l’augmentation du corpus accroît l’effort d’évaluation du RAG sans augmenter le nombre de requêtes des utilisateurs, et comment les tests stratifiés maintiennent...

