Un serveur IA domestique achemine les modèles en fonction de leur empreinte mémoire, en associant chaque requête à un modèle dont l’ensemble de travail complet tient dans la capacité disponible de l’appareil.
Un routeur local peut choisir entre de petits et de grands modèles de langage, des modèles d’embeddings, des encodeurs de vision, des systèmes vocaux et des chemins d’exécution sur CPU ou GPU. Le fichier de point de contrôle n’est que le point de départ. L’admission réelle dépend également des métadonnées de quantification, du contexte d’exécution, du cache KV, de la longueur du prompt, de la concurrence, des jetons visuels, des espaces de travail temporaires et de la mémoire déjà réservée par d’autres services. Un routeur efficace évalue ces coûts avant l’exécution et choisit un modèle, une précision, une limite de contexte et un chemin matériel capables de rester stables pendant toute la durée de la requête.
La taille du point de contrôle ne représente que la partie fixe de l’empreinte
Les poids et les métadonnées de quantification créent une base résidente prévisible. L’environnement d’exécution ajoute ensuite des bibliothèques, des pools d’allocation, des graphes d’exécution, des tampons d’entrée, des activations et l’état de la requête.
Le guide matériel de ZimaSpace considère la mémoire IA totale comme un élément allant au-delà de la taille du fichier du modèle.
Un routeur qui se base uniquement sur la taille du fichier peut accepter un modèle qui se charge correctement, mais échoue lors d’un long préremplissage, d’une requête multimodale ou d’une conversation simultanée.
Chaque modèle nécessite un profil mémoire empirique
Enregistrez pour chaque modèle et chaque quantification la mémoire résidente au repos, la mémoire maximale pendant le préremplissage, le nombre d’octets par jeton de contexte, la précision du KV, les limites de lots, le coût des jetons visuels et la réserve d’exécution.
Une étude de 2026 sur la planification multimodèle caractérise le comportement mémoire des modèles selon les architectures et les matériels hétérogènes, plutôt que de supposer qu’une seule formule de placement convient à tous les modèles.
Les profils doivent inclure les états à froid et à chaud, car les caches de compilation et les niveaux maximums d’allocation peuvent modifier la mémoire disponible après des requêtes précédentes.
Recréez le profil après toute modification de l’environnement d’exécution, du pilote, du paramètre de contexte, de la quantification ou du format du modèle.
Le routeur doit réserver une marge dynamique avant l’admission
La requête fournit des informations supplémentaires : longueur du prompt, sortie attendue, nombre et résolution des images, lot demandé et concurrence actuelle des utilisateurs.
Le planificateur mémoire global de Prism ajuste l’activation et l’éviction des modèles en fonction de la charge de travail et des informations de file d’attente, plutôt qu’avec des réservations fixes.
Un routeur domestique peut utiliser une formule d’admission plus simple : la mémoire libre de l’appareil, moins une marge de sécurité, doit dépasser la base du modèle ainsi que l’état estimé de la requête et l’espace de travail.
Si l’estimation ne tient pas, le routeur peut raccourcir le contexte, réduire la taille du lot, choisir un modèle plus petit, utiliser une précision de cache inférieure, mettre la requête en file d’attente ou l’acheminer vers un autre appareil.
L’ajustement complet au GPU, le déchargement partiel et l’exécution sur CPU sont des chemins différents
Un modèle qui tient entièrement dans la VRAM évite généralement les transferts répétés de poids entre l’hôte et l’appareil. Un modèle plus volumineux peut fonctionner avec un déchargement partiel sur le CPU ou avec une mémoire unifiée, mais avec des limites différentes en matière de latence et de bande passante.
ATSInfer utilise un placement au niveau des tenseurs pour coordonner le stockage, le transfert et le calcul entre la mémoire CPU et GPU des appareils grand public.
Le routeur doit distinguer « peut s’exécuter » de « respecte le délai prévu pour le flux de travail ». Un modèle partiellement déchargé peut convenir à une analyse nocturne, mais être inacceptable pour une interaction vocale.
La popularité et le coût du rechargement influencent les modèles conservés en mémoire
Les modèles fréquemment demandés peuvent rester actifs, tandis que les grands modèles rarement utilisés restent sur le stockage jusqu’à ce qu’une tâche justifie leur coût de chargement.
Weaver analyse les modèles très et peu sollicités dans des systèmes qui desservent de nombreux points d’accès aux popularités inégales.
Une requête peut être acheminée vers un modèle légèrement plus petit déjà actif s’il répond aux exigences de qualité et évite un long cycle d’éviction et de rechargement. Une tâche complexe peut justifier le chargement du modèle plus volumineux lorsque le gain de qualité attendu dépasse le délai.
Les exigences de la tâche doivent limiter les décisions fondées uniquement sur la mémoire
La plus petite empreinte n’est pas toujours le meilleur choix. Le codage, les textes multilingues, le raisonnement complexe, l’OCR et la planification d’outils peuvent nécessiter des capacités absentes d’un modèle plus petit.
MuxServe combine le placement et la planification, car un service efficace dépend à la fois de la demande des modèles et du comportement des ressources.
Définissez d’abord un seuil minimal de capacités, puis choisissez le modèle à l’empreinte la plus faible parmi ceux qui satisfont les critères de qualité, de sécurité, de latence et de format du flux de travail.
Une tâche d’extraction déterministe peut être acheminée vers un petit modèle résident, tandis qu’une requête de planification complexe est dirigée vers un modèle plus grand ou mise en attente jusqu’à ce que des ressources soient disponibles.
Le routage doit s’adapter à la mémoire disponible en temps réel et à l’historique récent d’exécution
Les profils statiques ne peuvent pas prendre en compte chaque réservation de l’allocateur, chaque région fragmentée, chaque conteneur concurrent ou chaque ralentissement thermique. Le routeur a également besoin de la mémoire libre actuelle, de la profondeur de la file d’attente, des modèles résidents et des échecs récents.
Les recherches sur la planification agentique CPU-GPU combinent les empreintes mémoire, le coût de démarrage à froid, l’historique d’exécution et les données matérielles pour attribuer les tâches IA hétérogènes.
Consignez le chemin choisi, la mémoire prédite, le pic réel, le temps de chargement, la latence avant le premier jeton, la vitesse de sortie et tout mécanisme de repli. Mettez à jour le profil du modèle lorsque l’erreur de prédiction dépasse une marge définie.
Le routage tenant compte de la mémoire est efficace lorsque les requêtes restent dans une capacité stable, tout en permettant au serveur de sélectionner le modèle le plus performant capable de respecter l’objectif de service de la tâche en cours.
FAQ
Un routeur peut-il utiliser la taille du fichier du modèle comme estimation rapide ?
C’est une base utile, mais le routeur doit également prendre en compte la surcharge de l’environnement d’exécution, le cache KV, le prompt, le lot et une marge de sécurité avant d’admettre la requête.
Un modèle doit-il être acheminé vers le CPU dès que la VRAM est pleine ?
Uniquement si l’exécution sur CPU ou en mode hybride respecte les exigences de latence et de mémoire de la tâche. Mettre la requête en file d’attente ou choisir un modèle plus petit peut être préférable.
Le routage tenant compte de la mémoire nécessite-t-il plusieurs GPU ?
Non. Il peut choisir entre un seul GPU, l’exécution sur CPU, le déchargement partiel, différentes quantifications et plusieurs tailles de modèles sur un seul serveur domestique.
Centre Tech & IA
Plus à lire

Quelles fonctionnalités permettent de créer une frontière de confiance pour l’IA domestique autour des fichiers sensibles ?
Une frontière de confiance pour l’IA à domicile combine le chiffrement des données au repos, des autorisations selon le principe du moindre privilège, un...

Pourquoi les résultats de recherche privés privilégient-ils les fichiers fréquemment modifiés ?
Les fichiers fréquemment modifiés bénéficient d’un meilleur classement lorsque chaque mise à jour ajoute des signaux de fraîcheur, des segments, des versions ou des...

Qu’est-ce qui pousse les modèles de détection de présence pour maison intelligente à confondre les invités avec les résidents ?
Les invités peuvent être pris pour des résidents lorsque le système observe des habitudes d’activité du foyer, mais ne dispose d’aucun signal d’identité stable...

