La planification de l’accélérateur influence l’IA domestique multi-utilisateur en déterminant quelles requêtes démarrent, partagent chaque itération, conservent leur état en mémoire ou attendent derrière d’autres tâches.
Plusieurs utilisateurs d’un même foyer peuvent envoyer des requêtes aux coûts très différents : une courte question sur le contrôle de l’éclairage, un long document, une image, une demande vocale ou un agent qui génère de nombreux appels. L’accélérateur ne peut pas déduire l’importance d’une requête pour le foyer à partir du seul moment d’arrivée. Un ordonnanceur doit combiner l’ordre de la file, les budgets de jetons, le traitement par lots, les priorités, l’admission en mémoire et la résidence des modèles, alors que la durée des sorties reste imprévisible. Les sections ci-dessous expliquent pourquoi un même matériel peut sembler équitable, rapide ou inutilisable selon la manière dont ces choix sont effectués.
FIFO considère le moment d’arrivée comme la seule priorité
Une file « premier arrivé, premier servi » est simple, mais une longue invite ou une longue réponse peut retarder de nombreuses requêtes courtes arrivées plus tard.
Les requêtes de LLM ont des coûts en jetons inégaux ; une équité fondée uniquement sur le nombre de requêtes peut donc accorder à un utilisateur beaucoup plus de temps d’accélérateur qu’à un autre.
FIFO est prévisible lorsque la charge est faible, mais provoque un blocage en tête de file lorsque les charges de travail du foyer deviennent hétérogènes.
Le traitement continu par lots partage les itérations entre les utilisateurs
Les ordonnanceurs au niveau de l’itération peuvent ajouter de nouvelles séquences entre les étapes de décodage et retirer celles qui sont terminées sans reconstruire un lot fixe.
La planification par itération d’Orca améliore l’utilisation des ressources tout en permettant à plusieurs utilisateurs de progresser ensemble.
Le partage ne garantit pas une vitesse égale. L’ordonnanceur détermine toujours combien de séquences sont admises, à quelle fréquence chacune progresse et si un nouveau préremplissage interrompt les décodages actifs.
Les politiques de priorité protègent les requêtes sensibles à la latence
Le contrôle vocal et les conversations interactives courtes peuvent mériter une admission plus rapide que les résumés en arrière-plan, les plongements vectoriels ou la génération d’images.
Llumnix traite les priorités de latence pour les requêtes de LLM hétérogènes.
La priorité doit intégrer un vieillissement des requêtes ou des quotas afin que les tâches en arrière-plan finissent par s’exécuter et qu’un utilisateur privilégié ne puisse pas affamer le reste du foyer.
L’admission en mémoire peut bloquer une requête avant même le calcul
Une requête a besoin d’un cache KV et d’un espace de travail en plus des poids du modèle. L’ordonnanceur peut retarder son admission même lorsque les unités de calcul semblent inactives, car la marge mémoire est insuffisante.
Le guide de ZimaSpace consacré à la pression mémoire multi-utilisateur explique pourquoi les contextes plus longs réduisent le nombre de conversations pouvant rester actives.
La préemption d’une séquence libère de la capacité, mais peut nécessiter de recalculer ou de restaurer son état ultérieurement, transformant ainsi la politique mémoire en latence supplémentaire.
Le préremplissage et le décodage nécessitent des traitements différents
Les longs préremplissages sollicitent fortement le calcul, tandis que le décodage des jetons relit constamment les poids et l’état du cache. Les exécuter ensemble sans contrôle peut interrompre la diffusion de la sortie.
Sarathi-Serve utilise une planification sans blocage et un préremplissage par fragments afin d’améliorer le débit tout en limitant les perturbations de latence.
Un ordonnanceur domestique peut réserver des occasions de décodage aux conversations actives et fractionner les longs préremplissages de documents au lieu de laisser une seule requête monopoliser une longue itération.
L’équité doit être mesurée selon des critères perceptibles par l’utilisateur
Le débit total en jetons par seconde peut augmenter tandis qu’un utilisateur attend beaucoup plus longtemps qu’un autre. Suivez le temps d’attente dans la file, le délai jusqu’au premier jeton, le délai entre les jetons, le temps d’achèvement et la part de service par utilisateur ou par classe de charge de travail.
Le Virtual Token Counter définit une équité prenant en compte les jetons, plutôt que de compter chaque requête de manière identique.
Utilisez des classes explicites pour la voix, les conversations interactives, les agents, les plongements vectoriels et les tâches de maintenance. Testez ensuite le chevauchement de requêtes longues et courtes afin de vérifier que la politique choisie correspond aux attentes du foyer.
La planification ne peut pas créer davantage de capacité d’accélérateur, mais elle peut déterminer si la pénurie se traduit par un ralentissement équitable, des pics de latence en queue ou le blocage de tous les autres utilisateurs par une seule personne.
Centre Tech & IA
Plus à lire

Quelles fonctionnalités permettent de créer une frontière de confiance pour l’IA domestique autour des fichiers sensibles ?
Une frontière de confiance pour l’IA à domicile combine le chiffrement des données au repos, des autorisations selon le principe du moindre privilège, un...

Pourquoi les résultats de recherche privés privilégient-ils les fichiers fréquemment modifiés ?
Les fichiers fréquemment modifiés bénéficient d’un meilleur classement lorsque chaque mise à jour ajoute des signaux de fraîcheur, des segments, des versions ou des...

Qu’est-ce qui pousse les modèles de détection de présence pour maison intelligente à confondre les invités avec les résidents ?
Les invités peuvent être pris pour des résidents lorsque le système observe des habitudes d’activité du foyer, mais ne dispose d’aucun signal d’identité stable...

