La mise en lots de l’IA à domicile améliore le débit total en regroupant les tâches compatibles, mais chaque requête peut attendre plus longtemps ou partager des itérations plus lentes avec d’autres utilisateurs.
Un prompt unique peut être immédiatement pris en charge par un accélérateur disponible, tandis qu’un serveur familial reçoit souvent des conversations simultanées, des prompts sur des documents, des requêtes vocales et des tâches en arrière-plan. Le moteur d’exécution peut conserver brièvement une requête pour former un lot, ajouter de nouvelles séquences entre les itérations de décodage ou diviser les préfills longs en blocs plus petits. Ces choix permettent de mieux occuper l’accélérateur, mais modifient aussi le délai avant le premier token, le délai entre les tokens et l’équité. Les sections ci-dessous expliquent dans quels cas la mise en lots est utile et à partir de quel moment les gains de débit n’améliorent plus l’expérience interactive.
La mise en lots transforme la capacité inutilisée de l’accélérateur en travail partagé
Une requête peut ne pas utiliser efficacement toutes les voies d’exécution parallèles, notamment lors de petites opérations matricielles ou avec des séquences courtes. Le regroupement de plusieurs requêtes crée des opérations tensorielles plus importantes, qui exploitent plus efficacement l’accélérateur.
Orca a introduit la planification au niveau des itérations, qui permet aux requêtes de rejoindre ou de quitter un lot entre deux itérations de génération, au lieu d’imposer à un lot fixe de rester groupé jusqu’à la fin de chaque séquence.
Le gain se mesure en tokens ou en requêtes traités par unité de temps. Il ne garantit pas qu’un utilisateur donné recevra un token plus rapidement.
Une fenêtre de mise en lots ajoute un temps d’attente avant le début du calcul
Un moteur d’exécution qui attend d’autres requêtes peut former un lot plus grand et plus efficace, mais la première requête doit subir ce délai, même lorsque l’accélérateur était disponible.
Le compromis entre débit et latence devient visible lorsque des lots plus importants améliorent l’efficacité du matériel tout en prolongeant le temps d’attente ou la durée des itérations.
L’IA interactive à domicile nécessite généralement une fenêtre de mise en lots courte ou adaptative. Les embeddings en arrière-plan peuvent tolérer une attente plus longue, car leur objectif est de traiter le travail, et non de fournir une réponse conversationnelle.
Les préfills longs peuvent bloquer les tâches courtes de décodage
Le traitement d’un prompt effectue un préfill important et intensif en calcul, tandis que les conversations actives reviennent régulièrement pour des étapes de décodage limitées par la mémoire. Les mélanger dans un même lot peut obliger un petit décodage interactif à attendre derrière un long prompt documentaire.
DistServe isole les interférences entre le préfill et le décodage, car ces deux phases présentent des caractéristiques différentes en matière de ressources et de latence.
Le préfill par blocs constitue un compromis : il divise un prompt long afin que les requêtes de décodage puissent s’exécuter entre les blocs, mais le document nécessite davantage de cycles de planification pour être traité.
Le meilleur réglage dépend de la priorité du serveur : un long travail d’analyse ou plusieurs utilisateurs qui reçoivent déjà des réponses en continu.
Des séquences de longueurs différentes rendent chaque lot irrégulier
Les requêtes diffèrent par la longueur du prompt, la longueur de la sortie, les conditions d’arrêt et les fonctionnalités du modèle. Certaines se terminent rapidement tandis que d’autres restent actives, si bien que la composition du lot évolue continuellement.
vLLM utilise la mise en lots continue avec un cache KV paginé pour accepter de nouvelles requêtes à mesure que la capacité se libère, plutôt que d’attendre la limite d’un lot fixe.
Même avec une gestion efficace de la mémoire, une réponse très longue consomme des emplacements de décodage et du cache KV pendant de nombreuses itérations. La taille des lots doit donc être exprimée en budgets de tokens et de mémoire, et pas uniquement en nombre de requêtes.
Des lots plus importants peuvent réduire le débit de tokens par utilisateur
Le nombre total de tokens par seconde peut augmenter tandis que chaque utilisateur reçoit une part plus faible des itérations de décodage. Un tableau de bord affichant un débit global supérieur peut donc coexister avec un streaming visible plus lent.
Le guide de ZimaSpace sur la concurrence familiale explique pourquoi les benchmarks avec un seul utilisateur ne permettent pas de prévoir la latence de plusieurs conversations simultanées.
Mesurez le délai avant le premier token, le délai entre les tokens et le temps d’achèvement de chaque requête, en plus du débit global. Sinon, la mise en lots risque d’être réglée pour une mesure que les utilisateurs ne perçoivent jamais directement.
Définissez des politiques de mise en lots différentes pour les tâches interactives et en arrière-plan
Réservez des fenêtres d’attente courtes, une concurrence limitée et une priorité élevée à la voix et au chat. Autorisez des lots plus importants et une priorité moindre pour les embeddings, l’indexation, les résumés et les transformations hors ligne.
Les recherches sur le service équitable des grands modèles de langage utilisent l’équité tenant compte des tokens, afin que l’entrée ou la sortie très longue d’une requête n’occupe pas indéfiniment une part disproportionnée des ressources.
Effectuez les tests avec une charge familiale représentative, et pas uniquement avec la taille de lot maximale. La configuration utile est celle qui offre le débit le plus élevé tout en respectant les objectifs de délai avant le premier token et de latence du streaming pour le parcours interactif.
Lorsqu’un seul accélérateur ne peut pas satisfaire les deux catégories, des processus ou des planifications distincts peuvent être plus simples qu’une politique de mise en lots universelle.
FAQ
La mise en lots augmente-t-elle toujours la latence ?
Non. Une mise en lots efficace peut réduire le temps total nécessaire pour vider la file d’attente et éviter la surcharge, mais l’attente nécessaire pour former un lot et le partage d’itérations plus longues peuvent augmenter la latence d’une requête individuelle.
La taille du lot correspond-elle au nombre d’utilisateurs ?
Pas exactement. Les moteurs d’exécution peuvent établir leur budget selon les séquences actives, les tokens, les blocs KV ou le travail total, et un seul utilisateur peut générer plusieurs requêtes simultanées.
Faut-il regrouper les requêtes vocales avec les embeddings ?
En général, pas avec la même politique de latence. La voix est interactive, tandis que les tâches d’embedding peuvent attendre et utiliser des lots plus importants lorsque la capacité est disponible.
Centre Tech & IA
Plus à lire

Pourquoi les prédictions de la maison connectée deviennent-elles moins précises après des changements de routine saisonniers ?
Les habitudes saisonnières modifient la relation entre le temps, les capteurs, l’occupation et les actions souhaitées, ce qui rend obsolète un modèle entraîné à...

Pourquoi un NVR domestique manque-t-il des événements brefs lorsque le suivi des objets est activé ?
Le suivi nécessite suffisamment de détections pour commencer et confirmer une trajectoire ; un objet peut donc disparaître brièvement avant que le NVR ne...

Pourquoi les étiquettes des photos générées par l’IA changent-elles après la mise à niveau d’un modèle ?
Une mise à niveau du modèle modifie la représentation et le classement utilisés pour attribuer les étiquettes, de sorte qu’une même photo peut franchir...

