Le regroupement continu planifie les séquences actives à chaque itération de décodage, permettant aux nouvelles requêtes de rejoindre le groupe et aux requêtes terminées de le quitter sans attendre la formation d'un groupe fixe.
Une famille peut envoyer en quelques secondes une requête vocale, une question sur un document et une demande de code à un même modèle local. Leurs invites et leurs longueurs de sortie diffèrent, si bien qu'un groupe fixe gaspille des emplacements tandis que les réponses plus courtes attendent la plus longue. Le regroupement continu reconstruit en permanence le travail utile autour du modèle, mais il n'est pertinent que lorsque les requêtes se chevauchent et que le serveur dispose de suffisamment de mémoire et de marge pour la planification.
La planification au niveau de l'itération est l'idée centrale
Le décodage autorégressif fait progresser chaque séquence active d'environ un jeton par itération du modèle. Un planificateur continu sélectionne les séquences exécutables pour l'itération suivante, accepte de nouvelles requêtes lorsque de la capacité se libère et retire immédiatement les séquences une fois terminées.
L'article d'Orca a introduit la planification au niveau de l'itération, à la granularité des itérations du modèle plutôt qu'à celle des requêtes entières. Le regroupement sélectif rassemble ensuite les opérations compatibles tout en laissant séparées les tâches propres à chaque requête. Cette distinction reste visible lors des tests domestiques ultérieurs.
Ce mécanisme ne se confond pas avec la diffusion des jetons en continu à l'utilisateur. La diffusion modifie le moment où la sortie est envoyée ; le regroupement continu modifie la façon dont plusieurs requêtes partagent en interne l'exécution du modèle. Le résultat intermédiaire doit rester inspectable avant que l'automatisation ne poursuive le processus.
Il diffère du regroupement statique et du regroupement par fenêtre d'arrivée
Le regroupement statique enferme un groupe fixe dans une même exécution et ajoute souvent des remplissages aux séquences plus courtes jusqu'à la fin de la plus longue. Le regroupement par fenêtre d'arrivée, ou regroupement dynamique, attend brièvement pour collecter les requêtes, mais peut tout de même exécuter le groupe obtenu comme une seule unité. Le regroupement continu réévalue la composition du groupe à chaque itération.
L'article sur vLLM associe la planification au niveau de l'itération à la gestion paginée du cache KV, afin que les ensembles de séquences changeants n'exigent pas de réservations contiguës rigides. La planification et la gestion de la mémoire sont des fonctionnalités complémentaires plutôt qu'interchangeables. Cette limite doit être mesurée séparément dans des conditions d'exploitation réalistes.
Un plus grand nombre de séquences actives amortit la lecture des poids et peut améliorer le débit, mais chaque requête se dispute la mémoire KV et les ressources de calcul. Un groupe actif plus important n'est pas automatiquement préférable pour la latence ou l'équité. La conséquence pratique apparaît lorsque plusieurs sources se disputent un contexte limité.
La concurrence, et non la seule taille du modèle, crée le gain
Un seul utilisateur interactif peut constater peu de bénéfices, car aucune deuxième requête n'est disponible pour remplir la capacité inutilisée. Les gains apparaissent lorsque plusieurs utilisateurs domestiques se chevauchent, avec des branches d'agents, des résumés en arrière-plan ou plusieurs applications partageant un même modèle résident.
Sarathi-Serve analyse la façon dont les interférences lors du préremplissage peuvent perturber la latence du décodage et utilise des préremplissages par blocs pour rendre la planification mixte plus prévisible. Le résultat montre que la politique d'admission compte autant que l'étiquette de regroupement continu. Cette dépendance doit rester explicite dans l'interface finale.
La limite apparaît lorsque la mémoire est sous pression ou lorsque l'admission agressive augmente le temps par jeton de sortie et la latence de queue. Lorsque le cache KV est plein, la préemption, l'échange ou le recalcul peuvent annuler les gains de débit et rendre le service interactif instable.
Déterminez si la demande concurrente le justifie
Rejouez une, deux, quatre et huit requêtes qui se chevauchent, avec des longueurs réalistes pour les invites et les sorties. Mesurez le débit, le temps jusqu'au premier jeton, le temps par jeton de sortie, le temps d'achèvement au 95e percentile, l'utilisation du cache KV, les préemptions et l'équité par classe de requête.
Comparez le comportement avec les lacunes d'utilisation du GPU liées au regroupement continu. Répétez le test avec le regroupement continu désactivé ou avec une référence à groupe fixe, en maintenant constants le modèle, la quantification, les limites de contexte et le matériel. Le résultat doit donc être vérifié par rapport aux éléments de preuve d'origine.
Utilisez le regroupement continu lorsque le chevauchement produit des gains substantiels de débit ou de capacité sans dépasser la latence de queue acceptable pour l'interactivité. Si les requêtes se chevauchent rarement, donnez la priorité à la résidence du modèle et à la latence de démarrage avant d'ajouter la complexité d'un planificateur. Cette distinction reste visible lors des tests domestiques ultérieurs.
Centre Tech & IA
Plus à lire

Qu’est-ce que la dérive des représentations vectorielles, et quand faut-il reconstruire un index de recherche privé ?
Décoder la dérive du modèle, du prétraitement, du corpus et des requêtes ; distinguer la surveillance de l’incompatibilité ; et déterminer quand un index...

Qu’est-ce que la compatibilité des tokeniseurs et pourquoi peut-elle perturber le changement de modèle ?
Décodez l’identité du vocabulaire, la sémantique des tokens spéciaux, les modèles de chat, les tokens mis en cache, les adaptateurs et les vérifications de...

Qu’est-ce que la résidence d’un modèle et quand un service d’IA local doit-il conserver les poids chargés ?
Comprendre la persistance des poids, les niveaux de cache, les démarrages à froid, l’éviction, le multiplexage, la pression mémoire et les situations où un...

