O agendamento do acelerador afeta a IA doméstica multiutilizador ao decidir quais os pedidos que começam, partilham cada iteração, mantêm o estado na memória ou ficam à espera de outro trabalho.
Vários utilizadores da mesma casa podem enviar pedidos com custos muito diferentes: uma pergunta curta sobre o controlo da iluminação, um documento extenso, uma imagem, um pedido de voz ou um agente que gera muitas chamadas. O acelerador não consegue inferir a importância para a casa apenas com base na ordem de chegada. Um agendador tem de combinar a ordem da fila, os orçamentos de tokens, o processamento em lotes, as prioridades, a admissão na memória e a permanência dos modelos, enquanto os resultados continuam imprevisíveis. As secções abaixo explicam por que razão o mesmo hardware pode parecer justo, rápido ou inutilizável, dependendo da forma como essas escolhas são feitas.
O FIFO Trata a Hora de Chegada como a Única Prioridade
Uma fila FIFO (primeiro a entrar, primeiro a sair) é simples, mas um prompt ou uma resposta longos podem atrasar muitos pedidos curtos que chegaram mais tarde.
Os pedidos de LLM têm custos de tokens desiguais, pelo que a justiça baseada apenas no número de pedidos pode dar a um utilizador muito mais tempo de acelerador do que a outro.
O FIFO é previsível com pouca carga, mas provoca bloqueio no início da fila quando as cargas de trabalho domésticas se tornam heterogéneas.
O Processamento Contínuo em Lotes Partilha Iterações entre Utilizadores
Os agendadores ao nível da iteração podem adicionar novas sequências entre passos de descodificação e remover as que terminaram sem reconstruir um único lote fixo.
O agendamento por iterações do Orca melhora a utilização, permitindo que vários utilizadores avancem em conjunto.
A partilha não garante uma velocidade igual. O agendador continua a decidir quantas sequências entram, com que frequência cada uma avança e se um novo prefill interrompe as descodificações ativas.
As Políticas de Prioridade Protegem os Pedidos Sensíveis à Latência
O controlo por voz e o chat interativo curto podem justificar uma admissão mais rápida do que os resumos em segundo plano, os embeddings ou a geração de imagens.
O Llumnix aborda prioridades de latência para pedidos de LLM heterogéneos.
A prioridade deve incluir envelhecimento ou quotas, para que as tarefas em segundo plano acabem por ser executadas e para que um utilizador favorecido não prive os restantes membros da casa.
A Admissão na Memória Pode Bloquear um Pedido Antes do Processamento
Um pedido precisa de cache KV e de espaço de trabalho, além dos pesos do modelo. O agendador pode atrasar a admissão mesmo quando as unidades de processamento parecem estar inativas, porque não há memória disponível suficiente.
O guia da ZimaSpace sobre pressão de memória multiutilizador explica por que razão contextos mais longos reduzem o número de conversas que podem permanecer ativas.
A preempção de uma sequência liberta capacidade, mas pode exigir que o estado seja recalculado ou restaurado mais tarde, transformando a política de memória em latência adicional.
O Prefill e a Descodificação Precisam de um Tratamento de Agendamento Diferente
Os prefills longos utilizam intensivamente o processamento, enquanto a descodificação de tokens lê repetidamente os pesos e o estado da cache. Executá-los em conjunto sem controlo pode interromper a transmissão da saída.
O Sarathi-Serve utiliza agendamento sem bloqueios e prefill dividido em blocos para melhorar o débito, limitando simultaneamente a perturbação da latência.
Um agendador doméstico pode reservar oportunidades de descodificação para conversas ativas e dividir os prefills de documentos extensos, em vez de permitir que um único pedido monopolize uma iteração longa.
A Justiça Deve Ser Medida em Termos Visíveis para o Utilizador
O total de tokens por segundo pode melhorar enquanto um utilizador espera muito mais tempo do que outro. Acompanhe o tempo na fila, o tempo até ao primeiro token, o intervalo entre tokens, o tempo de conclusão e a quota de serviço por utilizador ou classe de carga de trabalho.
O Virtual Token Counter define justiça baseada em tokens, em vez de contar todos os pedidos de forma igual.
Utilize classes explícitas para voz, chat interativo, agentes, embeddings e tarefas de manutenção. Em seguida, teste pedidos longos e curtos sobrepostos para confirmar que a política escolhida corresponde às expectativas da casa.
O agendamento não pode criar mais capacidade de acelerador, mas pode decidir se a escassez se manifesta como uma redução de velocidade justa, picos de latência de cauda ou um utilizador a bloquear todos os outros.
Centro de Tecnologia e IA
Mais para Ler

Que funcionalidades permitem criar um limite de confiança de IA doméstico em torno de ficheiros sensíveis?
Uma fronteira de confiança para IA doméstica combina encriptação em repouso, permissões de privilégio mínimo, sandboxing em tempo de execução e recuperação com âmbito...

O que faz com que os resultados de pesquisa privada favoreçam ficheiros editados com frequência?
Os ficheiros editados frequentemente obtêm vantagens no posicionamento quando cada atualização acrescenta sinais de atualidade, fragmentos, versões ou interação, sem normalização por fonte.

O que faz com que os modelos de presença de casas inteligentes confundam visitantes com residentes?
Os visitantes podem parecer residentes quando o sistema observa padrões de atividade doméstica, mas não dispõe de um sinal de identidade estável da pessoa...

