O agendamento do acelerador afeta a IA doméstica multiutilizador ao decidir quais os pedidos que começam, partilham cada iteração, mantêm o estado na memória ou ficam à espera de outro trabalho.
Vários utilizadores da mesma casa podem enviar pedidos com custos muito diferentes: uma pergunta curta sobre o controlo da iluminação, um documento extenso, uma imagem, um pedido de voz ou um agente que gera muitas chamadas. O acelerador não consegue inferir a importância para a casa apenas com base na ordem de chegada. Um agendador tem de combinar a ordem da fila, os orçamentos de tokens, o processamento em lotes, as prioridades, a admissão na memória e a permanência dos modelos, enquanto os resultados continuam imprevisíveis. As secções abaixo explicam por que razão o mesmo hardware pode parecer justo, rápido ou inutilizável, dependendo da forma como essas escolhas são feitas.
O FIFO Trata a Hora de Chegada como a Única Prioridade
Uma fila FIFO (primeiro a entrar, primeiro a sair) é simples, mas um prompt ou uma resposta longos podem atrasar muitos pedidos curtos que chegaram mais tarde.
Os pedidos de LLM têm custos de tokens desiguais, pelo que a justiça baseada apenas no número de pedidos pode dar a um utilizador muito mais tempo de acelerador do que a outro.
O FIFO é previsível com pouca carga, mas provoca bloqueio no início da fila quando as cargas de trabalho domésticas se tornam heterogéneas.
O Processamento Contínuo em Lotes Partilha Iterações entre Utilizadores
Os agendadores ao nível da iteração podem adicionar novas sequências entre passos de descodificação e remover as que terminaram sem reconstruir um único lote fixo.
O agendamento por iterações do Orca melhora a utilização, permitindo que vários utilizadores avancem em conjunto.
A partilha não garante uma velocidade igual. O agendador continua a decidir quantas sequências entram, com que frequência cada uma avança e se um novo prefill interrompe as descodificações ativas.
As Políticas de Prioridade Protegem os Pedidos Sensíveis à Latência
O controlo por voz e o chat interativo curto podem justificar uma admissão mais rápida do que os resumos em segundo plano, os embeddings ou a geração de imagens.
O Llumnix aborda prioridades de latência para pedidos de LLM heterogéneos.
A prioridade deve incluir envelhecimento ou quotas, para que as tarefas em segundo plano acabem por ser executadas e para que um utilizador favorecido não prive os restantes membros da casa.
A Admissão na Memória Pode Bloquear um Pedido Antes do Processamento
Um pedido precisa de cache KV e de espaço de trabalho, além dos pesos do modelo. O agendador pode atrasar a admissão mesmo quando as unidades de processamento parecem estar inativas, porque não há memória disponível suficiente.
O guia da ZimaSpace sobre pressão de memória multiutilizador explica por que razão contextos mais longos reduzem o número de conversas que podem permanecer ativas.
A preempção de uma sequência liberta capacidade, mas pode exigir que o estado seja recalculado ou restaurado mais tarde, transformando a política de memória em latência adicional.
O Prefill e a Descodificação Precisam de um Tratamento de Agendamento Diferente
Os prefills longos utilizam intensivamente o processamento, enquanto a descodificação de tokens lê repetidamente os pesos e o estado da cache. Executá-los em conjunto sem controlo pode interromper a transmissão da saída.
O Sarathi-Serve utiliza agendamento sem bloqueios e prefill dividido em blocos para melhorar o débito, limitando simultaneamente a perturbação da latência.
Um agendador doméstico pode reservar oportunidades de descodificação para conversas ativas e dividir os prefills de documentos extensos, em vez de permitir que um único pedido monopolize uma iteração longa.
A Justiça Deve Ser Medida em Termos Visíveis para o Utilizador
O total de tokens por segundo pode melhorar enquanto um utilizador espera muito mais tempo do que outro. Acompanhe o tempo na fila, o tempo até ao primeiro token, o intervalo entre tokens, o tempo de conclusão e a quota de serviço por utilizador ou classe de carga de trabalho.
O Virtual Token Counter define justiça baseada em tokens, em vez de contar todos os pedidos de forma igual.
Utilize classes explícitas para voz, chat interativo, agentes, embeddings e tarefas de manutenção. Em seguida, teste pedidos longos e curtos sobrepostos para confirmar que a política escolhida corresponde às expectativas da casa.
O agendamento não pode criar mais capacidade de acelerador, mas pode decidir se a escassez se manifesta como uma redução de velocidade justa, picos de latência de cauda ou um utilizador a bloquear todos os outros.
Centro de Tecnologia e IA
Mais para Ler

Como afeta a redução da frequência de amostragem de séries temporais a deteção de anomalias em casas inteligentes?
Veja como a largura dos intervalos, a agregação, o anti-aliasing, os dados em falta, a duração dos eventos e a retenção multiescala alteram a...

Como é que uma grelha de ocupação combina sinais fracos de uma casa inteligente?
Saiba como células espaciais, modelos de sensores, atualizações de log-odds, decaimento, evidências correlacionadas e limiares transformam sinais domésticos fracos em estimativas de ocupação.

Como é que a normalização fotométrica afeta o agrupamento privado de rostos?
Veja como a correção da iluminação altera recortes faciais, embeddings, distâncias entre clusters, limiares, sobre-normalização e a avaliação da pesquisa privada de fotografias.

