Como é que o agendamento do acelerador afeta a IA doméstica multiutilizador?

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

O agendamento do acelerador afeta a IA doméstica multiutilizador ao decidir quais os pedidos que começam, partilham cada iteração, mantêm o estado na memória ou ficam à espera de outro trabalho.

Vários utilizadores da mesma casa podem enviar pedidos com custos muito diferentes: uma pergunta curta sobre o controlo da iluminação, um documento extenso, uma imagem, um pedido de voz ou um agente que gera muitas chamadas. O acelerador não consegue inferir a importância para a casa apenas com base na ordem de chegada. Um agendador tem de combinar a ordem da fila, os orçamentos de tokens, o processamento em lotes, as prioridades, a admissão na memória e a permanência dos modelos, enquanto os resultados continuam imprevisíveis. As secções abaixo explicam por que razão o mesmo hardware pode parecer justo, rápido ou inutilizável, dependendo da forma como essas escolhas são feitas.

O FIFO Trata a Hora de Chegada como a Única Prioridade

Uma fila FIFO (primeiro a entrar, primeiro a sair) é simples, mas um prompt ou uma resposta longos podem atrasar muitos pedidos curtos que chegaram mais tarde.

Os pedidos de LLM têm custos de tokens desiguais, pelo que a justiça baseada apenas no número de pedidos pode dar a um utilizador muito mais tempo de acelerador do que a outro.

O FIFO é previsível com pouca carga, mas provoca bloqueio no início da fila quando as cargas de trabalho domésticas se tornam heterogéneas.

O Processamento Contínuo em Lotes Partilha Iterações entre Utilizadores

Os agendadores ao nível da iteração podem adicionar novas sequências entre passos de descodificação e remover as que terminaram sem reconstruir um único lote fixo.

O agendamento por iterações do Orca melhora a utilização, permitindo que vários utilizadores avancem em conjunto.

A partilha não garante uma velocidade igual. O agendador continua a decidir quantas sequências entram, com que frequência cada uma avança e se um novo prefill interrompe as descodificações ativas.

As Políticas de Prioridade Protegem os Pedidos Sensíveis à Latência

O controlo por voz e o chat interativo curto podem justificar uma admissão mais rápida do que os resumos em segundo plano, os embeddings ou a geração de imagens.

O Llumnix aborda prioridades de latência para pedidos de LLM heterogéneos.

A prioridade deve incluir envelhecimento ou quotas, para que as tarefas em segundo plano acabem por ser executadas e para que um utilizador favorecido não prive os restantes membros da casa.

-15% OFF

A Admissão na Memória Pode Bloquear um Pedido Antes do Processamento

Um pedido precisa de cache KV e de espaço de trabalho, além dos pesos do modelo. O agendador pode atrasar a admissão mesmo quando as unidades de processamento parecem estar inativas, porque não há memória disponível suficiente.

O guia da ZimaSpace sobre pressão de memória multiutilizador explica por que razão contextos mais longos reduzem o número de conversas que podem permanecer ativas.

A preempção de uma sequência liberta capacidade, mas pode exigir que o estado seja recalculado ou restaurado mais tarde, transformando a política de memória em latência adicional.

O Prefill e a Descodificação Precisam de um Tratamento de Agendamento Diferente

Os prefills longos utilizam intensivamente o processamento, enquanto a descodificação de tokens lê repetidamente os pesos e o estado da cache. Executá-los em conjunto sem controlo pode interromper a transmissão da saída.

O Sarathi-Serve utiliza agendamento sem bloqueios e prefill dividido em blocos para melhorar o débito, limitando simultaneamente a perturbação da latência.

Um agendador doméstico pode reservar oportunidades de descodificação para conversas ativas e dividir os prefills de documentos extensos, em vez de permitir que um único pedido monopolize uma iteração longa.

A Justiça Deve Ser Medida em Termos Visíveis para o Utilizador

O total de tokens por segundo pode melhorar enquanto um utilizador espera muito mais tempo do que outro. Acompanhe o tempo na fila, o tempo até ao primeiro token, o intervalo entre tokens, o tempo de conclusão e a quota de serviço por utilizador ou classe de carga de trabalho.

O Virtual Token Counter define justiça baseada em tokens, em vez de contar todos os pedidos de forma igual.

Utilize classes explícitas para voz, chat interativo, agentes, embeddings e tarefas de manutenção. Em seguida, teste pedidos longos e curtos sobrepostos para confirmar que a política escolhida corresponde às expectativas da casa.

O agendamento não pode criar mais capacidade de acelerador, mas pode decidir se a escassez se manifesta como uma redução de velocidade justa, picos de latência de cauda ou um utilizador a bloquear todos os outros.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.