A inferência de IA em casa está a adotar agendamento sensível a prefixos, porque os prompts de sistema e os esquemas de ferramentas repetidos podem reutilizar o cálculo dispendioso de pré-preenchimento.
Um assistente doméstico pode acrescentar milhares de tokens idênticos relativos às instruções do sistema, aos esquemas de ferramentas, às regras de segurança e ao contexto da casa antes de cada pergunta única. Recalcular esses tokens aumenta a latência até ao primeiro token. O agendamento sensível a prefixos tenta encaminhar pedidos correspondentes para um estado em cache reutilizável, sem permitir que um prefixo aquecido monopolize a fila durante fluxos de trabalho domésticos repetidos e utilização concorrente.
Os prefixos repetidos transformam o histórico do prompt em computação reutilizável
Os assistentes domésticos enviam repetidamente o mesmo prompt de sistema, os esquemas de ferramentas, a política da casa e as instruções de RAG antes do texto único do utilizador. O pré-preenchimento calcula o estado de atenção desses tokens. Quando o prefixo exato se repete, os blocos KV em cache podem evitar grande parte desse trabalho.
O design de partilha de prefixos do SGLang utiliza uma árvore radix para partilhar prefixos comuns entre pedidos. Trata a sobreposição de prompts como um recurso de agendamento e memória.
A colocação em cache só ajuda quando um pedido posterior chega enquanto o estado correspondente ainda existe. Um agendador que ignore a localidade dos prefixos pode enviar o trabalho para um processo frio ou expulsar blocos reutilizáveis ao admitir contextos não relacionados.
O agendamento equilibra agora o tempo na fila com a localidade da cache
Um agendador sensível a prefixos considera tanto o tempo de espera de um pedido como o número de tokens do prompt que podem ser reutilizados em cada trabalhador. A reutilização reduz o tempo até ao primeiro token e o cálculo de pré-preenchimento, mas enviar tudo para um único trabalhador aquecido pode criar uma fila injusta.
Uma pilha de inferência aberta lista explicitamente o encaminhamento pela cache de prefixos e as caches de prefixos hierárquicas como padrões de implementação. A sua inclusão reflecte o facto de a localidade da cache se estar a tornar um sinal de serviço de primeira classe.
Numa única GPU doméstica, o mesmo princípio determina a ordem de admissão ou preserva blocos entre sessões. O benefício é maior para modelos estáveis e agentes com definições de ferramentas repetidas e extensas, não para prompts únicos e não relacionados.
Onde a sensibilidade a prefixos não pode ajudar
Uma única alteração num token no início de um prompt pode invalidar a reutilização a partir desse ponto. Marcas temporais dinâmicas, esquemas de ferramentas reordenados, segredos específicos de cada utilizador e serialização inconsistente reduzem o prefixo comum. A pesquisa e a retenção da cache passam então a consumir memória sem poupar muita computação.
Uma explicação sobre correspondências exatas de prefixos salienta que a reutilização exige um prefixo de tokens idêntico, e não apenas um significado semelhante. A tokenização e a construção do prompt devem permanecer estáveis.
A tendência também falha quando o tempo de descodificação domina um prompt curto ou quando apenas um pedido é executado ocasionalmente. Reter mais dados em cache pode ser prejudicial ao reduzir o espaço disponível para o estado KV ativo. A sensibilidade a prefixos é uma otimização, não uma melhoria da qualidade.
Meça a reutilização de prefixos sem criar fome na fila
Registe os hashes dos prefixos tokenizados, o número de tokens correspondentes, a taxa de acertos da cache, o tempo de pré-preenchimento, o tempo na fila, a latência até ao primeiro token e as expulsões. Reproduza pedidos domésticos com prompts de sistema estáveis e deliberadamente alterados, utilizando uma e várias sessões concorrentes.
Compare com os arranques a frio da IA local, porque um arranque a frio do disco ou do modelo pode ocultar as poupanças dos prefixos. Aqueça os mesmos pesos antes de medir os efeitos do agendamento.
Adopte uma ordenação sensível a prefixos quando os pedidos com prefixos repetidos apresentarem uma redução significativa do pré-preenchimento sem aumentar a latência do pedido mais antigo para além do objectivo. Normalize a ordem das ferramentas, coloque as marcas temporais depois do conteúdo estável, separe os prefixos sensíveis por utilizador e limite a memória da cache.
Centro de Tecnologia e IA
Mais para Ler

Porque é que a IA dos NVR domésticos está a passar da deteção por fotogramas para a compreensão de eventos em 2026?
Compreenda como as trajetórias se transformam em eventos, por que motivo o contexto temporal reduz os alertas repetitivos e em que situações a IA...

Porque é que o reconhecimento de voz no dispositivo está a substituir os processos de voz exclusivamente na nuvem em 2026?
Explique por que a privacidade, a latência, a resiliência offline e os modelos ASR mais pequenos favorecem o reconhecimento de voz local, enquanto os...

Porque é que a pesquisa multimodal está a aproximar-se do armazenamento local em 2026?
Veja por que motivo a indexação multimodal beneficia da proximidade dos dados, como o armazenamento doméstico se torna uma camada de IA e quando...

