Os limites de custo por pedido funcionam quando o gateway converte a política em orçamentos aplicáveis para tokens, tempo, memória, ferramentas, novas tentativas e trabalho em fila.
Uma pesquisa simples de um familiar pode desencadear inesperadamente uma resposta longa do modelo, três passagens de recuperação, OCR e várias ferramentas de agente num servidor doméstico partilhado. A inferência local não tem uma fatura na nuvem por token, mas continua a consumir tempo escasso do acelerador, eletricidade, RAM e capacidade interativa. O serviço precisa de estimativas antecipadas, contabilização em tempo real, pontos de cancelamento e um comportamento claro quando um orçamento se esgota.
As estimativas de admissão reservam um envelope de recursos limitado
Antes da execução, o gateway estima os tokens de entrada, o máximo de saída, a classe do modelo, a memória da cache KV, a profundidade da recuperação, o número de ferramentas e o prazo. As políticas do utilizador, do endpoint e do fluxo de trabalho combinam-se num único orçamento imutável por pedido, que os serviços a jusante não podem aumentar silenciosamente.
agendamento ao nível da iteração agenda a geração com uma granularidade de iteração e agrupa dinamicamente pedidos com diferentes comprimentos. O seu design mostra por que razão o trabalho efetivo de descodificação é revelado token a token, em vez de ser perfeitamente conhecido a partir do pedido inicial. Esta distinção continua visível durante os testes domésticos posteriores.
Por isso, as estimativas devem reservar um limite máximo sem cobrar a cada pedido como se atingisse esse limite. Trabalhos em segundo plano grandes mas de baixo risco podem entrar numa fila, enquanto o trabalho interativo pode ser rejeitado antecipadamente quando a sua memória no pior caso comprometeria uma reserva existente.
Os medidores de execução aplicam limites a tokens, tempo, memória e ferramentas
Cada serviço comunica a utilização normalizada associada ao ID do pedido: tokens do prompt e gerados, milissegundos de GPU, memória máxima, tempo de CPU, bytes lidos, chamadas de ferramentas, novas tentativas e operações externas. Um registo central subtrai atomicamente a utilização, para que os ramos paralelos não possam gastar cada um o orçamento restante na totalidade.
agendamento de pré-preenchimento em blocos estuda o pré-preenchimento em blocos e o agendamento sem interrupções para equilibrar o débito com a latência da descodificação. Isto ilustra como um prompt longo pode consumir a capacidade do serviço em rajadas, a menos que o trabalho seja dividido em unidades aplicáveis. O resultado intermédio deve permanecer inspecionável antes de a automatização prosseguir.
Os orçamentos de ferramentas precisam de categorias semânticas, não apenas de contagens. Dez chamadas de metadados só de leitura são diferentes de um envio de mensagem ou de uma pesquisa recursiva de ficheiros, pelo que a política pode limitar independentemente a classe de efeitos secundários, o âmbito do alvo, os bytes de saída e o tempo de execução acumulado.
O cancelamento e os resultados parciais definem o limite do orçamento
O cancelamento cooperativo propaga-se pela recuperação, geração e ferramentas, e cada etapa verifica o prazo ou o orçamento restante antes de iniciar trabalho dispendioso. As chaves de idempotência impedem que uma nova tentativa cancelada repita um efeito secundário externo. Esse limite deve ser medido separadamente em condições operacionais realistas.
agendamento equitativo da GPU distribui no tempo os ciclos do acelerador para impedir a inanição dos pedidos e analisa o custo da transferência do contexto de inferência. O trabalho demonstra que os controlos de equidade devem ter em conta tanto o tempo de computação como o estado da memória. A consequência prática surge quando várias fontes competem por um contexto limitado.
O limite de falha é a contabilização sem aplicação efetiva. Um painel pode comunicar excessos enquanto um pedido continua a monopolizar a GPU. Quando um limite é atingido, o sistema tem de parar num ponto de verificação seguro, devolver um resultado parcial explícito e distinguir o esgotamento do orçamento de uma falha do modelo ou da ferramenta.
Teste os orçamentos com formatos de pedidos adversariais
Crie pedidos com entradas enormes, prompts de saída sem limite, planos recursivos de ferramentas, ramos paralelos, ciclos de novas tentativas, ferramentas lentas, falhas de cache e cancelamentos durante efeitos secundários. Atribua orçamentos distintos a dois utilizadores e a um serviço em segundo plano. Esta dependência deve permanecer explícita na interface final.
Utilize o limite de QoS por utilizador em política de recursos por utilizador para registar os tokens reservados e efetivos, o tempo de GPU, a memória máxima, o atraso na fila, as operações das ferramentas, a contagem de novas tentativas, o atraso do cancelamento e a qualidade do resultado parcial. Confirme que os spans subordinados herdam o orçamento do elemento-pai em vez de o reporem.
Considere aprovado apenas quando todas as ações dispendiosas forem atribuídas e nenhum pedido exceder um limite rígido para além do trabalho de limpeza documentado. Se não for possível fazer uma estimativa precisa, admita de forma conservadora e devolva a capacidade não utilizada, em vez de permitir que os serviços a jusante inventem novos orçamentos.
Centro de Tecnologia e IA
Mais para Ler

Que funcionalidades permitem criar um limite de confiança de IA doméstica em torno de ficheiros sensíveis?
Veja como a classificação, o acesso limitado por capacidades, a análise isolada, os filtros de recuperação, a política de saída de dados, as aprovações...

Que fatores determinam se as cópias de segurança baseadas em árvores de Merkle detetam alterações silenciosas de forma eficiente?
Saiba como o tamanho dos blocos, o fator de ramificação, as raízes fidedignas, os hashes em cache, a localidade das alterações, o âmbito dos...

Que componentes permitem cópias de segurança verificáveis de índices de IA e do estado dos modelos?
Veja como snapshots coordenados, manifestos de conteúdo, somas de verificação, bloqueios de versão, simulações de restauro e testes de consulta comprovam que o estado...

