As médias de latência podem parecer saudáveis enquanto a IA interativa parece lenta, porque as esperas longas raras e as pausas sequenciais dominam as interações de que os utilizadores se recordam.
Nove pedidos locais podem começar em 300 milissegundos, enquanto o décimo espera cinco segundos pelo carregamento do modelo ou por uma ferramenta. A média mantém-se abaixo de um segundo, mas a conversa parece repetidamente interrompida. A qualidade da interação depende da distribuição e da sequência dos atrasos, não de um único valor central calculado entre tipos de pedidos não relacionados para a interação de que a pessoa se recorda.
A Média Esconde a Forma da Distribuição dos Atrasos
Uma média aritmética combina todos os pedidos num único número. Alguns turnos muito lentos podem ser diluídos por muitos acertos de cache ou pedidos curtos. Os percentis revelam a frequência com que os utilizadores ultrapassam um determinado limiar de atraso, embora até o p95 possa esconder o pior 1%.
A cauda da latência explica que uma pequena fração de componentes lentos pode dominar a latência de um pedido completo em sistemas com distribuição de pedidos. A IA interativa espera igualmente pela fase obrigatória mais lenta.
A composição da carga de trabalho também é importante. As verificações de estado e as chamadas de estado em cache não devem partilhar uma média de latência com interações de voz, recuperação RAG ou ações de ferramentas. Um valor agregado baixo pode estar matematicamente correto e ser operacionalmente irrelevante.
Os Utilizadores Vivenciam Marcos e Paragens, Não Apenas a Conclusão
Uma interação de chat tem vários relógios: espera na fila, recuperação, primeiro token, cadência dos tokens, espera por ferramentas e conclusão final. Um tempo total rápido, com uma abertura silenciosa prolongada, pode parecer pior do que uma resposta ligeiramente mais longa que começa prontamente e é transmitida de forma uniforme.
Uma análise da latência distingue o tempo até ao primeiro token do tempo de resposta completo, porque estas métricas representam partes diferentes do comportamento do modelo. Ambas são necessárias para descrever uma interação interativa.
As pausas visíveis também têm uma ordem. Uma paragem de uma ferramenta após vários tokens interrompe a atenção de forma diferente da mesma espera antes do primeiro token. Uma média entre fases apaga essa estrutura da interação e direciona a otimização para o componente errado.
Onde os Percentis Continuam a Induzir em Erro
Os percentis falham quando a ferramenta de medição deixa de emitir trabalho durante as paragens, recolhe amostras apenas de pedidos concluídos ou agrega períodos de tempo não relacionados. Esta omissão coordenada pode subcontabilizar precisamente os atrasos que os utilizadores enfrentam sob carga.
A análise de Gil Tene sobre a omissão coordenada mostra por que motivo os testes de carga devem preservar o calendário de pedidos previsto, em vez de abrandarem os envios quando o sistema abranda. Caso contrário, as distribuições de latência parecem artificialmente saudáveis.
A explicação da latência de cauda também deixa de se aplicar se o rastreio de todas as fases for rápido, mas os utilizadores continuarem a reportar lentidão. A apresentação da interface, o armazenamento intermédio da rede ou o feedback atrasado podem estar fora dos limites medidos do servidor. Mais painéis de percentis não ajudam quando o relógio começa demasiado tarde ou para demasiado cedo.
Rastreie os Marcos pelos Quais os Utilizadores Esperam Realmente
Registe a colocação na fila, o início da execução, a conclusão da recuperação, o primeiro token, cada chamada de ferramenta, o token final e a apresentação no cliente com um único identificador de rastreio monotónico. Apresente p50, p95, p99, máximo e taxa de excedência do limiar por tipo de interação e por estado frio ou quente.
Utilize rastreios de arranques a frio da IA para separar o carregamento a frio da inferência em estado estável. Mantenha as interações falhadas e canceladas no conjunto de dados, em vez de excluir as respetivas esperas.
Reproduza os pedidos segundo um calendário previsto fixo e compare os marcos visíveis no cliente com os visíveis no servidor. Otimize a fase responsável pelo percentil lento. Se os rastreios do servidor e do cliente divergirem, acompanhe o transporte e a apresentação; se apenas as interações a frio apresentarem picos, trate do carregamento em vez da geração em estado estável.
Centro de Tecnologia e IA
Mais para Ler

Porque é que o calor da IA local é diferente numa prateleira aberta e num armário fechado?
Analise a geração de calor, a circulação de ar e a recirculação em posicionamentos abertos e fechados, e meça as variáveis que os distinguem.

Porque é que um servidor doméstico parece mais silencioso à noite, mesmo à mesma velocidade da ventoinha?
Compreenda por que uma velocidade da ventoinha inalterada não garante uma perceção de volume sonoro inalterada e como distinguir entre mascaramento, condições da divisão...

Porque é que as cópias de segurança deduplicadas parecem menores do que o espaço ocupado após o restauro?
Veja como a deduplicação altera os bytes armazenados, mas não o significado restaurado, por que os ficheiros esparsos e comprimidos complicam os totais e...

