Último Blog
Como é que a Relevância Marginal Máxima reduz a redundância das evidências RAG?
O MMR reordena um conjunto de candidatos, valorizando a relevância e penalizando a semelhança com as passagens já selecionadas, deixando mais espaço para evidências independentes.
Como é que o paralelismo de pipeline move as camadas do modelo entre aceleradores de IA domésticos?
O paralelismo de pipeline coloca diferentes grupos de camadas em diferentes aceleradores e move as ativações através deles pela ordem, reduzindo a memória do modelo por dispositivo.
Como é que o paralelismo de tensores divide a inferência local de IA por várias GPUs?
O paralelismo de tensores divide os tensores das camadas entre GPUs, pelo que cada dispositivo calcula um fragmento e a comunicação coletiva reconstrói o resultado lógico.
Como é que o descarregamento para a CPU mantém modelos de grandes dimensões a funcionar num servidor doméstico?
O descarregamento do CPU mantém modelos de grandes dimensões executáveis, armazenando parte dos respetivos pesos na RAM do sistema e transferindo os tensores necessários para o acelerador durante a execução.
Como é que o encaminhamento Mixture-of-Experts altera a computação de modelos locais?
O encaminhamento MoE ativa especialistas selecionados por token, reduzindo a computação das camadas de especialistas em relação ao total de parâmetros, enquanto o conjunto completo de especialistas permanece armazenado.
Como é que o Flash Attention reduz o tráfego de memória durante a inferência local?
O Flash Attention mantém o processamento da atenção em blocos no chip e evita materializar a matriz de pontuações completa, reduzindo o tráfego na HBM sem aproximar o cálculo da atenção.
Como é que a Paged Attention gere a cache KV com pedidos de IA locais simultâneos?
A PagedAttention mapeia o histórico KV lógico de cada pedido para blocos de memória de tamanho fixo, alocando e reciclando capacidade à medida que as sequências simultâneas se alteram.
Como é que a colocação em cache de prefixos reduz o trabalho repetido dos prompts num servidor de IA doméstico?
A colocação em cache de prefixos reutiliza o estado de atenção de um prefixo de prompt partilhado, pelo que os pedidos subsequentes calculam apenas o sufixo não colocado em cache antes de a descodificação normal prosseguir.
