O NVIDIA PAIR altera uma suposição importante sobre o escalonamento da IA local: obter mais capacidade de computação nem sempre significa comprar um servidor de GPU maior. O PAIR liga computadores compatíveis na mesma rede local e encaminha pedidos de inferência independentes do Ollama ou do LM Studio para máquinas capazes de os executar. Assim, um PC de gaming, uma estação de trabalho, um Mac ou uma caixa de IA dedicada podem contribuir para o mesmo conjunto de inferência local.
Mas existe uma limitação importante. O PAIR não combina várias GPUs num acelerador maior, não agrega a VRAM nem divide um único modelo por vários PCs comuns. O seu verdadeiro valor é outro: permite que vários trabalhos de IA independentes utilizem várias máquinas em simultâneo. Essa distinção determina se o PAIR altera realmente a forma como deve construir um sistema de IA local.
O que é o NVIDIA PAIR?
O NVIDIA Personal AI Router, ou PAIR, é uma camada local de encaminhamento de inferência que fornece às aplicações de IA compatíveis um único ponto de acesso familiar, distribuindo os pedidos por computadores emparelhados na mesma rede.
A visão técnica geral do PAIR da NVIDIA descreve o sistema como um encaminhador de inferência virtual para o Ollama e o LM Studio. O suporte beta atual inclui sistemas compatíveis com Windows, Linux e macOS, com hardware RTX compatível, DGX Spark e sistemas Apple M4+ entre os destinos indicados.
O PAIR não substitui o motor de inferência. O Ollama ou o LM Studio continua a carregar e executar o modelo na máquina selecionada para esse pedido. O PAIR trata da descoberta, do conhecimento dos modelos, da elegibilidade dos nós e do encaminhamento, através da interface local familiar.
O NVIDIA PAIR combina a memória das GPUs?
Não. O PAIR não agrega a VRAM, não cria uma GPU virtual nem divide um único pedido de inferência por vários sistemas comuns.
Este é o limite técnico mais importante a compreender antes de chamar ao PAIR um cluster de IA local.
Se tiver:
- um sistema com RTX e 24 GB de VRAM,
- outro sistema com RTX e 24 GB de VRAM,
- e um Mac com a sua própria memória unificada,
O PAIR não os transforma automaticamente num único conjunto de memória maior, capaz de carregar um modelo que nenhuma das máquinas individuais consegue suportar.
A NVIDIA deixa esta limitação explícita nas perguntas frequentes do PAIR da NVIDIA. Cada pedido de inferência é enviado para um nó elegível, e esse nó tem de conseguir executar o modelo solicitado por si próprio.
| Objetivo de dimensionamento | O PAIR ajuda? |
|---|---|
| Combinar duas GPUs de 24 GB para obter 48 GB de VRAM | Não |
| Dividir um modelo de grandes dimensões por vários PCs comuns | Não |
| Executar vários pedidos de IA independentes em simultâneo | Sim |
| Encaminhar o trabalho para longe de um nó compatível ocupado | Sim, quando está disponível outro nó elegível |
| Utilizar máquinas diferentes para modelos diferentes | Sim |
O PAIR aumenta principalmente a simultaneidade e a capacidade de inferência disponível, não a memória máxima disponível para um único modelo.
O que é que o PAIR da NVIDIA distribui realmente?
O PAIR distribui pedidos de inferência independentes.
Isto é importante porque as aplicações modernas de IA geram cada vez mais várias chamadas ao modelo a partir de um único objetivo do utilizador. Um fluxo de trabalho multiagente pode atribuir tarefas distintas para pesquisar fontes, inspecionar código, resumir documentos, classificar ficheiros ou verificar uma resposta.
Se essas tarefas forem suficientemente independentes para serem executadas em paralelo, várias máquinas podem contribuir simultaneamente com capacidade de computação útil.
- O paralelismo de modelos faz com que vários aceleradores cooperem num único modelo de grandes dimensões ou numa única tarefa de inferência.
- O PAIR disponibiliza vários computadores independentes para diferentes tarefas de inferência.
Nos fluxos de trabalho com agentes, o segundo problema está a tornar-se cada vez mais importante.
Porque é que o PAIR é mais importante para agentes de IA do que para chatbots simples?
Um chatbot tradicional é sobretudo sequencial: o utilizador envia uma mensagem, o modelo devolve uma resposta e o pedido seguinte vem depois.
Os sistemas de agentes podem comportar-se de forma diferente. Um objetivo pode gerar várias subtarefas e algumas dessas tarefas podem ser executadas em simultâneo. Isto altera a questão do dimensionamento da IA local, que deixa de ser apenas «Qual é o maior modelo que esta GPU consegue carregar?» e passa a ser também «Quantas tarefas de inferência úteis consegue a minha infraestrutura local processar em simultâneo?»
A NVIDIA demonstrou o PAIR com um fluxo de trabalho Hermes Desktop que continha cinco subagentes. No teste específico da configuração da NVIDIA, três sistemas participantes concluíram a carga de trabalho em 8 minutos e 48 segundos, em comparação com 18 minutos num único portátil RTX Spark.
Esse resultado é uma demonstração do fornecedor, não uma garantia de desempenho geral. A conclusão útil é mais específica: as cargas de trabalho com um número suficiente de tarefas de inferência independentes podem beneficiar de mais trabalhadores independentes.
Isto também altera a economia do hardware que já possui. Uma comparação mais abrangente dos custos da IA local ajuda a separar o valor de reutilizar capacidade de computação inativa da questão muito diferente de saber se deve comprar uma máquina de inferência dedicada.
Como é que o NVIDIA PAIR decide qual o computador que processa um pedido?
O PAIR não distribui simplesmente os pedidos de forma rotativa por todos os computadores.
A documentação oficial do PAIR indica que um nó tem de estar acessível, executar um motor de inferência compatível e anunciar o modelo exato solicitado antes de se tornar elegível.
Entre os nós elegíveis, o PAIR considera o trabalho atual e as tarefas recentemente distribuídas, para que os pedidos simultâneos possam ser distribuídos pelas máquinas disponíveis em vez de ficarem todos em fila atrás de um único motor.
Isto cria uma regra importante: aderir ao cluster PAIR não torna todos os nós capazes de disponibilizar todos os modelos.
Os modelos permanecem associados ao motor de inferência instalado em cada máquina. Um nó pode ter um modelo de programação, enquanto outro tem um modelo de uso geral, e os pedidos podem ser encaminhados de acordo com a disponibilidade dos modelos.
Os modelos são sincronizados automaticamente entre os nós do PAIR?
Não. Os nós não partilham automaticamente os ficheiros dos modelos.
Se apenas um computador tiver um determinado modelo, apenas esse computador poderá processar pedidos para esse modelo. Instalar o mesmo modelo em vários nós dá ao PAIR mais máquinas elegíveis para essa carga de trabalho.
Isto cria duas estratégias úteis:
Replicar modelos utilizados frequentemente
Coloque o mesmo modelo muito utilizado em vários nós quando quiser maior capacidade de simultaneidade ou máquinas alternativas para esse tipo de pedido.
Especializar nós diferentes
Permita que diferentes computadores alojem modelos adequados ao seu hardware ou função — por exemplo, um modelo de programação num sistema e um modelo geral mais leve noutro.
Assim, o PAIR pode criar um grupo de inferência heterogéneo, mas a colocação dos modelos continua a ser uma decisão de planeamento de capacidade. A mesma regra de adequação da memória aplica-se a todos os nós, pelo que os atuais requisitos de hardware do Ollama continuam a ser relevantes para decidir quais os modelos que uma determinada máquina pode disponibilizar.
É necessário reescrever as aplicações Ollama e LM Studio para o PAIR?
Uma das escolhas de design mais fortes do PAIR é permitir que as aplicações compatíveis continuem a utilizar interfaces locais familiares.
O PAIR coloca um proxy à frente do Ollama ou do LM Studio. A aplicação comunica com um endpoint local compatível com Ollama ou OpenAI, enquanto o PAIR decide qual o nó emparelhado que irá efetivamente executar a inferência.
Isso significa que a aplicação não precisa de acompanhar:
- o endereço IP de cada computador,
- qual a máquina que está atualmente ocupada,
- onde está instalado um modelo solicitado,
- ou qual o nó que deve receber o pedido seguinte.
A NVIDIA descreve isto como não exigindo alterações aos agentes ou harnesses em fluxos de trabalho compatíveis.
Essa distinção também explica o que é o PAIR: infraestrutura de inferência, não uma estrutura de agentes.
O NVIDIA PAIR é um harness de agentes de IA?
Não. O PAIR e um harness de agentes resolvem problemas diferentes.
Um harness de agentes decide que trabalho deve ser realizado, como uma tarefa é decomposta, que ferramentas são utilizadas e como os subagentes coordenam o seu trabalho. O PAIR funciona numa camada inferior da pilha. Assim que existe um pedido de inferência, ajuda a decidir qual das máquinas locais elegíveis o deve processar.
| Camada | Responsabilidade principal |
|---|---|
| Harness de agentes | Planeia tarefas e coordena fluxos de trabalho |
| Encaminhador de modelos | Escolhe qual é o modelo que deve tratar uma tarefa |
| NVIDIA PAIR | Escolhe qual das máquinas locais elegíveis processa um pedido |
| Ollama / LM Studio | Carrega o modelo e executa a inferência |
| Infraestrutura persistente | Armazena ficheiros, o estado das tarefas, índices, registos e serviços de longa duração |
Esta separação permite que o PAIR funcione sob diferentes sistemas de agentes sem assumir o controlo da lógica de planeamento. Se quiser explorar a camada acima, o nosso guia sobre plugins do DeepSeek Harness mostra como um harness pode alterar o comportamento do fluxo de trabalho, deixando o encaminhamento da inferência para uma camada separada.
O PAIR pode transformar PCs domésticos inativos em capacidade de computação de IA útil?
Sim — quando a carga de trabalho tem pedidos independentes suficientes e as máquinas disponíveis têm efetivamente os modelos necessários.
Muitas casas e pequenos escritórios já têm capacidade computacional subutilizada:
- um PC de gaming,
- uma estação de trabalho,
- um Mac compatível,
- uma máquina de IA local dedicada,
- ou um sistema DGX Spark.
O PAIR permite que essas máquinas contribuam com capacidade sem exigir um cluster tradicional sempre ligado. Um PC de gaming pode ficar ocupado, um portátil pode entrar em suspensão e outro sistema disponível pode continuar a processar pedidos compatíveis.
Mas o tempo de GPU disponível, por si só, não é suficiente. Um nó livre não pode processar um pedido se não tiver o modelo solicitado ou se a máquina não tiver memória suficiente para o executar.
O que acontece quando um nó PAIR fica ocupado ou fica offline?
O PAIR acompanha quais nós estão disponíveis e encaminha novos pedidos apenas para máquinas elegíveis.
Se uma estação de trabalho ficar ocupada enquanto outro nó adequado estiver pronto, os pedidos independentes posteriores podem ser encaminhados para outro local. Isto torna o conjunto mais elástico do que associar rigidamente cada aplicação a um único servidor de inferência fixo.
Continuam a existir casos claros de falha:
- o modelo necessário existe apenas num nó indisponível,
- não existe nenhum motor compatível pronto,
- ou nenhuma máquina disponível tem capacidade suficiente para o pedido.
O PAIR melhora a utilização, mas não elimina o planeamento da capacidade.
Quando é que um servidor com uma única GPU potente continua a ser melhor do que o NVIDIA PAIR?
O PAIR não torna obsoletos os servidores de IA dedicados.
Um único sistema potente pode continuar a ser a melhor opção quando a carga de trabalho requer:
- um modelo que excede a memória disponível em todos os nós PAIR,
- inferência previsível 24/7,
- disponibilidade consistente do modelo,
- utilização elevada sustentada,
- inferência com várias GPUs fortemente acopladas,
- ou operações mais simples.
Um servidor dedicado também evita depender de computadores portáteis ou PCs gaming que podem entrar em suspensão, ser transportados, reiniciados ou requisitados para outras tarefas.
O PAIR é mais eficaz quando o problema é capacidade distribuída não utilizada, e não memória insuficiente em cada máquina individual.
| Requisito de IA local | PAIR | Servidor de GPU dedicado |
|---|---|---|
| Várias tarefas de agentes independentes | Excelente adequação | Também é possível |
| Utilizar hardware misto existente | Excelente adequação | Requer hardware dedicado |
| Um modelo excede a memória de todos os nós | O PAIR, por si só, não resolve este problema | Potencialmente melhor com memória suficiente |
| Inferência previsível sempre ativa | Depende dos nós disponíveis | Excelente adequação |
| Computação doméstica elástica | Excelente adequação | Menos relevante |
| Administração simples | Várias máquinas para manter | Frequentemente mais simples |
Se a IA local já concorre com o armazenamento, os conteúdos multimédia, as cópias de segurança ou outros serviços numa única máquina, as limitações não estão apenas relacionadas com a GPU. O nosso guia sobre limites dos servidores de IA local aborda os sinais de que a inferência está a começar a desestabilizar o resto de um servidor doméstico.
O NVIDIA PAIR mantém os dados de IA local privados?
O PAIR foi concebido para manter os prompts, os dados e o tráfego de inferência na rede local, em vez de enviar a inferência para um serviço na nuvem.
A arquitetura de confiança PAIR da NVIDIA documenta o emparelhamento explícito de nós e o TLS mútuo entre sistemas emparelhados.
Isso não torna todas as implementações locais automaticamente seguras. Os utilizadores continuam a precisar de dispositivos fidedignos, uma rede fidedigna, permissões de aplicações sensatas e segurança normal dos terminais.
O encaminhamento local protege um limite diferente do da inferência na nuvem: mantém o pedido ao modelo dentro da própria rede do utilizador, mas a segurança dessa rede e das máquinas nela existentes continua a ser importante.
O NVIDIA PAIR pode tornar-se um endpoint de API de IA para toda a rede?
Não por predefinição.
O endpoint PAIR voltado para as aplicações é local à máquina que executa a aplicação. Essa máquina pode encaminhar pedidos para outro nó capaz, mas o PAIR não expõe automaticamente um serviço de inferência aberto a dispositivos arbitrários na LAN.
Se um utilizador quiser uma única API Ollama ou compatível com OpenAI, exposta centralmente a toda a rede, essa é uma decisão de implementação separada.
Esta é outra razão para encarar o PAIR como uma camada de encaminhamento, e não como uma plataforma completa para servidores domésticos.
Onde se enquadra um servidor doméstico se o PAIR utiliza PCs para a inferência?
O PAIR torna a computação mais elástica, enquanto outras partes de um sistema de IA útil continuam a beneficiar da persistência.
Os nós GPU podem entrar em suspensão, ficar ocupados, sair da rede ou especializar-se em modelos diferentes. Os serviços de longa duração têm um requisito diferente.
Um servidor local persistente pode continuar a armazenar:
- ambiente de execução e agendamentos dos agentes,
- ficheiros privados,
- índices RAG,
- bases de dados vetoriais,
- estado das tarefas,
- registos,
- arquivos de modelos,
- e pelas cópias de segurança.
Isto cria uma distinção útil entre computação elástica e estado persistente. O PAIR centra-se no primeiro problema; um servidor doméstico pode continuar responsável pelo segundo.
Essa separação já é útil num assistente privado de IA num NAS, onde os ficheiros de longa duração e o estado de recuperação não têm de estar na mesma máquina que executa todas as chamadas ao modelo.
Isto também altera a forma como encara a IA local e o armazenamento de ficheiros. Um servidor de armazenamento estável pode permanecer sempre ligado, enquanto nós de inferência mais potentes se juntam à carga de trabalho apenas quando necessário.
A arquitetura híbrida mais ampla de agentes de IA segue o mesmo princípio: nem todas as partes de um sistema de IA precisam de ser executadas na mesma máquina.
O NVIDIA PAIR significa que já não precisa de um único servidor com uma GPU de grandes dimensões?
Não necessariamente. O PAIR altera a questão da escalabilidade, em vez de eliminar a necessidade de servidores de IA dedicados.
Antes de comprar um sistema GPU maior, os utilizadores de IA local têm agora outra pergunta a fazer:
O meu estrangulamento é um modelo que precisa de mais memória ou são várias tarefas de inferência a competir pela mesma máquina?
Se o problema for um único modelo demasiado grande, o encaminhamento de pedidos do PAIR não cria VRAM agregada e poderá não resolver a questão.
Se o problema for ter vários agentes, vários utilizadores, vários modelos ou muitas tarefas de IA local independentes a competir por uma única GPU, transformar os computadores existentes num conjunto de inferência pode ser muito mais útil.
Essa é a verdadeira importância do PAIR. A expansão da IA local já não tem de significar substituir a máquina existente por uma caixa maior. Em algumas cargas de trabalho, pode significar utilizar de forma mais eficiente o poder de computação já distribuído pela casa ou pelo escritório.
A configuração de IA local do futuro poderá ser menos parecida com um único computador gigante e mais com um servidor doméstico persistente rodeado por um conjunto elástico de nós de inferência.
FAQ: NVIDIA PAIR e clusters de IA local
O NVIDIA PAIR consegue combinar a VRAM de várias GPUs?
Não. O PAIR não agrega memória GPU nem cria uma GPU virtual. Cada pedido de inferência é executado num nó elegível que consegue processar o modelo solicitado.
O NVIDIA PAIR consegue executar um modelo demasiado grande para uma GPU?
Não através da agregação de memória entre nós PAIR comuns. A máquina selecionada continua a precisar de memória suficiente para carregar e executar o modelo solicitado. Outras tecnologias de inferência distribuída resolvem um problema diferente.
O NVIDIA PAIR funciona com o Ollama?
Sim. Atualmente, o PAIR disponibiliza um proxy local compatível com Ollama e pode encaminhar pedidos Ollama compatíveis entre nós emparelhados elegíveis.
O NVIDIA PAIR funciona com o LM Studio?
Sim. O PAIR também é compatível com o LM Studio através de um endpoint local compatível com OpenAI.
O NVIDIA PAIR pode utilizar Macs e PCs com RTX em conjunto?
Sim, os sistemas compatíveis com macOS, Windows e Linux podem participar no mesmo cluster PAIR. Consulte a lista de compatibilidade atual da NVIDIA antes de assumir que uma máquina específica é compatível.
Todos os nós PAIR precisam do mesmo modelo?
Não. Os nós podem alojar modelos diferentes. Uma máquina só pode processar um pedido quando o seu motor de inferência local tem o modelo solicitado, enquanto replicar o mesmo modelo em vários nós cria mais opções de encaminhamento.
Ainda precisa de um servidor de IA dedicado com o NVIDIA PAIR?
Depende da carga de trabalho. O PAIR é uma opção atrativa para várias tarefas de inferência independentes e para hardware existente diversificado. Um servidor GPU dedicado pode continuar a ser melhor para modelos únicos de grandes dimensões, inferência previsível 24/7 ou cargas de trabalho estreitamente acopladas entre várias GPUs.
Centro de Tecnologia e IA
Mais para Ler

Os modelos abertos estão a alcançar a IA de fronteira — será 2026 o ano em que a IA local se torna suficientemente boa?
Os modelos abertos estão a tornar-se suficientemente bons para mais cargas de trabalho locais de IA, enquanto os modelos de ponta na nuvem continuam...

Porque é que o Immich parece mais rápido na LAN do que em ligações remotas?
Os pedidos na LAN seguem normalmente um percurso mais curto e com menor latência. O acesso remoto acrescenta limitações de capacidade da WAN e...

O Immich funciona de forma fiável por trás de CGNAT ou de NAT duplo?
O CGNAT e o NAT duplo não impedem a utilização local do Immich. Complicam sobretudo o acesso remoto direto de entrada e podem obrigar...

