NVIDIA PAIR cambia una suposición importante sobre la ampliación de la IA local: obtener más capacidad de cálculo no siempre significa comprar un servidor con una GPU más grande. PAIR conecta ordenadores compatibles en la misma red local y dirige las solicitudes de inferencia independientes de Ollama o LM Studio a las máquinas capaces de atenderlas. Por tanto, un PC para juegos, una estación de trabajo, un Mac o un equipo de IA dedicado pueden contribuir al mismo conjunto de inferencia local.
Pero hay una limitación importante. PAIR no combina varias GPU en un acelerador más grande, no agrupa su VRAM ni divide un modelo entre varios PC convencionales. Su verdadero valor es diferente: permite que varios trabajos de IA independientes utilicen varias máquinas al mismo tiempo. Esta distinción determina si PAIR cambia realmente la forma en que deberías crear un sistema de IA local.
¿Qué es NVIDIA PAIR?
NVIDIA Personal AI Router, o PAIR, es una capa local de enrutamiento de inferencias que ofrece a las aplicaciones de IA compatibles un único punto de acceso conocido, mientras distribuye las solicitudes entre ordenadores emparejados de la misma red.
El resumen técnico de PAIR de NVIDIA describe el sistema como un enrutador virtual de inferencia para Ollama y LM Studio. La compatibilidad beta actual incluye sistemas compatibles con Windows, Linux y macOS, con hardware RTX compatible, DGX Spark y sistemas Apple M4+ entre los destinos indicados.
PAIR no sustituye al motor de inferencia. Ollama o LM Studio siguen cargando y ejecutando el modelo en la máquina seleccionada para esa solicitud. PAIR se encarga del descubrimiento, el conocimiento de los modelos, la elegibilidad de los nodos y el enrutamiento detrás de la conocida interfaz local.
¿NVIDIA PAIR combina la memoria de las GPU?
No. PAIR no agrupa la VRAM, no crea una GPU virtual ni divide una única solicitud de inferencia entre varios sistemas ordinarios.
Este es el límite técnico más importante que debes entender antes de considerar PAIR un clúster de IA local.
Si tienes:
- un sistema RTX con 24 GB de VRAM,
- otro sistema RTX con 24 GB de VRAM,
- y un Mac con su propia memoria unificada,
PAIR no los transforma automáticamente en un único grupo de memoria más grande capaz de cargar un modelo que ninguna de las máquinas individuales puede albergar.
NVIDIA hace explícita esta limitación en las preguntas frecuentes de NVIDIA PAIR. Cada solicitud de inferencia se envía a un nodo apto, y ese nodo debe poder ejecutar el modelo solicitado por sí mismo.
| Objetivo de escalado | ¿Ayuda PAIR? |
|---|---|
| Combinar dos GPU de 24 GB para obtener 48 GB de VRAM | No |
| Dividir un modelo grande entre varios ordenadores convencionales | No |
| Ejecutar varias solicitudes de IA independientes simultáneamente | Sí |
| Desviar el trabajo de un nodo compatible ocupado | Sí, cuando hay otro nodo apto disponible |
| Usar máquinas diferentes para modelos diferentes | Sí |
PAIR escala principalmente la concurrencia y la capacidad de inferencia disponible, no la memoria máxima disponible para un solo modelo.
¿Qué distribuye realmente NVIDIA PAIR?
PAIR distribuye solicitudes de inferencia independientes.
Esto es importante porque las aplicaciones modernas de IA generan cada vez más varias llamadas al modelo a partir de un único objetivo del usuario. Un flujo de trabajo multiagente puede asignar tareas separadas para investigar fuentes, inspeccionar código, resumir documentos, clasificar archivos o verificar una respuesta.
Si esas tareas son lo bastante independientes como para ejecutarse en paralelo, varias máquinas pueden aportar capacidad de cálculo útil al mismo tiempo.
- El paralelismo de modelos hace que varios aceleradores cooperen en un único modelo grande o en una única tarea de inferencia.
- PAIR pone varios ordenadores independientes a disposición de distintas tareas de inferencia.
En los flujos de trabajo con agentes, el segundo problema es cada vez más importante.
¿Por qué es PAIR más importante para los agentes de IA que para los chatbots simples?
Un chatbot tradicional es principalmente secuencial: el usuario envía un mensaje, el modelo devuelve una respuesta y, después, llega la siguiente solicitud.
Los sistemas de agentes pueden comportarse de manera diferente. Un objetivo puede generar varias subtareas, y algunas de ellas pueden ejecutarse al mismo tiempo. Esto cambia la pregunta sobre el escalado de la IA local: ya no es solo «¿Cuál es el modelo más grande que puede cargar esta GPU?», sino también «¿Cuántas tareas de inferencia útiles puede gestionar simultáneamente mi infraestructura local?»
NVIDIA demostró PAIR con un flujo de trabajo de Hermes Desktop que contenía cinco subagentes. En la prueba específica de configuración de NVIDIA, tres sistemas participantes completaron la carga de trabajo en 8 minutos y 48 segundos, frente a los 18 minutos de un portátil RTX Spark.
Ese resultado es una demostración del proveedor, no una garantía de rendimiento general. La conclusión útil es más específica: las cargas de trabajo con suficientes tareas de inferencia independientes pueden beneficiarse de un mayor número de trabajadores independientes.
Esto también cambia la economía del hardware que ya posees. Una comparativa más amplia de los costes de la IA local ayuda a distinguir el valor de reutilizar capacidad de cómputo inactiva de la cuestión, muy diferente, de si conviene comprar una máquina de inferencia dedicada.
¿Cómo decide NVIDIA PAIR qué equipo ejecuta una solicitud?
PAIR no se limita a rotar las solicitudes entre todos los equipos.
La documentación oficial de PAIR indica que un nodo debe ser accesible, ejecutar un motor de inferencia compatible y anunciar el modelo exacto solicitado antes de ser apto.
Entre los nodos aptos, PAIR tiene en cuenta la carga de trabajo actual y los trabajos enviados recientemente, de modo que las solicitudes simultáneas pueden distribuirse entre las máquinas disponibles en lugar de quedar todas en cola detrás de un solo motor.
Esto establece una regla importante: unirse al clúster de PAIR no hace que todos los nodos puedan ejecutar todos los modelos.
Los modelos permanecen asociados al motor de inferencia instalado en cada máquina. Un nodo puede tener un modelo de programación mientras otro tiene un modelo de uso general, y las solicitudes pueden dirigirse según la disponibilidad de los modelos.
¿Los modelos se sincronizan automáticamente entre los nodos de PAIR?
No. Los nodos no comparten automáticamente los archivos de los modelos.
Si solo un equipo tiene un modelo determinado, únicamente ese equipo puede atender solicitudes para él. Instalar el mismo modelo en varios nodos proporciona a PAIR más máquinas aptas para esa carga de trabajo.
Esto crea dos estrategias útiles:
Replica los modelos más utilizados
Coloca el mismo modelo de uso intensivo en varios nodos cuando quieras más capacidad de concurrencia o máquinas alternativas para ese tipo de solicitudes.
Especializa distintos nodos
Permite que distintos equipos alojen modelos que se ajusten a su hardware o función; por ejemplo, un modelo de programación en un sistema y un modelo general más ligero en otro.
PAIR puede crear así un grupo de inferencia heterogéneo, pero la asignación de modelos sigue siendo una decisión de planificación de capacidad. La misma regla de ajuste a la memoria se aplica a cada nodo, por lo que los requisitos de hardware de Ollama actuales siguen siendo relevantes al decidir qué modelos puede ejecutar una máquina determinada.
¿Es necesario reescribir las aplicaciones de Ollama y LM Studio para PAIR?
Una de las decisiones de diseño más acertadas de PAIR es que las aplicaciones compatibles pueden seguir utilizando interfaces locales conocidas.
PAIR coloca un proxy delante de Ollama o LM Studio. La aplicación se comunica con un endpoint local compatible con Ollama o con OpenAI, mientras PAIR decide qué nodo emparejado realizará finalmente la inferencia.
Eso significa que la aplicación no necesita registrar:
- la dirección IP de cada equipo,
- qué máquina está ocupada actualmente,
- dónde está instalado el modelo solicitado,
- o qué nodo debe recibir la siguiente solicitud.
NVIDIA describe esto como una solución que no requiere cambios en el agente ni en el harness para los flujos de trabajo compatibles.
Esa distinción también explica qué es PAIR: infraestructura de inferencia, no un marco de agentes.
¿Es NVIDIA PAIR un harness de agentes de IA?
No. PAIR y un harness de agentes resuelven problemas diferentes.
Un harness de agentes decide qué trabajo debe realizarse, cómo se descompone una tarea, qué herramientas se utilizan y cómo coordinan los subagentes. PAIR opera en un nivel inferior de la pila. Una vez que existe una solicitud de inferencia, ayuda a decidir qué máquina local apta debe atenderla.
| Capa | Responsabilidad principal |
|---|---|
| Harness de agentes | Planifica tareas y coordina flujos de trabajo |
| Enrutador de modelos | Elige qué modelo debe gestionar una tarea |
| NVIDIA PAIR | Elige qué máquina local apta atiende una solicitud |
| Ollama / LM Studio | Carga el modelo y realiza la inferencia |
| Infraestructura persistente | Almacena archivos, el estado de las tareas, índices, registros y servicios persistentes |
Esta separación permite que PAIR funcione por debajo de distintos sistemas de agentes sin asumir la lógica de planificación. Si quieres explorar la capa superior, nuestra guía sobre complementos de DeepSeek Harness muestra cómo un harness puede cambiar el comportamiento del flujo de trabajo mientras deja la asignación de la inferencia a una capa independiente.
¿Puede PAIR convertir los PC domésticos inactivos en capacidad de IA útil?
Sí, cuando la carga de trabajo tiene suficientes solicitudes independientes y las máquinas disponibles alojan realmente los modelos necesarios.
Muchos hogares y pequeñas oficinas ya cuentan con capacidad de cómputo desaprovechada:
- un PC para juegos,
- una estación de trabajo,
- un Mac compatible,
- una máquina de IA local dedicada,
- o un sistema DGX Spark.
PAIR permite que esos equipos aporten capacidad sin requerir un clúster tradicional siempre encendido. Un PC para juegos puede ocuparse, un portátil puede entrar en suspensión y otro sistema disponible puede seguir gestionando las solicitudes compatibles.
Pero el tiempo de GPU disponible por sí solo no basta. Un nodo libre no puede atender una solicitud si falta el modelo solicitado o si el equipo no tiene suficiente memoria para ejecutarlo.
¿Qué ocurre cuando un nodo de PAIR se ocupa o se desconecta?
PAIR registra qué nodos están disponibles y dirige las nuevas solicitudes únicamente a los equipos aptos.
Si una estación de trabajo se ocupa mientras otro nodo adecuado está disponible, las solicitudes independientes posteriores pueden dirigirse a otro lugar. Esto hace que el conjunto sea más flexible que asignar permanentemente cada aplicación a un único servidor de inferencia.
Siguen existiendo casos claros de fallo:
- el modelo necesario solo existe en un nodo que no está disponible,
- no hay ningún motor compatible listo,
- o ninguna máquina disponible tiene capacidad suficiente para la solicitud.
PAIR mejora la utilización, pero no elimina la planificación de capacidad.
¿Cuándo sigue siendo mejor un servidor grande con una sola GPU que NVIDIA PAIR?
PAIR no hace que los servidores de IA dedicados queden obsoletos.
Un único sistema potente puede seguir siendo el diseño más adecuado cuando la carga de trabajo requiere:
- un modelo que supera la memoria disponible en todos los nodos PAIR,
- inferencia predecible las 24 horas del día, los 7 días de la semana,
- disponibilidad constante del modelo,
- alta utilización sostenida,
- inferencia multi-GPU estrechamente acoplada,
- u operaciones más sencillas.
Un servidor dedicado también evita depender de portátiles o PC para juegos que pueden entrar en suspensión, trasladarse, reiniciarse o necesitarse para otras tareas.
PAIR es más eficaz cuando el problema es la capacidad distribuida sin usar, no la memoria insuficiente en cada máquina individual.
| Requisito de IA local | PAIR | Servidor con GPU dedicada |
|---|---|---|
| Varios trabajos independientes de agentes | Encaja muy bien | También es posible |
| Usar hardware mixto existente | Encaja muy bien | Requiere hardware dedicado |
| Un modelo supera la memoria de todos los nodos | PAIR por sí solo no resuelve esto | Potencialmente mejor con suficiente memoria |
| Inferencia predecible siempre activa | Depende de los nodos disponibles | Encaja muy bien |
| Cómputo doméstico elástico | Encaja muy bien | Menos relevante |
| Administración sencilla | Varias máquinas que mantener | A menudo más sencillo |
Si la IA local ya compite con el almacenamiento, los contenidos multimedia, las copias de seguridad u otros servicios en una misma máquina, las limitaciones no están relacionadas únicamente con la GPU. Nuestra guía sobre las limitaciones de los servidores de IA local explica las señales de que la inferencia está empezando a desestabilizar el resto de un servidor doméstico.
¿Mantiene NVIDIA PAIR la privacidad de los datos de la IA local?
PAIR está diseñado para mantener los prompts, los datos y el tráfico de inferencia en la red local, en lugar de enviar la inferencia a un servicio en la nube.
La arquitectura de confianza PAIR de NVIDIA documenta el emparejamiento explícito de nodos y TLS mutuo entre sistemas emparejados.
Eso no hace que cada implementación local sea segura automáticamente. Los usuarios siguen necesitando dispositivos de confianza, una red de confianza, permisos de aplicaciones sensatos y la seguridad habitual de los dispositivos finales.
El enrutamiento local protege un límite diferente al de la inferencia en la nube: mantiene la solicitud al modelo dentro de la propia red del usuario, pero la seguridad de esa red y de las máquinas que hay en ella sigue siendo importante.
¿Puede NVIDIA PAIR convertirse en un endpoint de API de IA para toda la red?
No de forma predeterminada.
El endpoint de PAIR orientado a las aplicaciones es local a la máquina que ejecuta la aplicación. Esa máquina puede enrutar las solicitudes a otro nodo con capacidad, pero PAIR no expone automáticamente un servicio de inferencia abierto a dispositivos arbitrarios de la LAN.
Si un usuario quiere una única API de Ollama o compatible con OpenAI expuesta de forma centralizada para toda la red, esa es una decisión de implementación independiente.
Esta es otra razón para considerar PAIR una capa de enrutamiento y no una plataforma completa para servidores domésticos.
¿Qué papel desempeña un servidor doméstico si PAIR utiliza PC para la inferencia?
PAIR hace que el cómputo sea más elástico, mientras que otras partes de un sistema de IA útil siguen beneficiándose de la persistencia.
Los nodos GPU pueden entrar en reposo, estar ocupados, desconectarse de la red o especializarse en distintos modelos. Los servicios de larga duración tienen un requisito diferente.
Un servidor local persistente aún puede almacenar:
- tiempo de ejecución y programaciones del agente,
- archivos privados,
- índices RAG,
- bases de datos vectoriales,
- estado de las tareas,
- registros,
- archivos de modelos,
- y las copias de seguridad.
Esto crea una distinción útil entre el cómputo elástico y el estado persistente. PAIR se centra en el primer problema; un servidor doméstico puede seguir siendo responsable del segundo.
Esa separación ya resulta útil en un asistente de IA privado en un NAS, donde los archivos de larga duración y el estado de recuperación no tienen que residir en la misma máquina que realiza cada llamada al modelo.
También cambia la forma de entender la IA local y el almacenamiento de archivos. Un servidor de almacenamiento estable puede permanecer siempre encendido, mientras los nodos de inferencia más potentes se incorporan a la carga de trabajo solo cuando es necesario.
La arquitectura híbrida de agentes de IA más amplia sigue el mismo principio: no todas las partes de un sistema de IA deben ejecutarse en la misma máquina.
¿Significa NVIDIA PAIR que ya no necesitas un gran servidor con GPU?
No necesariamente. PAIR cambia la cuestión de la ampliación, en lugar de eliminar los servidores de IA dedicados.
Antes de comprar un sistema con una GPU más grande, los usuarios de IA local ahora tienen otra pregunta que hacerse:
¿Mi cuello de botella es un modelo que necesita más memoria o muchos trabajos de inferencia que compiten por la misma máquina?
Si el problema es un modelo demasiado grande, el enrutamiento de solicitudes de PAIR no crea VRAM combinada y puede no resolverlo.
Si el problema son varios agentes, varios usuarios, varios modelos o muchos trabajos independientes de IA local que compiten por una sola GPU, convertir las computadoras existentes en un grupo de inferencia puede resultar mucho más útil.
Esa es la verdadera importancia de PAIR. La ampliación de la IA local ya no tiene por qué significar reemplazar la máquina existente por una caja más grande. En algunas cargas de trabajo, puede significar aprovechar con mayor eficiencia la capacidad de cómputo ya distribuida por el hogar o la oficina.
La configuración de IA local del futuro podría parecerse menos a una computadora gigantesca y más a un servidor doméstico permanente rodeado por un grupo elástico de nodos de inferencia.
Preguntas frecuentes: NVIDIA PAIR y los clústeres locales de IA
¿Puede NVIDIA PAIR combinar la VRAM de varias GPU?
No. PAIR no combina la memoria de la GPU ni crea una GPU virtual. Cada solicitud de inferencia se ejecuta en un nodo apto que puede atender el modelo solicitado.
¿Puede NVIDIA PAIR ejecutar un modelo demasiado grande para una sola GPU?
No mediante la combinación de memoria entre nodos PAIR normales. La máquina seleccionada sigue necesitando suficiente memoria para cargar y ejecutar el modelo solicitado. Otras tecnologías de inferencia distribuida resuelven un problema diferente.
¿Funciona NVIDIA PAIR con Ollama?
Sí. Actualmente, PAIR proporciona un proxy local compatible con Ollama y puede enrutar solicitudes compatibles de Ollama entre nodos emparejados aptos.
¿Funciona NVIDIA PAIR con LM Studio?
Sí. PAIR también es compatible con LM Studio mediante un endpoint local compatible con OpenAI.
¿Puede NVIDIA PAIR usar Macs y PC con RTX juntos?
Sí, los sistemas compatibles con macOS, Windows y Linux pueden participar en el mismo clúster de PAIR. Consulta la lista de compatibilidad actual de NVIDIA antes de dar por hecho que una máquina específica es compatible.
¿Todos los nodos de PAIR necesitan el mismo modelo?
No. Los nodos pueden alojar distintos modelos. Una máquina puede atender una solicitud solo cuando su motor de inferencia local tiene el modelo solicitado, mientras que replicar el mismo modelo en varios nodos crea más opciones de enrutamiento.
¿Sigues necesitando un servidor de IA dedicado con NVIDIA PAIR?
Depende de la carga de trabajo. PAIR resulta atractivo para múltiples tareas de inferencia independientes y para combinar hardware existente. Un servidor GPU dedicado puede seguir siendo mejor para modelos grandes individuales, inferencia predecible las 24 horas del día, los 7 días de la semana, o cargas de trabajo estrechamente acopladas entre varias GPU.
Centro de Tecnología e IA
Más para leer

Los modelos abiertos están alcanzando a la IA de vanguardia: ¿será 2026 el año en que la IA local alcance un nivel suficientemente bueno?
Los modelos abiertos están alcanzando un nivel suficiente para más cargas de trabajo de IA local, mientras que los modelos de vanguardia en la...

¿Por qué Immich se siente más rápido en una red LAN que mediante conexiones remotas?
Las solicitudes en la LAN suelen seguir una ruta más corta y con menor latencia. El acceso remoto añade limitaciones de capacidad de la...

¿Immich funciona de forma fiable detrás de CGNAT o doble NAT?
CGNAT y la doble NAT no impiden el uso local de Immich. Principalmente complican el acceso remoto directo entrante y pueden obligar a utilizar...

