NVIDIA lanza PAIR para convertir varios PC y Mac de casa en un clúster de IA local
NVIDIA PAIR distribuye tareas de IA entre equipos con RTX, DGX Spark y Mac M4 o posteriores. La beta gratuita funciona con Ollama y LM Studio.
NVIDIA ha presentado PAIR, siglas de Personal AI Router, una herramienta gratuita y de código abierto que permite utilizar varios ordenadores conectados a la misma red local para ejecutar cargas de inteligencia artificial. El software detecta equipos compatibles que tienen capacidad disponible y distribuye entre ellos solicitudes de inferencia, en lugar de concentrar todo el trabajo en una única GPU.
La beta de NVIDIA PAIR está disponible para Windows, Linux y macOS y funciona con sistemas equipados con tarjetas GeForce RTX 20 Series o posteriores, estaciones RTX PRO basadas en Turing o arquitecturas más recientes, DGX Spark y ordenadores Mac con chips M4 o posteriores. En su lanzamiento es compatible con los motores de inferencia local Ollama y LM Studio.
PAIR aprovecha los ordenadores que no están ocupados
El objetivo de PAIR es resolver uno de los cuellos de botella que aparecen al ejecutar agentes de IA localmente. Un agente puede dividir una tarea compleja entre varios subagentes, pero si todos envían sus solicitudes al mismo modelo y a una sola GPU, esas operaciones terminan formando una cola.
PAIR crea un único punto de acceso para los equipos de la red y decide qué máquina debe procesar cada nueva solicitud. Para tomar esa decisión comprueba si el nodo está disponible, qué motor de inferencia está ejecutando, si dispone del modelo solicitado, qué trabajos tiene activos y cuál es el nivel de utilización de su GPU.
Esto significa que un PC secundario, una estación de trabajo o un Mac que en ese momento tenga recursos libres puede recibir una tarea mientras el ordenador principal continúa utilizándose para trabajar, crear contenido o jugar.
No convierte varias GPU en una GPU más grande
PAIR no suma la memoria gráfica de los dispositivos ni transforma varios ordenadores en una única GPU virtual. Tampoco divide un mismo modelo entre diferentes equipos ni reparte una única solicitud de inferencia entre varias tarjetas gráficas.
Cada petición completa se asigna a un único nodo compatible. La ventaja aparece cuando una aplicación genera varias operaciones independientes simultáneamente, como sucede en sistemas multiagente o cuando se ejecutan varias herramientas locales de IA a la vez. Esas peticiones sí pueden procesarse en paralelo utilizando diferentes ordenadores.
NVIDIA muestra una tarea que pasa de 18 a menos de 9 minutos
NVIDIA realizó una demostración con Hermes Desktop, Ollama y cinco subagentes utilizando el modelo Qwen 3.6 35B A3B. Ejecutada solamente en un portátil RTX Spark, la tarea necesitó una media de 18 minutos.
Al utilizar PAIR con tres dispositivos, un portátil RTX Spark, un DGX Spark y una GeForce RTX 5090, el mismo escenario terminó en una media de 8 minutos y 48 segundos.
La propia NVIDIA advierte de que se trata de una demostración con una configuración específica y no de un benchmark general. El rendimiento depende del grado de paralelización de la tarea, los modelos utilizados, el hardware disponible, la red y la carga de cada equipo.
Ollama y LM Studio funcionan sin una nueva API
PAIR actúa como un router virtual de inferencia y no sustituye a los motores que ejecutan los modelos. Ollama o LM Studio continúan realizando la inferencia en cada ordenador mientras PAIR se ocupa de decidir dónde debe enviarse cada petición.
NVIDIA ha diseñado el sistema para mantener las interfaces compatibles de estos servicios. Una aplicación que ya utiliza Ollama o LM Studio puede conectarse al punto de acceso local proporcionado por PAIR mientras el router gestiona los diferentes nodos en segundo plano.
Los ordenadores tampoco necesitan almacenar exactamente los mismos modelos. PAIR puede identificar en qué nodos está instalado el modelo requerido y dirigir la tarea solamente a los equipos que puedan ejecutarlo. Tener el mismo modelo disponible en varias máquinas aumenta el número de destinos posibles para las solicitudes.
Los datos permanecen dentro de la red local
Otro de los argumentos de NVIDIA es la privacidad. PAIR está diseñado para mantener las solicitudes, archivos, contexto de los agentes y tráfico de inferencia dentro de la red local, sin depender de un servicio de inferencia en la nube para funcionar.
Los equipos se descubren automáticamente mediante mDNS y el usuario debe aprobar su vinculación. Después del emparejamiento, la comunicación entre nodos utiliza MTLS y certificados generados para proteger el tráfico dentro de la red.
Una vez descargados los modelos necesarios, PAIR tampoco necesita conexión a Internet para realizar sus operaciones locales. La conexión sí es necesaria inicialmente para obtener esos modelos.
PAIR ya está disponible en beta
NVIDIA PAIR se distribuye actualmente como una versión beta con interfaz gráfica y acceso mediante terminal. La compañía ha publicado además el proyecto como código abierto para que los desarrolladores puedan revisar el funcionamiento del software, informar de problemas y contribuir a componentes como el descubrimiento de dispositivos, el enrutamiento y la integración con motores de inferencia.
Los requisitos generales incluyen al menos 8 GB de RAM y hardware compatible. NVIDIA recomienda disponer de 20 GB o más de almacenamiento, aunque el espacio necesario para ejecutar IA local dependerá también de los modelos descargados.
PAIR está especialmente orientado a hogares y pequeños entornos con más de un ordenador capaz de ejecutar modelos localmente. Su principal ventaja no consiste en acelerar cualquier petición individual, sino en aprovechar recursos que de otro modo permanecerían inactivos cuando una aplicación de IA necesita ejecutar varias tareas simultáneas.