Saltar al contenido
Hardmaniacos

NVIDIA PAIR reparte la IA local entre varios PC de casa y acelera los agentes con RTX

10/09/2026
NVIDIA PAIR distribuyendo solicitudes de IA local entre varios equipos de una misma red
NVIDIA aprovechó IFA 2026 para ampliar su estrategia de inteligencia artificial ejecutada en local. Entre las novedades anunciadas el 3 de septiembre destaca NVIDIA Personal AI Router (PAIR), una herramienta gratuita, de código abierto y actualmente en beta que permite aprovechar varios equipos compatibles conectados a una misma red para repartir cargas de inferencia.

La idea es especialmente interesante para flujos con agentes y subagentes. En lugar de hacer que todas las solicitudes compitan por una sola GPU, PAIR descubre los nodos disponibles y puede enviar solicitudes independientes a diferentes sistemas en función de su disponibilidad, el motor de inferencia, el modelo instalado y la carga del equipo.

Sin embargo, conviene dejar clara una limitación fundamental desde el principio: PAIR no suma la VRAM de varias GPU, no crea una GPU virtual y no divide un único modelo o una misma solicitud entre varios ordenadores. Cada petición completa se ejecuta de principio a fin en un solo nodo compatible.

Índice

NVIDIA PAIR aprovecha varios ordenadores de casa para ejecutar IA local

NVIDIA define PAIR como un router virtual de inferencia. Una vez instalado en los equipos compatibles de una misma red local, puede descubrirlos mediante la propia red, emparejarlos de forma segura y mantener una visión actualizada de qué nodos están preparados para aceptar nuevas tareas.

Las aplicaciones compatibles se conectan a un único endpoint local. Detrás de ese punto de entrada, PAIR comprueba qué nodo está disponible, si dispone del motor adecuado y si tiene cargado el modelo solicitado antes de dirigir allí la petición.

En su lanzamiento, funciona con Ollama y LM Studio. Esto permite mantener interfaces conocidas y evita tener que configurar manualmente cada aplicación para hablar con cada ordenador por separado.

NVIDIA PAIR mostrando varios nodos compatibles y distribuyendo solicitudes de inferencia local

El sistema tiene especial sentido en flujos multiagente. Un agente principal puede dividir una tarea en varios subagentes y generar numerosas solicitudes independientes. Si todas llegan a una sola GPU, se forma una cola; con PAIR, algunas pueden ejecutarse en otros nodos compatibles que estén ociosos.

La documentación oficial es muy explícita: una solicitud siempre se asigna a un solo nodo. El modelo necesario debe estar disponible en ese equipo y la inferencia permanece allí durante toda la petición. Preparar el mismo modelo en varios nodos simplemente aumenta el número de equipos candidatos para atender solicitudes independientes.

NVIDIA mostró además una demostración con Hermes y cinco subagentes utilizando Qwen 3.6 35B A3B. En una configuración concreta, una sola máquina RTX Spark necesitó una media de 18 minutos, frente a 8 minutos y 48 segundos con un conjunto formado por un portátil RTX Spark, un DGX Spark y una GeForce RTX 5090. NVIDIA advierte expresamente de que se trata de una demostración específica y no de un benchmark universal ni de una promesa de escalado lineal.

Otro objetivo es mantener la carga dentro de casa. NVIDIA afirma que PAIR está diseñado para que prompts, archivos, contexto de los agentes y tráfico de inferencia permanezcan en la red local, aunque esto debe entenderse dentro del funcionamiento de PAIR y de las aplicaciones y modelos que el usuario utilice.

PC RTX, DGX Spark e incluso Mac pueden formar parte de PAIR

La beta actual está disponible para Windows, Linux y macOS mediante interfaz gráfica o terminal. La compatibilidad de hardware incluye GeForce RTX Serie 20 y posteriores, GPU RTX PRO de estación de trabajo compatibles desde arquitectura Turing, NVIDIA DGX Spark y equipos Mac con Apple M4 o posterior.

Uno de los aspectos más llamativos es que los nodos no tienen que utilizar el mismo sistema operativo. Un Mac compatible puede formar parte del mismo clúster personal que equipos Windows o Linux con RTX y sistemas DGX Spark.

Requisito / característicaNVIDIA PAIR beta
Sistemas operativosWindows, Linux y macOS compatibles
GeForceRTX Serie 20 y posteriores
RTX PROGPU de estación de trabajo compatibles, Turing o posteriores
NVIDIA DGXDGX Spark / GB10
MacApple M4 o posterior
RAM8 GB o más
Almacenamiento20 GB o más recomendados
Backends inicialesOllama y LM Studio
InternetNo requerido para funcionar localmente; sí para descargar modelos
LicenciaSoftware gratuito y proyecto de código abierto

No hace falta instalar racks, cableado especial ni hardware de centro de datos. Los dispositivos permanecen como sistemas independientes y pueden entrar o salir del conjunto si se apagan, suspenden o dejan de estar disponibles.

PAIR también tiene en cuenta si el nodo está online, si el motor de inferencia requerido está activo, si contiene el modelo solicitado, el número de trabajos en curso y la utilización de la GPU. Por ejemplo, puede evitar cargar el PC principal con nuevas inferencias mientras se está utilizando para jugar o crear contenido si existe otro nodo adecuado disponible.

NVIDIA también acelera llama.cpp y vLLM y simplifica los agentes locales

PAIR es la novedad más diferencial, pero NVIDIA también anunció optimizaciones para algunos de los motores utilizados para ejecutar modelos localmente.

La compañía afirma que las nuevas mejoras de llama.cpp pueden alcanzar hasta 1,9 veces más throughput gracias a optimizaciones de kernels, mejoras en speculative decoding y un prefill más rápido. Ese máximo procede de pruebas de NVIDIA con una GeForce RTX 5090, por lo que no debe interpretarse como una aceleración de 1,9x en cualquier modelo, tarjeta o configuración.

En vLLM, NVIDIA cita una mejora de 1,2x con una RTX PRO 6000 Blackwell Workstation Edition y de hasta 1,4x en una configuración con dos clústeres DGX Spark. Estas optimizaciones también pueden aprovecharse mediante aplicaciones como LM Studio y Ollama.

NVIDIA PAIR distribuyendo solicitudes de varios subagentes de Hermes mediante Ollama

La otra parte del anuncio busca reducir la dificultad de configurar agentes locales. Hermes Agent dispone en Windows de una configuración de modelo local con un solo clic para sistemas RTX y DGX: detecta la GPU NVIDIA, selecciona un modelo y una configuración adecuados y lo ejecuta mediante llama.cpp con las optimizaciones de NVIDIA. El soporte para Linux está previsto posteriormente.

La aplicación de Windows de OpenClaw simplifica asimismo la configuración de modelos locales optimizados en GPU RTX con al menos 24 GB de VRAM.

Por su parte, Perplexity Portable Computer está disponible actualmente en Linux para GPU NVIDIA RTX con al menos 24 GB de VRAM. NVIDIA indica que el soporte para Windows llegará próximamente. La aplicación puede mantener determinados flujos de trabajo en local y recurrir selectivamente a modelos en la nube cuando el usuario lo autoriza.

Estas novedades no eliminan las diferencias entre cada agente, modelo o backend, pero muestran una tendencia clara: NVIDIA quiere reducir la configuración manual necesaria para que una IA local pueda pasar de una instalación experimental a una herramienta que permanezca ejecutándose en el PC.

RTX Spark llegará a nuevos PC en octubre, pero PAIR no depende de comprarlos

NVIDIA también confirmó durante IFA que los primeros PC Windows con RTX Spark llegarán en octubre de 2026, con nuevos diseños mostrados por fabricantes como Acer y Lenovo.

RTX Spark también está apareciendo en equipos destinados específicamente a creación e IA local. En Hardmaniacos ya hemos preparado por separado los ASUS ProArt con RTX Spark, donde el enfoque está en el hardware, las especificaciones y los casos de uso de esos dispositivos.

Aquí la diferencia es importante: PAIR no exige comprar un nuevo PC RTX Spark. Su propuesta consiste precisamente en aprovechar hardware compatible que el usuario ya pueda tener en la red, desde un PC con una GeForce RTX relativamente antigua hasta estaciones RTX PRO, DGX Spark o determinados Mac.

NVIDIA también anunció que el nuevo AI PC Mode de CyberLink PhotoDirector 365 llegará junto a RTX Spark en octubre, ofreciendo herramientas de edición generativa con la posibilidad de elegir entre procesamiento local o en la nube según la tarea.

La estrategia de NVIDIA en IFA va, por tanto, más allá de lanzar nuevo hardware. PAIR intenta resolver un problema bastante concreto de la IA doméstica: tener varios ordenadores capaces de ejecutar modelos, pero utilizar normalmente solo uno de ellos. No convierte esas máquinas en una única superGPU, pero sí puede hacer que varios agentes o solicitudes trabajen en paralelo sin concentrar toda la carga en el mismo equipo.

Fuentes: NVIDIA Blog: Sparks Fly: NVIDIA Accelerates Local AI at IFA 2026, NVIDIA España: Personal AI Router, NVIDIA PAIR FAQ, Documentación oficial de NVIDIA PAIR y NVIDIA Technical Blog: PAIR Virtual Inference Router.