Tarjetas Gráficas

NVIDIA promete hasta 1,9 veces más rendimiento para IA local, pero el máximo procede de una única RTX 5090

Las optimizaciones de llama.cpp alcanzan 1,9x con Qwen3.6-35B en una RTX 5090, pero NVIDIA no demuestra que esa mejora se replique en todos los agentes locales.

NVIDIA ha anunciado nuevas optimizaciones para ejecutar modelos y agentes de inteligencia artificial de forma local mediante llama.cpp y vLLM. La compañía habla de un aumento de rendimiento de hasta 1,9 veces, pero ese máximo corresponde a una prueba concreta con una GeForce RTX 5090 y no demuestra que cualquier agente, modelo o GPU RTX vaya a experimentar una mejora del 90%.

El resultado de 1,9x corresponde a llama.cpp en una RTX 5090

La cifra más elevada comunicada por NVIDIA se obtuvo utilizando llama.cpp sobre una GeForce RTX 5090. La compañía atribuye la mejora a optimizaciones de kernels, técnicas mejoradas de speculative decoding y un procesamiento más rápido de la fase de prefill.

En las pruebas publicadas alrededor del anuncio de IFA 2026, el modelo Qwen3.6-35B alcanzó aproximadamente 1,9 veces el throughput de la referencia utilizada anteriormente por NVIDIA. Con Qwen3.6-27B, la mejora en el mismo tipo de plataforma fue menor, de alrededor del 50%.

El benchmark utiliza una carga de programación de 8K

Las mediciones se realizaron con AIPerf sobre una carga SpeedBench-Coding 8K. Esto convierte el resultado en una medición concreta de throughput bajo determinadas condiciones de modelo, contexto, software y hardware.

El dato es relevante para evaluar cuánto han avanzado las optimizaciones de inferencia, pero no equivale a afirmar que una aplicación completa basada en agentes terminará sus tareas 1,9 veces más rápido. Un agente también puede dedicar tiempo a ejecutar herramientas, acceder a archivos, realizar búsquedas, esperar servicios externos o procesar múltiples turnos.

vLLM muestra mejoras menores en otro hardware

NVIDIA también publicó resultados para vLLM. En una RTX PRO 6000 Blackwell Workstation Edition comunica una mejora de alrededor de 1,2 veces, mientras que una configuración formada por dos sistemas DGX Spark alcanza hasta 1,4 veces.

En este caso, NVIDIA atribuye los avances a nuevos kernels de atención XQA en FlashInfer y a otras optimizaciones del backend. La diferencia entre estos resultados y el 1,9x de la RTX 5090 refuerza que no existe un multiplicador único aplicable a todo el hardware o a todos los motores de inferencia.

Qué ha cambiado sin sustituir la GPU

La mejora anunciada se produce en la pila de software. Los kernels determinan cómo se ejecutan determinadas operaciones del modelo sobre la GPU, mientras que speculative decoding puede acelerar la generación aceptando varios tokens candidatos cuando el modelo y la configuración lo permiten.

El prefill corresponde al procesamiento inicial del prompt y del contexto antes de comenzar la generación. Acelerar esta etapa puede ser especialmente importante para agentes que trabajan con documentos extensos, historiales largos o grandes cantidades de código.

Estas mejoras demuestran que el rendimiento de la IA local no depende únicamente del número de núcleos, la memoria o el ancho de banda de una GPU. Cambios en el runtime pueden extraer más rendimiento del mismo hardware sin necesidad de sustituirlo.

Las optimizaciones llegan también a LM Studio y Ollama

NVIDIA indica que las mejoras están disponibles directamente a través de los backends llama.cpp y vLLM. Los usuarios también pueden beneficiarse de ellas mediante aplicaciones que integran estas tecnologías, entre ellas LM Studio y Ollama.

La compañía trabaja además con proyectos de agentes como Hermes Agent, OpenClaw y Perplexity Portable Computer para facilitar el uso de modelos locales en hardware NVIDIA. Algunas de estas soluciones pueden detectar la GPU y seleccionar automáticamente modelos y configuraciones compatibles.

El 1,9x no debe extrapolarse a todas las RTX

El principal límite del anuncio es la amplitud de los datos publicados. El máximo de 1,9x se apoya en una combinación específica de GeForce RTX 5090, llama.cpp, modelo y benchmark. NVIDIA no ha presentado una matriz equivalente que demuestre la misma mejora en RTX 5080, RTX 4090, RTX 3090 u otras GPU de consumo.

Tampoco todos los modelos se benefician de la misma forma de speculative decoding, kernels optimizados o mejoras de prefill. El tamaño del contexto, la cuantización, el sistema operativo, la versión de CUDA y la memoria disponible pueden modificar significativamente los resultados.

Throughput no es lo mismo que velocidad percibida por el usuario

El throughput mide cuánto trabajo puede procesar el motor en un intervalo de tiempo, normalmente expresado mediante tokens por segundo. Para un servidor con varias solicitudes o para un agente que ejecuta subagentes en paralelo, esta métrica puede ser especialmente importante.

Sin embargo, un usuario que mantiene una sola conversación también percibe el tiempo hasta el primer token, la velocidad de generación individual y el tiempo total necesario para completar la tarea. Una mejora grande en throughput agregado no garantiza una reducción equivalente en todas esas métricas.

NVIDIA presenta el dato como un máximo, no como una mejora universal

El propio anuncio utiliza la expresión hasta 1,9x. Por tanto, la cifra debe interpretarse como el mejor resultado comunicado dentro de las configuraciones evaluadas y no como una actualización que haga automáticamente un 90% más rápidos todos los agentes locales ejecutados en una RTX 5090.

Las optimizaciones de llama.cpp y vLLM sí representan una mejora de software disponible sin cambiar de GPU. Para determinar su impacto real será necesario comparar cada modelo y carga con las mismas versiones, cuantización, contexto y parámetros antes y después de actualizar el motor de inferencia.