Nvidia presenta NVHBM: hasta un 30% más de ancho de banda y un 15% menos de consumo para chips de IA
NVHBM integra el controlador de memoria en el propio stack HBM, libera espacio en los aceleradores de IA y tendrá a Amazon Annapurna Labs como primer socio.
Nvidia ha presentado NVHBM, una nueva arquitectura personalizada de memoria de alto ancho de banda destinada a aceleradores de inteligencia artificial. Frente a HBM4E estándar, la compañía promete hasta un 30% más de ancho de banda, un 15% menos de consumo energético de la memoria y más espacio disponible en el silicio del procesador para incorporar unidades de computación.
NVHBM formará parte del ecosistema NVLink Fusion y no está planteada como una memoria para tarjetas gráficas de consumo. Su objetivo son los hyperscalers y compañías de inteligencia artificial que diseñan sus propios aceleradores, conocidos como XPU, pero quieren integrarlos dentro de la infraestructura de Nvidia.
El controlador pasa del acelerador al propio HBM
La diferencia arquitectónica más importante está en la ubicación del controlador de memoria. En una implementación HBM convencional, este componente se encuentra dentro del propio XPU y ocupa una parte de la superficie que podría dedicarse a núcleos de cálculo, caché u otras funciones.
NVHBM traslada el controlador personalizado diseñado por Nvidia al base die situado en la parte inferior del stack tridimensional de memoria. La compañía también ha desarrollado una interfaz física específica para reducir el espacio requerido por las conexiones entre el acelerador y la memoria.
Según Nvidia, esta arquitectura puede ofrecer hasta un 30% más de ancho de banda por stack frente a HBM4E estándar. La mejora está especialmente orientada a cargas de inteligencia artificial limitadas por el movimiento de datos, donde los núcleos de cálculo pueden permanecer infrautilizados mientras esperan pesos de modelos, activaciones o información almacenada en la KV cache.
NVHBM consume hasta un 15% menos
El segundo objetivo es reducir el consumo energético. Nvidia estima que NVHBM puede utilizar hasta un 15% menos de energía que una implementación HBM4E convencional.
El ahorro adquiere especial importancia en centros de datos de IA donde miles de aceleradores operan simultáneamente y tanto el suministro eléctrico como la refrigeración se han convertido en limitaciones para aumentar la capacidad de cálculo.
Nvidia calcula que, en un centro de datos de 1 gigavatio formado por XPU de 2.000 W, el margen energético obtenido mediante esta arquitectura podría equivaler a capacidad para instalar hasta 15.000 aceleradores adicionales. Se trata de una estimación realizada por la propia compañía y no de una medición sobre una instalación comercial existente.
Más superficie del chip podrá dedicarse a computación
Integrar el controlador en la memoria también reduce el espacio que el XPU necesita reservar para su interfaz HBM. Nvidia señala que su diseño puede liberar hasta un 25% más de superficie del compute die frente a HBM4E estándar.
Ese espacio puede utilizarse para incorporar más unidades matriciales, núcleos vectoriales, SRAM, memoria caché u otros bloques diseñados específicamente para la carga de trabajo que ejecutará cada acelerador.
La documentación técnica de Nvidia indica además que el área dedicada al PHY y otros componentes asociados a la interfaz puede reducirse hasta un 67%. Una interfaz más compacta simplifica también el enrutamiento de conexiones sobre el interposer que une la memoria y el procesador.
No será una memoria HBM abierta para cualquier fabricante
NVHBM no pretende sustituir directamente al estándar HBM desarrollado por JEDEC. Nvidia ofrecerá la tecnología como parte de NVLink Fusion, su plataforma para que terceros conecten procesadores y aceleradores personalizados a la arquitectura de centros de datos de la compañía.
Los clientes de NVLink Fusion podrán acceder a una implementación estandarizada de NVHBM que Nvidia pretende validar junto con varios fabricantes de memoria. El objetivo es evitar que cada diseñador de aceleradores tenga que desarrollar y certificar individualmente toda la interfaz con diferentes proveedores de HBM.
Esto limita inicialmente el público de la tecnología a grandes compañías capaces de desarrollar chips personalizados para inteligencia artificial. No existe ningún anuncio que indique que los módulos NVHBM vayan a comercializarse como componentes independientes para ordenadores convencionales o tarjetas gráficas.
Amazon será el primer socio de NVHBM
Amazon Annapurna Labs será la primera compañía que trabajará con Nvidia en NVHBM. Annapurna es la división responsable de desarrollar chips personalizados para AWS, incluida la familia de aceleradores Trainium utilizada para entrenamiento e inferencia de modelos de inteligencia artificial.
La colaboración forma parte de un acuerdo más amplio entre AWS y Nvidia alrededor de NVLink Fusion. Amazon ya ha confirmado que la futura generación Trainium4 será compatible con esta plataforma, permitiendo que los aceleradores propios de AWS compartan una arquitectura de interconexión a escala de rack con tecnologías de Nvidia.
Nvidia no ha confirmado todavía en qué generación concreta de Trainium se estrenará comercialmente NVHBM ni cuándo comenzarán a desplegarse los primeros sistemas que la utilicen.
La misma tecnología llegará a futuras GPU de Nvidia
Nvidia indica que NVHBM utiliza la misma tecnología de memoria personalizada que empleará en futuras generaciones de sus propias GPU. La compañía no ha detallado todavía qué arquitectura gráfica será la primera en incorporarla ni las capacidades concretas que ofrecerá en esos procesadores.
Para los clientes externos, NVHBM se integra en la estrategia de NVLink Fusion, con la que Nvidia busca ampliar su presencia más allá de la venta de GPU. La plataforma permite a hyperscalers combinar aceleradores propios con NVLink, NVLink-C2C, switches de Nvidia, sistemas MGX y el resto de su infraestructura de red y software.
La memoria se convierte así en otra pieza de esa estrategia. En lugar de ofrecer únicamente conectividad para integrar chips externos, Nvidia también quiere proporcionar una arquitectura HBM personalizada capaz de aumentar el ancho de banda, reducir el consumo y liberar superficie de silicio en los aceleradores de IA diseñados por sus socios.