NVIDIA Vera estrena 88 núcleos Olympus y alcanza hasta 1,8× frente a EPYC Turin

NVIDIA Vera estrena 88 núcleos Olympus y alcanza hasta 1,8× frente a EPYC Turin

NVIDIA ha detallado la arquitectura de Vera, su nuevo procesador Armv9.2 para centros de datos equipado con 88 núcleos Olympus y 176 hilos. El diseño prioriza el rendimiento monohilo, la ejecución de código, el análisis de datos y las tareas auxiliares que acompañan a los sistemas de inteligencia artificial basados en agentes.

La compañía asegura que Vera puede alcanzar hasta 1,8 veces el rendimiento de procesadores x86 de última generación en determinadas cargas, utilizando AMD EPYC Turin como referencia. Son mediciones internas limitadas a trabajos concretos, por lo que no representan una ventaja general del 80% en cualquier aplicación.

Olympus decodifica hasta diez instrucciones por ciclo

NVIDIA Vera estrena 88 núcleos Olympus y alcanza hasta 1,8× frente a EPYC Turin

 

Cada núcleo Olympus está dividido en etapa de entrada, bloque intermedio, motor de ejecución y subsistema de caché. La primera incorpora un predictor neuronal de saltos destinado a reducir las instrucciones ejecutadas por caminos incorrectos cuando el programa cambia constantemente de dirección.

Este comportamiento resulta frecuente en intérpretes, compiladores, bases de datos, análisis de grafos y entornos de ejecución para agentes. Para mantener ocupadas sus unidades internas, Olympus utiliza un sistema capaz de decodificar hasta diez instrucciones por ciclo y gestionar dos saltos tomados simultáneamente.

La etapa intermedia incorpora un búfer de reordenamiento amplio y suficientes registros físicos para mantener un mayor número de instrucciones pendientes de ejecución. El objetivo consiste en encontrar operaciones independientes mientras otras esperan datos, resuelven dependencias o necesitan conocer el resultado de un salto anterior.

Esta ejecución fuera de orden permite aprovechar mejor los recursos del núcleo cuando el programa presenta cadenas largas de dependencias o accesos irregulares a memoria. NVIDIA no ha publicado todos los detalles del motor, pero confirma unidades escalares, vectoriales, de coma flotante, criptográficas y de carga o almacenamiento.

El multihilo espacial reduce la interferencia entre tareas

NVIDIA Vera estrena 88 núcleos Olympus y alcanza hasta 1,8× frente a EPYC Turin

 

Los procesadores con multihilo simultáneo permiten que dos hilos compartan un mismo núcleo, aunque pueden aparecer interferencias cuando ambos compiten por la caché, el predictor de saltos o las unidades de ejecución. Esto provoca variaciones de latencia especialmente problemáticas en servidores con numerosas tareas concurrentes.

Vera introduce NVIDIA Spatial Multithreading, una implementación que puede dividir previamente parte de los recursos disponibles entre los dos hilos. Olympus puede concentrar su capacidad en una tarea principal o crear dos entornos de ejecución más aislados, reduciendo la interferencia que ejerce un hilo sobre el otro.

La configuración completa suma 88 núcleos Olympus y 176 hilos, permitiendo ejecutar numerosos entornos aislados, herramientas y procesos auxiliares al mismo tiempo. NVIDIA busca mantener un rendimiento monohilo elevado con todos los núcleos ocupados, en lugar de optimizar únicamente las puntuaciones obtenidas con pocos hilos activos.

Vera incorpora 164 MB de caché L3 unificada

Los núcleos están conectados mediante NVIDIA Scalable Coherency Fabric, una interconexión coherente con 3,4 TB/s de ancho de banda interno. Esta estructura integra los controladores de memoria, las interfaces de entrada y salida, NVLink-C2C y 164 MB de caché L3 compartida dentro de un único die monolítico.

El diseño monolítico evita la latencia añadida por las comunicaciones entre distintos dies, presente en algunos procesadores basados en chiplets. NVIDIA sostiene que esta disposición proporciona una latencia más uniforme al acceder a datos compartidos, algo importante cuando numerosos núcleos consultan simultáneamente bases de datos, índices de recuperación o estructuras de grafos.

Olympus también incorpora varias unidades de precarga y una específica para datos organizados como grafos. Su función es anticipar qué información necesitará el procesador y trasladarla hacia la caché antes de que las unidades de ejecución queden detenidas esperando una respuesta desde la memoria principal.

NVIDIA Vera estrena 88 núcleos Olympus y alcanza hasta 1,8× frente a EPYC Turin

SOCAMM2 permite instalar hasta 1,5 TB LPDDR5X

Vera utiliza módulos SOCAMM2 con memoria LPDDR5X, capaces de proporcionar 1,2 TB/s de ancho de banda agregado, equivalente a un máximo teórico de 14 GB/s por núcleo. NVIDIA ofrecerá configuraciones con hasta 1,5 TB de memoria, una capacidad orientada a análisis de datos, inteligencia artificial y computación de alto rendimiento.

A diferencia de la memoria LPDDR soldada utilizada habitualmente en dispositivos de consumo, los módulos SOCAMM2 son extraíbles y sustituibles en el propio centro de datos. La plataforma conserva así la eficiencia energética y las conexiones cortas de LPDDR5X sin renunciar al mantenimiento ni a la ampliación que requieren los servidores.

NVIDIA afirma que este subsistema duplica el ancho de banda y triplica el ancho de banda por núcleo frente a plataformas x86 con DDR5. La comparación vuelve a proceder de pruebas internas, por lo que el resultado dependerá de la configuración de memoria, el procesador utilizado y el tipo de carga ejecutada.

El 1,8× corresponde a cargas seleccionadas

Las primeras cifras muestran hasta 1,8 veces más rendimiento en tareas vinculadas a agentes, incluyendo compilación de código, ejecución de Python y análisis de programas. Vera puede trabajar como procesador independiente o actuar como CPU anfitriona dentro de sistemas acelerados como Vera Rubin NVL72.

La propia NVIDIA señala que los resultados fueron medidos internamente durante julio de 2026 y que pueden variar antes de la disponibilidad comercial. La comparación tampoco implica que Vera supere por ese margen a EPYC Turin en bases de datos, virtualización, computación científica o cualquier otra carga de servidor.

El principal avance de Vera no reside únicamente en sus 88 núcleos, sino en combinar un rendimiento monohilo elevado, 1,2 TB/s de memoria LPDDR5X y una interconexión interna de 3,4 TB/s. El análisis independiente deberá confirmar si la arquitectura mantiene estas ventajas fuera de las cargas seleccionadas por NVIDIA.

Vía: TechPowerUp

Sobre el autor