AMD une Helios con Cerebras WSE para lograr hasta 5x más tokens por segundo por vatio

AMD une Helios con Cerebras WSE para lograr hasta 5x más tokens por segundo por vatio

AMD integrará Helios con Cerebras Wafer-Scale Engine, combinando su plataforma de inteligencia artificial a escala de rack con un procesador construido sobre una oblea completa. La propuesta promete hasta 5x más tokens por segundo por vatio, además de menor latencia durante la generación de respuestas en modelos avanzados.

La colaboración aplicará inferencia desagregada, separando el procesamiento inicial del contexto y la generación secuencial de tokens entre dos motores especializados. Helios asumirá las cargas de alto rendimiento, mientras Cerebras WSE acelerará la decodificación, evitando obligar a una sola arquitectura a resolver fases con necesidades diferentes.

Helios procesará prompts y grandes ventanas de contexto

La primera etapa de inferencia, conocida como prefill, analiza el prompt completo y construye el estado necesario para iniciar la respuesta. Helios se encargará de este procesamiento inicial de alto rendimiento, aprovechando sus aceleradores Instinct para manejar prompts complejos, numerosas solicitudes simultáneas y ventanas de contexto extensas.

Esta fase favorece una arquitectura con gran capacidad de cálculo paralelo, memoria de alta velocidad y escalabilidad entre numerosos aceleradores. El objetivo consiste en procesar cada solicitud con rapidez antes de transferir la generación secuencial hacia Cerebras, evitando que el prefill limite el volumen total de trabajo.

Helios integra 72 aceleradores Instinct MI455X, procesadores EPYC Venice y redes Pensando dentro de un rack abierto. La plataforma alcanza 31 TB de memoria HBM4, hasta 260 TB/s de ancho de banda de interconexión dentro del rack y alrededor de 2,9 exaFLOPS en FP4 para cargas de IA.

Estas cifras sitúan a Helios como el motor encargado de absorber grandes volúmenes de solicitudes, entrenamiento, ajuste e inferencia intensiva. Sin embargo, la generación de cada token presenta un comportamiento distinto, más condicionado por la latencia de memoria que por el rendimiento bruto disponible entre todas las GPU.

Cerebras WSE acelerará la generación secuencial de tokens

AMD une Helios con Cerebras WSE para lograr hasta 5x más tokens por segundo por vatio

La segunda fase, denominada decode, genera los tokens de la respuesta uno tras otro. Esta etapa necesita consultar repetidamente los pesos del modelo, por lo que depende especialmente de un acceso rápido y predecible a memoria, además de una comunicación eficiente entre cálculo, parámetros y activaciones.

El Wafer-Scale Engine se ocupará de esta decodificación de latencia ultrabaja, reduciendo el tiempo transcurrido entre tokens. La mejora resultará especialmente útil en asistentes de programación, sistemas conversacionales, aplicaciones interactivas y agentes que deben ejecutar varias acciones consecutivas sin introducir esperas prolongadas.

Cerebras concentra cálculo y memoria dentro de una oblea completa, evitando distribuir el procesador entre numerosos chips independientes. El WSE-3 reúne 4 billones de transistores, 900.000 núcleos de cálculo y 44 GB de SRAM integrada en un único silicio fabricado mediante un proceso de 5 nm.

La memoria alcanza alrededor de 21 PB/s de ancho de banda interno, permitiendo mantener una gran cantidad de información cerca de las unidades de ejecución. Esta organización reduce los desplazamientos hacia memoria externa y parte de los cuellos de botella asociados a modelos repartidos entre aceleradores conectados mediante redes convencionales.

La inferencia desagregada divide cada fase según sus necesidades

La alianza no consiste únicamente en conectar dos sistemas diferentes. AMD y Cerebras pretenden coordinar prefill y decode dentro de un mismo flujo de trabajo, enviando cada fase hacia el motor que puede resolverla con mayor eficiencia, rendimiento o menor latencia.

Helios proporcionará alto rendimiento agregado y escalabilidad, mientras Cerebras asumirá la generación intensiva en ancho de banda de memoria. Esta distribución busca mantener elevada la cantidad de solicitudes procesadas sin sacrificar el tiempo de respuesta, un equilibrio especialmente complejo en servicios con numerosos usuarios simultáneos.

El planteamiento también permite ajustar los recursos de forma independiente. Un operador podría ampliar la capacidad de prefill o decode según el comportamiento de sus cargas, evitando desplegar la misma proporción de aceleradores para ambas fases. Esto puede traducirse en mejor utilización del hardware y menor consumo por token generado.

La cifra anunciada alcanza hasta 5x más tokens por segundo por vatio frente a una configuración formada únicamente por sistemas Cerebras. La mejora procede de combinar el elevado rendimiento de Helios durante el prefill con la baja latencia del Wafer-Scale Engine durante el decode.

AMD une Helios con Cerebras WSE para lograr hasta 5x más tokens por segundo por vatio

El resultado de 5x depende del modelo y la configuración

La ventaja fue calculada utilizando Kimi 2.6 con un billón de parámetros, comparando Helios junto con Cerebras frente a una plataforma basada únicamente en WSE. Por tanto, el resultado no representa una mejora universal aplicable a cualquier modelo, nivel de concurrencia o longitud de contexto.

El rendimiento efectivo dependerá del reparto entre prefill y decode, el tamaño del modelo, la longitud de los prompts, la cantidad de usuarios simultáneos y el software encargado de coordinar ambos sistemas. Una carga dominada por generación de tokens puede comportarse de forma distinta a otra con contextos iniciales mucho más extensos.

También será necesario valorar el coste completo de desplegar ambas plataformas. Una mayor eficiencia energética no implica automáticamente un menor coste total cuando se incluyen equipos de red, refrigeración, espacio físico, mantenimiento y complejidad operativa. La integración deberá demostrar ventajas sostenidas fuera de las simulaciones iniciales.

La propuesta resulta especialmente atractiva para servicios donde importan simultáneamente alto volumen y respuesta inmediata. La inferencia para agentes, programación o razonamiento puede necesitar largos prompts, pero también exige generar tokens con rapidez para evitar que cada paso ralentice toda la cadena de trabajo.

Cerebras utiliza una arquitectura distinta a las LPU de Groq

AMD une Helios con Cerebras WSE para lograr hasta 5x más tokens por segundo por vatio

Groq distribuye los modelos entre numerosos chips especializados, cada uno equipado con grandes bloques matriciales, vectoriales y alrededor de 230 MB de SRAM. Su compilador programa de forma determinista cada operación, movimiento de datos y comunicación, eliminando predictores de saltos y planificadores de hardware.

Esta ejecución planificada permite conseguir latencias muy bajas y predecibles, pero requiere dividir los modelos entre múltiples aceleradores con memorias independientes. Cerebras sigue la dirección opuesta al concentrar cientos de miles de núcleos y decenas de GB de SRAM dentro de un único silicio interconectado.

El WSE puede mantener un modelo mediano completo o grandes secciones de otro más extenso dentro de su memoria integrada. Esto reduce la necesidad de mover información entre chips, mientras su arquitectura conserva capacidad para entrenamiento e inferencia, no únicamente generación de tokens.

NVIDIA utiliza la tecnología de Groq mediante el Groq 3 LPX, un rack con 256 aceleradores LPU, refrigeración líquida y hasta 315 PFLOPS de rendimiento FP8. La plataforma alcanza además 128 GB de SRAM, 40 PB/s de ancho de banda interno y 640 TB/s de comunicación entre chips.

AMD responde a NVIDIA mediante una plataforma más heterogénea

La alianza con Cerebras permite a AMD incorporar un motor especializado en baja latencia sin desarrollar desde cero una arquitectura equivalente a las LPU. Helios seguirá proporcionando capacidad para entrenamiento, ajuste e inferencia general, mientras el WSE asumirá aquellas fases donde el acceso rápido a los pesos resulta decisivo.

NVIDIA adopta una estrategia comparable al combinar sus GPU de propósito más amplio con Groq 3 LPX. Ambas compañías convergen hacia plataformas heterogéneas de inferencia, donde diferentes tipos de aceleradores cooperan según la fase del modelo en lugar de depender de un único diseño para todo el proceso.

La diferencia principal reside en cómo escalan ambos enfoques. Groq utiliza numerosos chips coordinados por compilador, mientras Cerebras concentra los recursos dentro de una oblea completa. La primera opción prioriza ejecución determinista entre aceleradores; la segunda reduce las comunicaciones externas y los movimientos de datos.

La colaboración amplía el alcance de Helios más allá de una plataforma formada exclusivamente por tecnología AMD. Si la integración cumple las previsiones, permitirá combinar alto rendimiento de prefill, generación de tokens con latencia ultrabaja y mayor eficiencia energética, tres variables fundamentales para la próxima generación de servicios de IA.

Vía: Wccftech

Sobre el autor