AMD ha anunciado una alianza técnica con Cerebras para combinar la plataforma Helios con la arquitectura Wafer-Scale Engine dentro de un mismo flujo de inferencia. La solución separará distintas fases del procesamiento para alcanzar hasta 5× más tokens por segundo y vatio, priorizando rendimiento agregado, baja latencia y eficiencia energética.
La elección recibe además un respaldo relevante desde OpenAI. Jeffrey Wang, investigador de la compañía, asegura que algunos modelos internos ejecutados sobre chips de Cerebras ofrecen una inferencia tan rápida que determinadas tareas terminan antes de que pueda cambiar de actividad, mejorando directamente su productividad durante el trabajo diario.
OpenAI destaca la velocidad de los chips de Cerebras
Jeffrey Wang explica que anteriormente podía esperar varios minutos hasta completar determinadas tareas, mientras los sistemas de Cerebras reducen esa pausa hasta evitar la interrupción mental asociada al cambio de contexto. La mejora permite mantener la concentración sobre el mismo problema, especialmente durante procesos iterativos de programación, investigación y evaluación de modelos.
El comentario resulta especialmente significativo porque OpenAI ya ejecuta algunos modelos internos sobre chips de Cerebras. No se trata únicamente de una demostración técnica, sino de una experiencia obtenida mediante cargas reales de trabajo, donde la velocidad de generación modifica directamente el tiempo necesario para probar instrucciones, revisar resultados y repetir experimentos.
La declaración no confirma el rendimiento de la futura combinación entre AMD Helios y Wafer-Scale Engine, pero reduce parte del riesgo tecnológico asociado a Cerebras. Su arquitectura ya demuestra una latencia de inferencia muy baja dentro de OpenAI, mientras AMD aportará la capacidad de procesamiento escalable necesaria para atender grandes volúmenes de solicitudes.
OpenAI researcher Jeffrey Wang reveals the internal models running on Cerebras chips are so fast that tasks now finish before he even has the opportunity to context-switch, and it increases his productivity.
«Internally, we have some OpenAI models that are on Cerebras chips.… https://t.co/Aajgm9J5xl pic.twitter.com/I9DZwBzwVW
— Fireside Alpha (@firesidealpha) July 28, 2026
Helios procesará el contexto y Cerebras generará los tokens
AMD y Cerebras aplicarán un modelo de inferencia desagregada, separando las fases de prefill y decode. Helios procesará las instrucciones iniciales y las ventanas extensas de contexto con un elevado throughput, mientras la Wafer-Scale Engine asumirá la generación secuencial de tokens, especialmente sensible al ancho de banda y la latencia de memoria.
La plataforma AMD Helios estará formada por estos componentes principales:
- Aceleradores AMD Instinct MI455X.
- Procesadores AMD EPYC de sexta generación.
- Tarjetas de red AMD Pensando AI NIC.
- AMD Pensando DPU para infraestructura y seguridad.
- Interconexión AMD Infinity Fabric.
- Pila de software AMD ROCm.
Este reparto permite asignar cada etapa al motor que ofrece una mayor eficiencia específica. Helios aportará capacidad de cálculo, escalabilidad y procesamiento paralelo, mientras Cerebras acelerará el decode y la generación de tokens. AMD calcula que la combinación puede proporcionar hasta 5× más tokens por segundo y vatio frente a una arquitectura convencional.
La cifra de 5× procede de las estimaciones anunciadas por AMD y Cerebras, no de benchmarks independientes. El resultado final dependerá del modelo utilizado, la longitud del contexto, el tamaño de los lotes, el patrón de tráfico y la implementación del centro de datos, por lo que no representa una mejora universal para cualquier carga.
Morgan Stanley laid out the economics of AI “intelligence factories.”
Data centers that sell tokens (AI inference output) could post net margins of 58-90%, depending on the NVIDIA GPU generation running them.
Blackwell-based centers: around 59% margins.
Rubin: around 78%.… pic.twitter.com/aDdHCEFjPt— Semiconductor Insider (@SemiconductorsX) July 28, 2026
Wafer-Scale Engine reduce el movimiento de datos
La Wafer-Scale Engine concentra una enorme cantidad de cálculo, memoria SRAM e interconexiones dentro de una única oblea de silicio. Esta arquitectura reduce los movimientos hacia memoria externa y las comunicaciones entre múltiples aceleradores, evitando algunos de los cuellos de botella de red y transferencia presentes en los sistemas distribuidos tradicionales.
Su gran bloque unificado de SRAM puede alojar modelos de tamaño medio o porciones considerables de modelos mayores. Mantener los datos cerca de los núcleos de cálculo disminuye la latencia de acceso y favorece el decode, donde cada nuevo token exige consultar repetidamente los parámetros y el estado acumulado durante la conversación.
El planteamiento no pretende sustituir completamente a las GPU AMD Instinct. Helios conservará la capacidad necesaria para entrenamiento, prefill, contextos largos e inferencia distribuida, mientras Cerebras funcionará como un motor especializado de latencia ultrabaja. La alianza construye así un sistema heterogéneo, no una plataforma basada exclusivamente en Wafer-Scale Engine.
Esta especialización resulta especialmente útil para asistentes interactivos, generación de código, agentes autónomos y aplicaciones en tiempo real. En esas cargas no basta con procesar muchos tokens de forma agregada: también importa reducir el tiempo que transcurre entre la solicitud del usuario y la entrega visible de cada respuesta.
Los tokens por vatio decidirán la rentabilidad de la inferencia
La eficiencia medida en tokens por segundo y vatio se ha convertido en una métrica comercial decisiva para los centros de datos. Generar más respuestas utilizando la misma potencia mejora la utilización de la infraestructura, mientras que reducir la energía consumida por token disminuye los costes operativos, térmicos y eléctricos asociados a cada modelo.
La inferencia representa una parte creciente del gasto porque los modelos deben ejecutarse continuamente para atender a millones de usuarios. Una reducción de latencia también puede aumentar la productividad y el uso del servicio, pero necesita mantenerse sin disparar el consumo energético ni la cantidad de hardware desplegado dentro de cada centro de datos.
La colaboración permite a AMD diferenciar Helios frente a soluciones de rack más homogéneas. En lugar de obligar a los Instinct MI455X a asumir todas las fases, la compañía incorpora una arquitectura especializada para el decode. Esa separación podría mejorar la eficiencia total del sistema, aunque también aumenta la complejidad de integración y programación.
AMD todavía no ha comunicado una fecha concreta para la integración comercial, las configuraciones finales ni resultados independientes. Por ahora, los 5× más tokens por vatio deben considerarse un objetivo técnico. El respaldo de OpenAI demuestra la velocidad de Cerebras, pero la solución conjunta deberá validar su rendimiento, coste y escalabilidad.
Vía: Wccftech










