Ryzen AI Max+ PRO 495 mueve un modelo de 320.000 millones de parámetros a 20 tokens/s

Ryzen AI Max+ PRO 495 mueve un modelo de 320.000 millones de parámetros a 20 tokens/s

AMD ha detallado los avances de su estrategia “Agentic PC”, una denominación propia para equipos capaces de ejecutar agentes de IA localmente mediante CPU, GPU y NPU. La compañía asegura haber distribuido más de 500.000 Agentic PC en más de 50 diseños, además de decenas de millones de AI PC correspondientes a más de 250 modelos.

El gran protagonista ha sido el Ryzen AI Max+ PRO 495 “Gorgon Halo”, capaz de incorporar hasta 192 GB de memoria LPDDR5X compartida entre CPU y GPU. AMD asegura haber ejecutado localmente GLM 5.3 Flash, con 320.000 millones de parámetros, alcanzando hasta 20 tokens/s mediante cuantización de 4 bits.

Los 192 GB permiten asignar hasta 160 GB a la GPU

El Ryzen AI Max+ PRO 495 permite configurar manualmente cuánta memoria queda disponible para la GPU integrada. En las pruebas con GLM 5.3 Flash, AMD reservó 160 GB de los 192 GB disponibles, una cantidad muy superior a la memoria gráfica presente en prácticamente cualquier portátil convencional.

El modelo necesitó alrededor de 160 GB con cuantización UD_IQ4_XS de 4 bits, mostrando que una de las principales ventajas de esta plataforma no está únicamente en la potencia de cálculo. Poder acceder a una reserva de memoria compartida tan grande permite ejecutar cargas que directamente no cabrían en GPUs móviles con 16, 24 o incluso 32 GB de memoria gráfica.

AMD promociona la plataforma como capaz de trabajar con modelos de hasta 300.000 millones de parámetros, aunque sus propias diapositivas presentan cierta inconsistencia. Una nota fechada el 10 de mayo todavía menciona modelos de hasta 200.000 millones de parámetros para la anterior configuración con 128 GB de memoria.

Eso parece corresponder a documentación heredada de la generación previa, pero ilustra por qué conviene diferenciar entre capacidad teórica para cargar un modelo y rendimiento práctico al ejecutarlo. Que un modelo entre en memoria no implica necesariamente que vaya a generar tokens a una velocidad útil.

GLM 5.3 Flash alcanza hasta 20 tokens/s

Según las pruebas internas de AMD, GLM 5.3 Flash con 320.000 millones de parámetros alcanza hasta 20 tokens/s sobre el Ryzen AI Max+ PRO 495. La cifra resulta especialmente llamativa tratándose de una GPU integrada, aunque procede de una carga muy concreta.

La compañía mostró también Qwen 3.8 Flash Next a hasta 42 tokens/s, con una configuración de 125.000 millones más 51.000 millones de parámetros y MTP activado, una técnica que puede elevar la velocidad al predecir varios tokens por paso.

Modelo probado Configuración destacada Rendimiento anunciado
GLM 5.3 Flash 320.000 millones de parámetros, cuantización de 4 bits Hasta 20 tokens/s
Qwen 3.8 Flash Next 125.000 M + 51.000 M, MTP activado Hasta 42 tokens/s

 

Ambos resultados parecen proceder de una prueba corta basada en una pregunta de física, por lo que tareas de agentes prolongadas pueden ofrecer cifras diferentes. Longitud del contexto, tamaño del lote, herramientas utilizadas y generación sostenida pueden alterar considerablemente el rendimiento observado durante sesiones reales.

AMD gana las 18 pruebas de ComfyUI frente al Core Ultra X9 388H

AMD comparó el Ryzen AI Max+ PRO 495 con un Intel Core Ultra X9 388H mediante 18 cargas generativas ejecutadas en ComfyUI. Según sus resultados, el sistema AMD fue más rápido en todas ellas, con ventajas normalmente situadas entre 1,1x y 3,1x.

Existe, sin embargo, una diferencia importante en la configuración. El equipo AMD utilizó 192 GB de memoria con 128 GB asignados a la GPU, mientras el portátil Intel disponía de 64 GB. Esa diferencia debería importar poco en modelos pequeños que caben en ambos sistemas, pero puede ser decisiva en cargas grandes.

El benchmark denominado YuE muestra una ventaja extrema de 32,2x, precisamente donde la capacidad podría convertirse en el factor dominante. No sería correcto atribuir directamente esa diferencia a una superioridad equivalente de la arquitectura gráfica de AMD.

Panther Lake puede admitir capacidades superiores en determinadas configuraciones, pero el Core Ultra X9 388H está limitado a LPDDR5X y alcanza hasta 96 GB. Además, AMD habría utilizado uno de los sistemas Intel comerciales con mayor memoria disponible en ese momento, evitando una comparación deliberadamente limitada por una configuración básica.

AMD incluso escribió mal varios nombres en sus propias diapositivas

Resulta llamativo que varios modelos aparezcan mal escritos en la presentación de AMD. “Klien” debería ser Klein, “Yuve” corresponde realmente a YuE y “Pixal 3D” debería aparecer como Pixel 3D, errores que no invalidan por sí solos los benchmarks, pero sí aconsejan revisar con cautela el material.

x86 es otro de los argumentos frente a los PC con Snapdragon

AMD aprovechó la presentación para destacar la compatibilidad nativa con aplicaciones x86 en Windows y Linux, contraponiéndola a equipos Arm con Snapdragon que pueden necesitar la capa de traducción Prism de Microsoft cuando una aplicación carece de versión nativa.

Esto puede ser especialmente importante en herramientas profesionales como SolidWorks, Autodesk 3ds Max o Mastercam, citadas por AMD. En este tipo de entornos, evitar traducción también reduce posibles problemas con complementos, controladores o software antiguo.

AMD ya ha enviado más de medio millón de sus “Agentic PC”

AMD afirma haber distribuido más de 500.000 equipos clasificados como Agentic PC mediante más de 50 diseños. El término, sin embargo, es una categoría comercial creada por la propia compañía, no un estándar independiente de la industria.

La empresa considera que los sistemas Ryzen AI Max+ con 64 GB de memoria o más ofrecen la mejor experiencia para ejecutar agentes localmente. La serie Ryzen AI Max 400 representa su siguiente paso para 2026, con el PRO 495 y sus 192 GB como configuración de referencia más ambiciosa.

AMD también recordó el soporte de FSR en más de 700 juegos junto con acuerdos con Microsoft, Perplexity y Cisco. Ryzen AI Halo será la primera plataforma de Project Zenith, mientras Perplexity prepara Portable Computer para sistemas Ryzen AI Max.

No existe todavía una hoja de ruta detallada posterior a la serie 400. La estrategia actual deja claro, no obstante, que AMD quiere utilizar la enorme capacidad de memoria compartida como elemento diferenciador frente a portátiles con GPU dedicada y reservas de memoria gráfica mucho menores.

Light Sail VR utiliza IA local por privacidad y para evitar costes por token

AMD mostró como caso práctico a Light Sail VR, un estudio de producción inmersiva que utiliza un agente local como coordinador. El sistema comenzó en un Framework Desktop con Ryzen AI Max y 128 GB de memoria, antes de pasar a una plataforma equipada con tarjetas gráficas Radeon AI PRO R9700.

Según su CEO, Matthew Celia, los empleados interactúan con el agente mediante Slack para actualizar calendarios, documentos y correos electrónicos. La compañía afirma haber pasado de gestionar uno o dos trabajos simultáneos a entre seis y nueve, aunque esa mejora no ha sido verificada de forma independiente.

El estudio eligió IA local principalmente por privacidad y costes, ya que trabaja con acuerdos de confidencialidad y quería evitar miles de dólares en consumo de tokens. Es un ejemplo interesante del tipo de escenario que AMD intenta asociar a sus Agentic PC, pero no sustituye una evaluación independiente del hardware.

Todas las cifras de rendimiento de la presentación proceden de pruebas realizadas por la propia AMD. La ventaja más fácil de comprobar sigue siendo la capacidad: disponer de 192 GB de memoria compartida permite cargar localmente modelos que directamente no caben en la mayoría de portátiles, aunque habrá que medir fuera de las demostraciones cuánto rendimiento sostenido ofrece realmente.

Vía: TechPowerUp

Sobre el autor