Google prepara Frozen V2, un chip para Gemini que reduciría la dependencia de HBM y CoWoS

Google estaría desarrollando Frozen V2, un acelerador personalizado para ejecutar sus modelos Gemini con un menor consumo energético y un coste inferior por token. Según un informe de Morgan Stanley, el diseño integraría una elevada cantidad de memoria SRAM dentro del propio silicio, reduciendo la necesidad de memoria HBM externa.

Esta arquitectura también podría permitir a Google prescindir del encapsulado avanzado CoWoS de TSMC, utilizado para conectar grandes aceleradores con varias pilas de HBM. La compañía reduciría así su exposición a dos componentes caros y con capacidad limitada: la memoria de alto ancho de banda y el encapsulado 2,5D avanzado.

Frozen V2 estaría diseñado específicamente para Gemini

Frozen V2 sería un ASIC adaptado a la arquitectura de Gemini, no una TPU generalista destinada a ejecutar cualquier modelo. Google fijaría en el hardware determinadas operaciones, rutas de datos y comportamientos utilizados repetidamente durante la inferencia de sus propios modelos de inteligencia artificial.

La especialización permitiría eliminar parte de las instrucciones, transferencias y decisiones que una GPU NVIDIA o una TPU convencional deben resolver mediante software. El objetivo sería conseguir más tokens por segundo, una latencia inferior y un menor consumo por consulta dentro de servicios con millones de usuarios.

El coste de esa eficiencia sería una flexibilidad considerablemente menor. Si Google modifica profundamente las capas, los mecanismos de atención o la distribución interna de Gemini, algunas unidades de Frozen V2 podrían quedar infrautilizadas y exigir un nuevo diseño del silicio.

La SRAM estaría integrada directamente en el chip

Google pretende fabricar la memoria SRAM como parte del propio silicio, situándola físicamente junto a las unidades de cálculo. Esta memoria ofrece una latencia muy inferior y un ancho de banda interno superior al de la memoria externa, aunque necesita una superficie mucho mayor para almacenar cada bit.

La principal ventaja sería reducir el movimiento de parámetros y activaciones entre el acelerador y la memoria. En las cargas de inteligencia artificial, una parte importante del consumo no procede del cálculo, sino de trasladar continuamente enormes cantidades de datos mediante interconexiones externas.

Mantener más información dentro del chip permitiría alimentar las unidades de ejecución con menos esperas. Frozen V2 podría ofrecer así un mayor rendimiento por vatio, especialmente dentro de consultas repetitivas que utilizan la misma arquitectura y un conjunto estable de operaciones de Gemini.

Google prepara Frozen V2, un chip para Gemini que reduciría la dependencia de HBM y CoWoS

Google reduciría la necesidad de memoria HBM

Las GPU para inteligencia artificial y las TPU más avanzadas utilizan varias pilas de HBM para almacenar parámetros, activaciones y cachés de contexto. Esta memoria proporciona un enorme ancho de banda, pero aumenta el precio del acelerador, el consumo y la complejidad del encapsulado.

Frozen V2 intentaría mantener dentro de su SRAM integrada una parte mayor de los datos utilizados durante la inferencia. Google podría reducir el volumen de HBM necesario o, en determinadas configuraciones, prescindir completamente de ella mediante una arquitectura optimizada para modelos Gemini concretos.

No está confirmado que el chip pueda funcionar sin ninguna memoria externa. El resultado dependerá del tamaño del modelo, la precisión numérica, la longitud del contexto y la cantidad de activaciones almacenadas. La SRAM tampoco puede igualar económicamente la capacidad de varias pilas HBM.

Prescindir de HBM permitiría evitar CoWoS

El encapsulado TSMC CoWoS conecta un acelerador con varias pilas de memoria HBM mediante un interposer de alta densidad. Esta estructura permite alcanzar un ancho de banda enorme, pero incrementa el coste de fabricación, complica las pruebas y depende de una capacidad industrial muy demandada.

Si Frozen V2 puede ejecutar Gemini utilizando principalmente memoria integrada, Google dejaría de necesitar el conjunto formado por ASIC, interposer y varias pilas HBM. La compañía también evitaría competir por CoWoS con NVIDIA, AMD y otros desarrolladores de aceleradores para centros de datos.

Esto no significa fabricar un chip sin encapsulado. Frozen V2 todavía necesitaría sustrato, alimentación, conexiones de entrada y salida, refrigeración y montaje sobre una placa, pero podría utilizar una solución mucho más sencilla que los paquetes 2,5D destinados a aceleradores con HBM.

El movimiento de datos sería el principal objetivo

La arquitectura buscaría atacar el denominado muro de memoria, donde las unidades de cálculo pueden ejecutar operaciones más rápido de lo que reciben los datos necesarios. Añadir más potencia matemática aporta poco rendimiento cuando los núcleos permanecen esperando parámetros procedentes de la memoria externa.

La SRAM integrada reduciría la distancia física recorrida por los datos, disminuyendo simultáneamente la latencia y la energía empleada. Esta optimización podría resultar más importante que aumentar únicamente el número de unidades de cálculo dentro del acelerador.

Un chip especializado también puede eliminar operaciones innecesarias para Gemini. Frozen V2 combinaría así menos movimiento de datos, hardware adaptado al modelo y una menor dependencia de componentes externos para mejorar directamente el coste por token generado.

Los pesos podrían continuar siendo actualizables

El diseño recuerda al empleado por Taalas, que integra directamente los pesos de una red neuronal dentro del silicio. Esta estrategia elimina gran parte del tráfico de memoria, pero vincula cada chip con un modelo concreto y obliga a fabricar otro cuando cambian significativamente sus parámetros.

Frozen V2 adoptaría previsiblemente una solución menos rígida. Google podría fijar en hardware determinadas partes de la arquitectura de Gemini, mientras mantiene sus pesos actualizables. Esto permitiría utilizar versiones mejoradas del modelo siempre que conservaran una estructura compatible.

La separación entre arquitectura fijada y pesos modificables aumentaría la vida útil comercial del acelerador. Sin embargo, una revisión profunda de Gemini podría seguir obligando a rediseñar el chip, especialmente si cambia la distribución de expertos, el mecanismo de atención o el flujo de datos.

Marvell podría participar en el proyecto

Morgan Stanley considera que Frozen V2 podría entrar en una producción inicial durante 2027 y aumentar su volumen durante 2028. Marvell aparece como posible socio de diseño, aunque Google todavía no ha confirmado públicamente la colaboración ni el fabricante encargado del silicio.

Google ya trabaja con Broadcom y MediaTek en diferentes generaciones de aceleradores personalizados. La compañía también habría estudiado Intel EMIB-T como alternativa de encapsulado para futuras TPU, manteniendo abiertas varias combinaciones de procesos, proveedores y tecnologías de integración.

Frozen V2 seguiría una estrategia distinta: en lugar de sustituir CoWoS por otro encapsulado avanzado, intentaría reducir directamente la necesidad de utilizar HBM. Esta decisión simplificaría el paquete y evitaría depender de una capacidad compartida con los aceleradores más demandados del mercado.

Google reduciría costes a cambio de asumir más riesgo

Un acelerador especializado para Gemini podría proporcionar un menor consumo, una latencia inferior y un coste por token considerablemente más bajo. También permitiría reservar la memoria HBM y la capacidad CoWoS disponible para TPU destinadas a entrenamiento o cargas más generales.

El riesgo reside en que desarrollar un ASIC necesita varios años, mientras los modelos de IA pueden cambiar profundamente durante ese periodo. Google deberá conseguir que la arquitectura de Gemini permanezca suficientemente estable hasta que Frozen V2 alcance la producción masiva.

El proyecto representa una apuesta por la especialización extrema de la inferencia. Google no buscaría competir directamente con NVIDIA mediante otro acelerador generalista, sino aprovechar el control simultáneo sobre Gemini, el software y el silicio para reducir sus costes operativos.

Vía: Wccftech

Sobre el autor