SpaceXAI quiere llevar Colossus 2 de 550.000 a 1,21 millones de GPU NVIDIA antes de acabar 2026

SpaceXAI quiere llevar Colossus 2 de 550.000 a 1,21 millones de GPU NVIDIA antes de acabar 2026

SpaceXAI quiere acelerar todavía más la ampliación de Colossus 2 en Memphis. Según las últimas cifras compartidas por Elon Musk, el centro de datos funciona actualmente con 110.000 NVIDIA GB200 y 440.000 GB300, una capacidad que ya sitúa la segunda fase del proyecto muy por encima de la infraestructura con la que comenzó Colossus.

El siguiente objetivo resulta todavía más ambicioso. Musk asegura que la compañía pretende incorporar otras 660.000 GPU GB300 antes de terminar 2026, repartidas en tres nuevas tandas de 220.000 unidades. Si consigue cumplir el calendario, Colossus 2 pasaría de las 550.000 GPU actuales a aproximadamente 1,21 millones de aceleradores NVIDIA.

Las GB300 ya dominan Colossus 2

La mayor parte de la capacidad instalada corresponde actualmente a 440.000 NVIDIA GB300, frente a las 110.000 GB200 que completan el despliegue actual. Esto muestra claramente hacia dónde está desplazándose la infraestructura: Blackwell Ultra se está convirtiendo en la plataforma principal de Colossus 2.

El contraste con la primera fase es considerable. Colossus 1 se levantó principalmente alrededor de unas 200.000 GPU NVIDIA H100, a las que posteriormente se sumaron aproximadamente 30.000 GB200. La segunda instalación no solo supera ya esas cifras, sino que lo hace utilizando una generación de hardware mucho más reciente.

La siguiente ampliación añadirá otras 220.000 GPU

Musk espera poner en funcionamiento un nuevo bloque de 220.000 GB300 en cuestión de días. Solo con esa incorporación, Colossus 2 alcanzaría unas 770.000 GPU entre GB200 y GB300.

La compañía no pretende detenerse ahí. Otro lote de 220.000 GB300 debería estar operativo antes de finalizar noviembre, elevando la instalación hasta aproximadamente 990.000 aceleradores.

Todavía quedaría una tercera ampliación del mismo tamaño. Musk considera posible incorporar otras 220.000 GB300 durante diciembre, aunque ese último paso dependerá de que el despliegue mantenga el ritmo previsto.

1,1 millones de GB300 si se completa todo el calendario

Las tres nuevas incorporaciones sumarían 660.000 GB300 adicionales a las 440.000 ya instaladas, llevando únicamente esta generación hasta 1,1 millones de unidades.

A ellas habría que añadir las 110.000 GB200 actuales, dejando Colossus 2 en torno a 1,21 millones de GPU NVIDIA antes de cerrar 2026.

Conviene separar claramente el objetivo de la capacidad existente. Las 660.000 nuevas GPU todavía no están operativas, por lo que la cifra de 1,21 millones representa el escenario al que SpaceXAI pretende llegar y no el tamaño actual del centro de datos.

El ritmo planteado resulta especialmente llamativo porque la compañía pretende más que duplicar en pocos meses buena parte de la capacidad Blackwell Ultra disponible actualmente en Colossus 2.

Poner las GPU en funcionamiento es tan importante como conseguirlas

Musk también ha reconocido que desplegar semejante cantidad de capacidad de cálculo con rapidez resulta extremadamente difícil. Instalar cientos de miles de GPU exige ampliar al mismo tiempo electricidad, refrigeración, redes y almacenamiento, además de conseguir que todos esos sistemas trabajen de forma coordinada.

En una infraestructura de este tamaño, la interconexión entre aceleradores se convierte en un elemento crítico. El rendimiento disponible deja de depender únicamente de cada GPU y pasa a estar condicionado por la capacidad del sistema para mover datos entre miles de nodos sin generar cuellos de botella.

Por eso, recibir físicamente las GPU no equivale a disponer inmediatamente de toda su capacidad. Cada nueva fase necesita instalarse, validarse e integrarse dentro del clúster antes de poder dedicarse de forma estable al entrenamiento o la inferencia.

Blackwell Ultra toma el relevo de Hopper

El crecimiento de Colossus permite observar también la velocidad con la que está cambiando el hardware utilizado para inteligencia artificial. H100 fue una de las bases de la primera gran expansión, mientras Colossus 2 está trasladando prácticamente todo el crecimiento nuevo hacia GB300.

Las plataformas GB300 combinan GPU Blackwell Ultra con CPU Grace, siguiendo la estrategia de NVIDIA de integrar procesamiento general y aceleración para IA dentro de sistemas diseñados para trabajar a escala de rack.

Esto hace que comparar Colossus 1 y Colossus 2 únicamente mediante el número de GPU resulte insuficiente. Una GB300 no ofrece la misma capacidad que una H100, por lo que el salto real en potencia, memoria y ancho de banda es mayor de lo que sugiere simplemente contar aceleradores.

Toda esta capacidad estará destinada a acelerar Grok

Musk relaciona directamente el despliegue con las próximas generaciones de Grok y con el objetivo de acelerar el ritmo de desarrollo de los modelos de SpaceXAI. El ejecutivo considera que disponer rápidamente de una capacidad de cálculo mucho mayor permitirá reducir distancias frente a OpenAI y Anthropic.

Sus previsiones sobre futuros modelos siguen siendo, sin embargo, expectativas expresadas por el propio Musk y no resultados que puedan comprobarse actualmente.

Además, disponer de más hardware no garantiza automáticamente un modelo mejor. Arquitectura, datos de entrenamiento, algoritmos y eficiencia del software continúan siendo determinantes, especialmente cuando se intenta aprovechar un clúster compuesto por cientos de miles de aceleradores.

Aun así, aumentar el número de GPU sí permite ejecutar más entrenamiento e inferencia en paralelo, experimentar con modelos mayores y reducir determinados tiempos de desarrollo cuando el resto de la infraestructura puede mantener alimentado al hardware.

Colossus 2 podría sumar más GPU nuevas de las que tiene ahora mismo

La magnitud del plan se aprecia mejor comparando directamente ambas cifras. Colossus 2 tendría actualmente unas 550.000 GPU y quiere añadir otras 660.000 antes de finalizar diciembre.

Eso significa que SpaceXAI pretende incorporar durante los próximos meses más aceleradores de los que ya tiene funcionando actualmente en esta segunda fase del proyecto.

Si consigue completar las tres ampliaciones, las GB300 pasarían de 440.000 a 1,1 millones de unidades, convirtiendo Blackwell Ultra en el componente absolutamente dominante de la instalación.

El objetivo final de aproximadamente 1,21 millones de GPU NVIDIA en Colossus 2 muestra hasta qué punto la carrera por entrenar modelos de IA está llevando a construir infraestructuras de una escala que hace apenas unos años habría resultado difícil de imaginar.

Vía: Wccftech

Sobre el autor