El entrenamiento de GPT-6 Astra habría costado hasta 1.000 millones de dólares y Jensen Huang apunta a 400.000 GPU

El entrenamiento de GPT-6 Astra habría costado hasta 1.000 millones de dólares y Jensen Huang apunta a 400.000 GPU

El lanzamiento de GPT-6 Astra ha vuelto a poner sobre la mesa hasta dónde está creciendo la infraestructura necesaria para entrenar los modelos de inteligencia artificial más avanzados. OpenAI habría utilizado un clúster de alrededor de 100.000 GPU NVIDIA durante su entrenamiento, una escala que permitiría situar únicamente el coste computacional entre 500 y 1.000 millones de dólares, dependiendo de la duración y tarifa asumidas.

Ese despliegue podría quedar pequeño relativamente pronto. Jensen Huang, CEO de NVIDIA, ha apuntado a la llegada de unas 400.000 GPU adicionales, multiplicando por cuatro la escala asociada al entrenamiento de Astra. Si un futuro entrenamiento aprovechara semejante infraestructura mediante sistemas GB200 NVL72, las necesidades eléctricas podrían entrar incluso en el entorno de 1,2 GW, aunque esta última cifra procede de una estimación basada en varias suposiciones y no de un dato confirmado por OpenAI.

Cien mil GPU y hasta 1.000 millones de dólares solo en cálculo

El punto de partida es el enorme clúster utilizado para GPT-6 Astra. Tomando como referencia 100.000 GPU, entre 90 y 120 días de entrenamiento y un coste de 2,50$ a 3,50$ (~2,15€ a ~3,01€) por GPU y hora, el gasto únicamente en capacidad de cálculo se mueve dentro de un rango extraordinariamente amplio.

Las estimaciones utilizadas para ilustrar esa escala quedarían aproximadamente así:

  • 90 días a 2,50$ por GPU/hora: 540 millones de dólares (~465 millones de euros).
  • 120 días a 2,50$ por GPU/hora: 720 millones de dólares (~620 millones de euros).
  • 90 días a 3,50$ por GPU/hora: 756 millones de dólares (~651 millones de euros).
  • 120 días a 3,50$ por GPU/hora: 1.008 millones de dólares (~868 millones de euros).

Estas cifras no representan el coste confirmado del entrenamiento de GPT-6 Astra. Son cálculos teóricos construidos a partir de tarifas horarias estimadas y una duración hipotética, sin incluir infraestructura, energía, personal, almacenamiento, red, refrigeración, desarrollo previo o entrenamientos descartados.

El coste sería todavía mayor utilizando capacidad alquilada a determinados proveedores. La referencia citada para CoreWeave ronda 10,50$ (~9,04€) por GPU y hora, aunque tampoco existe confirmación de que OpenAI recurriera a esa plataforma para este entrenamiento concreto.

Stargate podría convertirse en la base del siguiente salto

La hipótesis más repetida sitúa el entrenamiento de Astra dentro de la infraestructura Stargate de OpenAI en Abilene, Texas, pero la ubicación concreta no está confirmada en la información disponible. Lo realmente relevante es que la siguiente etapa requeriría una instalación bastante mayor si las 400.000 GPU mencionadas por Jensen Huang terminan empleándose conjuntamente.

El ejecutivo de NVIDIA aseguró que “400K GPUs” serían las siguientes en entrar en funcionamiento, después de felicitar públicamente a OpenAI por Astra. Eso indica una fuerte expansión de capacidad, pero no demuestra por sí solo que las 400.000 unidades vayan a participar simultáneamente en un único entrenamiento.

Por tanto, conviene distinguir capacidad de infraestructura disponible y tamaño efectivo de un entrenamiento concreto. Un centro de datos puede repartir sus aceleradores entre entrenamiento, inferencia, investigación, evaluaciones y varios modelos al mismo tiempo.

Aun así, pasar de una referencia de 100.000 a una infraestructura potencial de 400.000 GPU muestra la velocidad con la que está creciendo la escala necesaria para continuar empujando los modelos frontera.

Un hipotético despliegue completo podría acercarse a 1,2 GW

Existe además una estimación especialmente llamativa sobre el consumo. Si esas 400.000 GPU se desplegaran mediante racks NVIDIA GB200 NVL72, serían necesarios aproximadamente 5.556 sistemas de este tipo para alcanzar semejante número de aceleradores.

Suponiendo unos 140 kW por rack y un PUE de 1,5, que añade el consumo correspondiente a refrigeración y resto de infraestructura, el conjunto podría acercarse a 1,2 GW de demanda eléctrica.

Pero nuevamente estamos ante una proyección, no una especificación de un futuro centro de datos confirmado por OpenAI. El hardware finalmente utilizado, la utilización efectiva de cada GPU, el PUE real y la distribución de las cargas podrían modificar mucho esa cifra.

La magnitud sirve, no obstante, para visualizar el desafío. 1,2 GW deja de ser una cifra propia de un simple centro de datos convencional y entra en una escala energética comparable a grandes instalaciones industriales.

Astra cambia también la forma en la que se utiliza el modelo

El enorme gasto computacional no se destina únicamente a aumentar resultados en benchmarks. GPT-6 Astra está diseñado para trabajar directamente con navegadores, hojas de cálculo, páginas web y aplicaciones de escritorio, avanzando desde el modelo tradicional de chatbot hacia tareas completas realizadas sobre un ordenador.

Su arquitectura puede desplegar varios agentes especializados para trabajar en paralelo sobre distintas partes de un problema. Un agente principal puede plantear una estrategia mientras otros comprueban alternativas, ejecutan pruebas o validan resultados antes de continuar.

Ese planteamiento busca reducir uno de los problemas habituales de los agentes autónomos: quedar atrapados repitiendo una acción que no funciona. Al disponer de diferentes líneas de trabajo y validación, el sistema puede abandonar una estrategia, depurar errores y probar otra aproximación sin depender constantemente de nuevas instrucciones del usuario.

El resultado es una infraestructura que necesita capacidad tanto para entrenar modelos cada vez mayores como para ejecutar posteriormente grandes cantidades de agentes e inferencias. La carrera de hardware no termina, por tanto, cuando finaliza el entrenamiento.

Jensen Huang habla de AGI, pero no existe consenso

Huang fue todavía más lejos al afirmar que “la AGI ha llegado” tras el lanzamiento de Astra. Es una valoración extraordinariamente contundente, pero debe tratarse como la opinión del CEO de NVIDIA y no como una conclusión aceptada de forma general por la comunidad científica.

De hecho, disponer del modelo más grande o utilizar más GPU no establece por sí mismo que se haya alcanzado inteligencia artificial general. La definición de AGI sigue siendo objeto de debate y no existe una prueba universalmente aceptada que permita señalar un momento concreto en el que se haya cruzado ese umbral.

Astra tampoco domina absolutamente todas las evaluaciones disponibles. Según las comparaciones citadas, Anthropic Fable 5.1 continúa por delante en SWE-bench Pro y determinados índices de inteligencia, agentes de programación y demostraciones matemáticas formales.

Eso no resta importancia a la evolución de GPT-6 Astra, pero sí demuestra que el progreso continúa siendo desigual según la tarea y el benchmark utilizado, incluso cuando el entrenamiento alcanza escalas de decenas de miles de aceleradores.

La próxima barrera ya no es solo conseguir más GPU

Si las estimaciones se aproximan a la realidad, entrenar Astra habría requerido cientos de millones de dólares únicamente en capacidad computacional, mientras una futura infraestructura cuatro veces mayor añadiría desafíos energéticos, térmicos y de interconexión mucho más difíciles.

La carrera comienza así a depender tanto de electricidad, centros de datos, redes, refrigeración y capacidad de fabricación como de los propios algoritmos. Conseguir 400.000 GPU sirve de poco si no pueden alimentarse, conectarse y mantenerse trabajando eficientemente como parte de una infraestructura coherente.

GPT-6 Astra muestra hasta dónde ha llegado esa escalada: 100.000 GPU para una sola generación y hasta 1.000 millones de dólares estimados en cálculo. Si las 400.000 unidades adelantadas por Jensen Huang marcan realmente la siguiente etapa, el próximo gran salto de la IA podría necesitar una infraestructura varias veces mayor que la utilizada apenas unos meses antes.

Vía: Wccftech

Sobre el autor