GPT-6 Astra utiliza más de 100,000 GPUs Blackwell, destacando la brecha avanzada en clústeres de China

iconMetaEra
Compartir
AI summary iconResumen
Noticias de IA y cripto: GPT-6 Astra utilizó más de 100,000 GPUs Blackwell para el entrenamiento, mostrando una nueva fase en el desarrollo de la IA. Empresas chinas como ByteDance y DeepSeek están escalando el uso de GPUs, pero aún se quedan atrás en la implementación de Blackwell y la eficiencia de los clusters. El problema principal para China no es la cantidad de GPUs, sino construir sistemas de alta eficiencia. Las últimas noticias de cripto muestran que la IA y la infraestructura siguen siendo campos de batalla clave.
GPT-6 Astra revela públicamente que se entrenó con más de 100,000 GPU Grace Blackwell, lo que significa que la competencia en modelos de vanguardia ha entrado en la era de clusters ultraescalables.

Autor y fuente del artículo: ME News



TL;DR:

  • GPT-6 Astra revela públicamente que se entrenó con más de 100,000 GPU Grace Blackwell, lo que significa que la competencia en modelos de vanguardia ha entrado en la era de clusters ultraescalables.
  • Las principales empresas de modelos en China no carecen de capacidad de cómputo a gran escala, pero la información pública muestra que aún existen diferencias significativas en las generaciones avanzadas de GPU y en la escala de despliegue concentrado inicial.
  • Las empresas como ByteDance, Kimi y DeepSeek están ampliando su infraestructura de cómputo, pero actualmente se centran más en arquitecturas Hopper o soluciones sustitutas nacionales, aún distantes de clústeres de nivel Blackwell.
  • La clave de la competencia en IA ya no es si tienes GPU, sino si puedes obtener las GPU de la última generación y organizar eficientemente decenas de miles e incluso cientos de miles de chips.
  • Aunque Blackwell ya no es la arquitectura más reciente de NVIDIA, la tendencia de Rubin a reducir aún más los costos de entrenamiento implica que la ventaja competitiva podría seguir concentrándose en las capacidades de infraestructura.

Detrás de 100,000 unidades de Blackwell, la competencia en modelos grandes entra en la era de la infraestructura de cómputo

Cuando Huang Renxun reveló la escala de entrenamiento de GPT-6 Astra, lo que llamó la atención del público no fue solo el número "100.000 GPU", sino el nuevo paradigma de competencia en IA que representa este número.

En los últimos años, la competencia entre modelos grandes a menudo se ha entendido como una competencia en algoritmos, datos y capacidades de ingeniería. La innovación en la arquitectura del modelo, la optimización de los métodos de entrenamiento y el aumento de la eficiencia de inferencia realmente determinan la capacidad final de los productos de IA. Sin embargo, a partir de 2026, una tendencia cada vez más clara está emergiendo: cuando el tamaño del modelo sigue aumentando, la capacidad de la infraestructura en sí misma se ha convertido en un factor crucial que determina el límite tecnológico.

Según lo revelado públicamente por Jensen Huang, el entrenamiento de GPT-6 Astra utilizó más de 100,000 GPU Grace Blackwell, conectadas en un clúster de alta velocidad mediante NVLink72. Asimismo, mencionó que la próxima ola incluirá 400,000 GPU, pero no reveló los modelos específicos ni su propiedad.

Sin importar los detalles posteriores de implementación, esta información transmite una señal muy clara: el entrenamiento de los modelos más avanzados está pasando de la competencia por parámetros de decenas de billones y miles de GPU a la competencia entre clústeres de miles e incluso decenas de miles de GPU avanzadas.

Lo importante aquí no es solo la cantidad.

Si solo se compara la cantidad de GPU, las empresas chinas no carecen por completo de recursos de cómputo a gran escala. La verdadera brecha radica en si se puede obtener GPU de última generación de alto rendimiento y si se puede lograr una colaboración eficiente entre estas GPU en una misma tarea de entrenamiento.

Para modelos grandes, el rendimiento pico de una sola GPU es solo lo básico. Entrenar un modelo grande requiere que muchas GPUs intercambien continuamente parámetros y datos. Si la eficiencia de interconexión es insuficiente, incluso con una gran cantidad de chips, no se podrá lograr una capacidad de cómputo efectiva.

Por lo tanto, la competencia en infraestructura de IA ha pasado de "cuántas tarjetas comprar" a "qué tipo de sistema de cómputo construir".

La distribución de capacidad de cómputo de las principales empresas de modelos chinas presenta una brecha generacional con la era Blackwell

La información pública actual muestra que la capacidad de cómputo de las principales empresas de modelos de China está aumentando rápidamente, pero aún existe una brecha significativa en comparación con los clusters de entrenamiento de nivel Blackwell representados por GPT-6 Astra.

ByteDance es una de las empresas más cercanas al nivel internacional líder en la distribución pública de capacidad de cómputo. Este año, ByteDance conectó aproximadamente 36.000 GPU B200 a través de Malasia. Estos chips pertenecen a la arquitectura Blackwell de NVIDIA y pertenecen a la misma generación que los GB200 utilizados por Astra.

Sin embargo, es importante tener en cuenta que este lote de B200 se ha desplegado en el extranjero. Cuando ByteDance presenta públicamente la infraestructura de IA dentro de China, sigue utilizando principalmente la versión especial para China con arquitectura Hopper, el H20, así como chips como el H800 obtenidos anteriormente.

Lo que se refleja aquí no es simplemente una diferencia en cantidad, sino una brecha en la cadena de suministro y el entorno de despliegue.

Blackwell presenta mejoras en comparación con Hopper en términos de capacidad de cómputo, memoria gráfica y capacidad de interconexión. En particular, el GB200 no es simplemente una GPU, sino que combina la CPU Grace con la GPU Blackwell, conectando 72 GPU en un mismo dominio de interconexión de alta velocidad mediante el sistema NVL72.

Para el entrenamiento de modelos grandes, la importancia de este diseño a nivel de sistema está aumentando. Cuanto mayor sea el tamaño del modelo, mayor será la proporción de comunicación entre GPUs; la capacidad de los chips para coordinarse eficientemente afectará directamente la eficiencia del entrenamiento.

Se reveló que Moonshot, detrás de Kimi, obtuvo aproximadamente 20,000 GPU Hopper a través de Alibaba. Bloomberg citó fuentes que indican que el modelo específico es el H200, pero Alibaba negó que se tratara del modelo H200.

Si se calcula según el H200, aún pertenece a la arquitectura Hopper de la generación anterior, mientras que el B200 ya ha ingresado a la era Blackwell. Entre ambos no existe una simple relación de reemplazo entre viejo y nuevo, sino que representan capacidades de infraestructura de IA en distintas etapas.

La situación de DeepSeek es aún más especial.

DeepSeek generó atención global a principios de 2025 con modelos de alta eficiencia, y su línea tecnológica demostró que la optimización de algoritmos y la eficiencia de ingeniería pueden reducir parcialmente la demanda de poder de cómputo. Sin embargo, según la información pública, la empresa no ha revelado la configuración completa del hardware de entrenamiento de V4.

La transcripción filtrada de la reunión de intercambio con inversores de Liang Wenfeng muestra que la empresa tenía aproximadamente 20,000 unidades de potencia de cálculo equivalente H en mayo, la mayoría de las cuales acababan de llegar, y futuras adquisiciones serán "básicamente de NVIDIA". Huawei proporcionó a DeepSeek una capacidad de 950 equivalente a aproximadamente 16,000 unidades. Liang Wenfeng indicó que este lote de tarjetas nacionales equivale aproximadamente a 4,000 tarjetas Nvidia de la serie B, suficiente solo para el entrenamiento del modelo actual.

Esta información refleja una realidad: aunque las empresas chinas ya poseen una cantidad significativa de capacidad de IA, aún existe una brecha de escala respecto al uso concentrado de 100.000 GPU avanzadas de la misma generación en una sola tarea de entrenamiento.

La verdadera debilidad de la capacidad de cómputo de IA en China no es la falta de chips, sino la ausencia de capacidades avanzadas de clúster.

Al discutir la capacidad de cómputo de IA en China, es fácil caer en dos extremos.

Una opinión sostiene que China carece completamente de chips de IA avanzados, por lo que no puede participar en la competencia; otra opinión sostiene que, siempre que aumente la cantidad de chips nacionales, se puede alcanzar rápidamente a NVIDIA.

En realidad, la situación es más compleja.

La capacidad de entrenamiento de IA es determinada por múltiples componentes, incluyendo el rendimiento de los chips, procesos avanzados, capacidad de memoria gráfica, interconexión de alta velocidad, diseño de servidores, suministro de energía del centro de datos, ecosistema de software y capacidad de programación a gran escala.

La GPU es solo una de las partes más cruciales, pero no la única.

La ventaja a largo plazo establecida por NVIDIA no proviene solo del hardware GPU, sino también del ecosistema CUDA, las tecnologías de interconexión de red, las soluciones de servidores y el sistema integral formado con proveedores de nube.

En la era Blackwell, esta ventaja del sistema se amplía aún más.

Cuando un entrenamiento de modelo requiere 100.000 GPU, el problema ya no es simplemente adquirir decenas de miles de chips, sino cómo construir una fábrica de cálculo grande que funcione de manera estable.

Esta es también la razón por la que las empresas chinas aún no han revelado en documentos públicos ningún caso de entrenamiento de modelo utilizando 100,000 GPU avanzadas de la misma generación.

Las empresas chinas están mejorando sus capacidades de diversas maneras, incluyendo el aumento de la despliegue de potencia de cómputo en el extranjero, la expansión de la adaptación de chips nacionales, la optimización de la arquitectura de modelos y el aumento de la eficiencia de entrenamiento. Estas vías tienen valor, pero en el corto plazo es difícil reemplazar por completo la ventaja de capacidad básica que ofrecen los clusters de GPU más avanzados.

En los últimos años, la industria china de IA ha demostrado un hecho: la innovación algorítmica puede reducir significativamente ciertas brechas.

La aparición de empresas como DeepSeek demuestra que equipos de ingeniería excelentes pueden lograr avances con recursos computacionales limitados mediante la optimización de la arquitectura del modelo, el ajuste de estrategias de entrenamiento y la mejora de la eficiencia en el uso de recursos.

Pero otro hecho también es cierto: cuando la competencia global entre en la etapa de modelos base de próxima generación, la importancia de la escala de poder de cómputo seguirá aumentando.

La optimización de la eficiencia puede reducir costos, pero es difícil cambiar por completo los límites de capacidad impuestos por hardware avanzado y clústeres de gran escala.

Después de Blackwell, la era Rubin podría ampliar aún más la brecha en infraestructura

Lo que merece más atención es que Blackwell no es el punto final de la línea tecnológica actual de NVIDIA.

La próxima arquitectura Vera Rubin de NVIDIA ya ha entrado en producción en masa. Según las estimaciones públicas de NVIDIA, al entrenar grandes modelos MoE, la cantidad de GPU necesaria para Rubin se reduce aproximadamente a la cuarta parte de la de Blackwell.

Esto significa que la competencia futura en IA podría entrar en un nuevo ciclo.

Las empresas líderes cuentan con la arquitectura más reciente, lo que les permite realizar entrenamientos a mayor escala con menos chips; un menor costo de entrenamiento impulsa a estas empresas a realizar más experimentos, mejorando aún más la capacidad de los modelos.

Las empresas rezagadas que solo puedan acceder a hardware de la generación anterior podrían enfrentar dos problemas: por un lado, una eficiencia de entrenamiento baja, y por otro, dificultades para competir en modelos de mayor escala.

Of course, this does not mean that Chinese AI companies have no opportunities.

La historia de la IA ha demostrado en múltiples ocasiones que la competencia tecnológica no está determinada únicamente por el hardware. La innovación en modelos, los escenarios de aplicación, la capacidad de comercialización y la eficiencia de ingeniería también pueden generar nuevos avances.

Pero si se observa desde la perspectiva de la infraestructura, el hecho de que GPT-6 Astra utilice 100.000 GPU Blackwell revela efectivamente un cambio en curso: el campo de batalla central de la competencia global de IA se está desplazando aún más desde el nivel de los modelos hacia la infraestructura de cómputo.

En los próximos años, lo que determinará la competitividad de las empresas de IA no será solo la capacidad de entrenar un modelo excelente, sino la capacidad de establecer un proceso continuo de entrenamiento para los modelos de la próxima generación.

Para la industria china de la inteligencia artificial, lo que realmente necesita alcanzar no es un solo modelo o un solo lanzamiento, sino todo un conjunto de capacidades sistémicas que van desde la adquisición de chips, la construcción de centros de datos, la programación de clústeres hasta el ecosistema de software.

El significado de 100.000 Blackwell no radica en que genere un número impresionante, sino en que recuerda al mercado: la inteligencia artificial está entrando en la fase industrial, y la competencia industrial finalmente se decide por la infraestructura.

Fuente de referencia:

  1. Official NVIDIA materials on Blackwell, GB200 NVL72, Vera Rubin architecture, and AI infrastructure.
  2. Información sobre la conferencia pública y las entrevistas con los medios de Huang Renxun.
  3. Reportes de Bloomberg sobre la adquisición de capacidad de cómputo de Kimi y relacionados con H200.
  4. Información revelada públicamente por ByteDance sobre la infraestructura de IA y la implementación de capacidad de cómputo en el extranjero.
  5. Transcripciones relacionadas con la información pública de DeepSeek y la reunión de intercambio con inversores de Liang Wenhong.
  6. Información pública de Alibaba Cloud sobre la infraestructura de IA y la colaboración en capacidad de cómputo para modelos grandes.
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.