ByteDance planea un modelo de IA de 10 billones de parámetros utilizando 30,000 GPUs

iconCryptoBriefing
Compartir
AI summary iconResumen
ByteDance está realizando el preentrenamiento de un modelo de IA de 10 billones de parámetros utilizando aproximadamente 30,000 GPUs, superando los sistemas de IA chinos existentes. El equipo Seed AI, que anteriormente desarrolló un modelo de 175 mil millones de parámetros, está utilizando una arquitectura Mixture of Experts (MoE). El preentrenamiento tomará de 3 a 6 meses, seguido por el ajuste fino. Mientras tanto, BTC continúa actuando como cobertura contra la inflación ante los cambios macroeconómicos globales. Las regulaciones CFT también están ganando impulso en los sectores de desarrollo de IA.

Se informa que ByteDance se prepara para preentrenar un modelo de IA con aproximadamente 10 billones de parámetros, una escala que superaría a todos los sistemas de IA chinos conocidos y colocaría a la empresa en competencia directa con los laboratorios occidentales más avanzados. Este esfuerzo requeriría aproximadamente 30,000 GPUs y entre 3 y 6 meses de preentrenamiento continuo.

Para poner en perspectiva 10 billones de parámetros, esto es más del triple del tamaño de Kimi K3 de Moonshot AI, que tiene 2.8 billones de parámetros y actualmente se encuentra entre los modelos más grandes producidos en China. Los parámetros son esencialmente los controles que un modelo de IA ajusta durante el entrenamiento para aprender patrones en los datos.

Lo que realmente está construyendo ByteDance

El modelo en cuestión utiliza una arquitectura Mixture of Experts (MoE). En lugar de activar todos los parámetros para cada consulta, los modelos MoE redirigen cada entrada a un subconjunto de subredes especializadas llamadas "expertos". Esto los hace mucho más eficientes durante la inferencia que un modelo denso del mismo tamaño total.

Anuncio

El equipo de Seed AI de ByteDance, que según se informa consta de alrededor de 2,000 empleados, lidera el esfuerzo. El equipo tiene experiencia previa en la escalación de entrenamientos, habiendo entrenado previamente modelos de hasta 175 mil millones de parámetros utilizando aproximadamente 12,000 GPUs. ByteDance ha publicado investigaciones sobre su infraestructura MegaScale, diseñada para gestionar sistemas de entrenamiento distribuido que superan las 10,000 GPUs.

La fase de preentrenamiento es solo el primer paso. Después de la ejecución inicial, el modelo pasaría por un ajuste fino antes de cualquier posible lanzamiento público. Se ha informado que el fundador de ByteDance, Zhang Yiming, ha dirigido al equipo de Seed AI a centrarse en auténticos avances tecnológicos en lugar de depender de la distilación de sistemas de IA occidentales.

Por qué ByteDance cree que puede lograrlo

ByteDance tiene algunas ventajas estructurales que hacen que esto sea más que un simple proyecto de vanidad. La empresa opera TikTok, que sirve a más de mil millones de usuarios en todo el mundo, y Doubao, uno de los asistentes de IA más utilizados en China. Esa presencia de consumidores genera un volumen enorme de datos de interacción que pueden informar tanto las decisiones de entrenamiento como de ajuste fino.

El elefante en la sala, por supuesto, son las restricciones de exportación de EE. UU. sobre chips de IA avanzada. Washington ha reforzado progresivamente los controles sobre la venta de GPUs de alta gama de Nvidia y otros aceleradores a entidades chinas. ByteDance no ha detallado públicamente qué modelos específicos de GPU planea utilizar para este entrenamiento, pero la capacidad de la empresa para reunir 30.000 de ellas sugiere que ha encontrado un camino viable para sortear las restricciones.

El panorama competitivo que reconfigura

ByteDance no es el único laboratorio chino de IA con grandes ambiciones. El equipo Qwen de Alibaba, Baidu y startups como DeepSeek y Moonshot AI han estado empujando los límites de la escala de los modelos. Pero un modelo de 10 billones de parámetros representaría un salto significativo más allá de lo que cualquiera de ellos ha anunciado o implementado públicamente.

El objetivo también coloca a ByteDance en la conversación con los laboratorios de la frontera occidental. Los últimos sistemas de Anthropic, el estándar competitivo que se informa que ByteDance busca igualar, representan el límite actual de la capacidad de IA conocida públicamente.

La ventana de preentrenamiento de 3 a 6 meses significa que los resultados o complicaciones podrían comenzar a surgir antes del final de 2026.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.