Se informa que ByteDance se prepara para preentrenar un modelo de IA con aproximadamente 10 billones de parámetros, una escala que superaría a todos los sistemas de IA chinos conocidos y colocaría a la empresa en competencia directa con los laboratorios occidentales más avanzados. Este esfuerzo requeriría aproximadamente 30,000 GPUs y entre 3 y 6 meses de preentrenamiento continuo.
Para poner en perspectiva 10 billones de parámetros, esto es más del triple del tamaño de Kimi K3 de Moonshot AI, que tiene 2.8 billones de parámetros y actualmente se encuentra entre los modelos más grandes producidos en China. Los parámetros son esencialmente los controles que un modelo de IA ajusta durante el entrenamiento para aprender patrones en los datos.
Lo que realmente está construyendo ByteDance
El modelo en cuestión utiliza una arquitectura Mixture of Experts (MoE). En lugar de activar todos los parámetros para cada consulta, los modelos MoE redirigen cada entrada a un subconjunto de subredes especializadas llamadas "expertos". Esto los hace mucho más eficientes durante la inferencia que un modelo denso del mismo tamaño total.
El equipo de Seed AI de ByteDance, que según se informa consta de alrededor de 2,000 empleados, lidera el esfuerzo. El equipo tiene experiencia previa en la escalación de entrenamientos, habiendo entrenado previamente modelos de hasta 175 mil millones de parámetros utilizando aproximadamente 12,000 GPUs. ByteDance ha publicado investigaciones sobre su infraestructura MegaScale, diseñada para gestionar sistemas de entrenamiento distribuido que superan las 10,000 GPUs.
La fase de preentrenamiento es solo el primer paso. Después de la ejecución inicial, el modelo pasaría por un ajuste fino antes de cualquier posible lanzamiento público. Se ha informado que el fundador de ByteDance, Zhang Yiming, ha dirigido al equipo de Seed AI a centrarse en auténticos avances tecnológicos en lugar de depender de la distilación de sistemas de IA occidentales.
Por qué ByteDance cree que puede lograrlo
ByteDance tiene algunas ventajas estructurales que hacen que esto sea más que un simple proyecto de vanidad. La empresa opera TikTok, que sirve a más de mil millones de usuarios en todo el mundo, y Doubao, uno de los asistentes de IA más utilizados en China. Esa presencia de consumidores genera un volumen enorme de datos de interacción que pueden informar tanto las decisiones de entrenamiento como de ajuste fino.
El elefante en la sala, por supuesto, son las restricciones de exportación de EE. UU. sobre chips de IA avanzada. Washington ha reforzado progresivamente los controles sobre la venta de GPUs de alta gama de Nvidia y otros aceleradores a entidades chinas. ByteDance no ha detallado públicamente qué modelos específicos de GPU planea utilizar para este entrenamiento, pero la capacidad de la empresa para reunir 30.000 de ellas sugiere que ha encontrado un camino viable para sortear las restricciones.
El panorama competitivo que reconfigura
ByteDance no es el único laboratorio chino de IA con grandes ambiciones. El equipo Qwen de Alibaba, Baidu y startups como DeepSeek y Moonshot AI han estado empujando los límites de la escala de los modelos. Pero un modelo de 10 billones de parámetros representaría un salto significativo más allá de lo que cualquiera de ellos ha anunciado o implementado públicamente.
El objetivo también coloca a ByteDance en la conversación con los laboratorios de la frontera occidental. Los últimos sistemas de Anthropic, el estándar competitivo que se informa que ByteDance busca igualar, representan el límite actual de la capacidad de IA conocida públicamente.
La ventana de preentrenamiento de 3 a 6 meses significa que los resultados o complicaciones podrían comenzar a surgir antes del final de 2026.
