A ByteDance está supostamente se preparando para pré-treinar um modelo de IA com cerca de 10 trilhões de parâmetros, uma escala que superaria todos os sistemas de IA chineses conhecidos e colocaria a empresa em competição direta com os laboratórios ocidentais mais avançados. O esforço exigiria aproximadamente 30.000 GPUs e uma estimativa de 3 a 6 meses de pré-treinamento contínuo.
Para colocar 10 trilhões de parâmetros em perspectiva, isso é mais de três vezes o tamanho do Kimi K3 da Moonshot AI, que possui 2,8 trilhões de parâmetros e atualmente está entre os maiores modelos produzidos na China. Parâmetros são essencialmente os controles que um modelo de IA ajusta durante o treinamento para aprender padrões nos dados.
O que a ByteDance está realmente construindo
O modelo em questão utiliza uma arquitetura Mixture of Experts (MoE). Em vez de ativar todos os parâmetros para cada consulta, os modelos MoE encaminham cada entrada para um subconjunto de sub-redes especializadas chamadas “especialistas”. Isso os torna muito mais eficientes para execução durante a inferência do que um modelo denso do mesmo tamanho total.
A equipe de Seed AI da ByteDance, que supostamente possui cerca de 2.000 funcionários, está liderando o esforço. A equipe possui experiência anterior em escalar execuções de treinamento, tendo anteriormente treinado modelos com até 175 bilhões de parâmetros usando aproximadamente 12.000 GPUs. A ByteDance publicou pesquisas sobre sua infraestrutura MegaScale, projetada para gerenciar sistemas de treinamento distribuído superiores a 10.000 GPUs.
A fase de pré-treinamento é apenas o primeiro passo. Após a execução inicial, o modelo passaria por um ajuste fino antes de qualquer possível lançamento público. O fundador da ByteDance, Zhang Yiming, supostamente orientou a equipe Seed AI a se concentrar em verdadeiras inovações tecnológicas, em vez de depender da distilação de sistemas de IA ocidentais.
Por que a ByteDance acha que consegue realizar isso
O ByteDance possui algumas vantagens estruturais que tornam isso mais do que apenas um projeto de vaidade. A empresa opera o TikTok, que atende mais de um bilhão de usuários globalmente, e o Doubao, um dos assistentes de IA mais amplamente utilizados na China. Essa presença de consumidores gera um volume imenso de dados de interação que podem informar decisões de treinamento e ajuste fino.
O elefante na sala, claro, são as restrições de exportação dos EUA sobre chips avançados de IA. Washington tem apertado progressivamente os controles sobre a venda de GPUs de alto desempenho da Nvidia e outros aceleradores para entidades chinesas. O ByteDance não detalhou publicamente quais modelos específicos de GPU planeja usar para esta rodada de treinamento, mas a capacidade da empresa de reunir 30.000 delas sugere que encontrou um caminho viável contornando as restrições.
O cenário competitivo que isso reconfigura
A ByteDance não é o único laboratório chinês de IA com grandes ambições. A equipe Qwen da Alibaba, o Baidu e startups como DeepSeek e Moonshot AI também têm impulsionado os limites da escala dos modelos. Mas um modelo de 10 trilhões de parâmetros representaria um salto significativo além do que qualquer um deles anunciou ou implementou publicamente.
O alvo também coloca a ByteDance na conversa com os laboratórios da fronteira ocidental. Os últimos sistemas da Anthropic, o benchmark competitivo que a ByteDance supostamente busca igualar, representam o limite atual da capacidade de IA publicamente conhecida.
A janela de pré-treinamento de 3 a 6 meses significa que resultados ou complicações podem começar a surgir antes do final de 2026.
