ByteDance prévoit un modèle IA de 10 billions de paramètres en utilisant 30 000 GPU

iconCryptoBriefing
Partager
AI summary iconRésumé
ByteDance pré-entraîne un modèle IA de 10 billions de paramètres en utilisant environ 30 000 GPU, dépassant les systèmes IA chinois existants. L'équipe Seed AI, qui a précédemment développé un modèle de 175 milliards de paramètres, utilise une architecture Mixture of Experts (MoE). Le pré-entraînement prendra entre 3 et 6 mois, suivi d'un affinage. Pendant ce temps, le BTC continue de servir de couverture contre l'inflation face aux changements macroéconomiques mondiaux. Les réglementations CFT gagnent également du terrain dans les secteurs du développement de l'IA.

ByteDance préparerait à pré-entraîner un modèle d'IA comportant environ 10 billions de paramètres, une échelle qui dépasserait tous les systèmes d'IA chinois connus et placerait l'entreprise en concurrence directe avec les laboratoires occidentaux les plus avancés. Cet effort nécessiterait environ 30 000 GPU et une période estimée de 3 à 6 mois de pré-entraînement continu.

Pour donner une idée de 10 billions de paramètres, cela représente plus de trois fois la taille de Kimi K3 de Moonshot AI, qui compte 2,8 billions de paramètres et figure actuellement parmi les plus grands modèles développés en Chine. Les paramètres sont essentiellement les réglages qu’un modèle d’IA ajuste pendant l’entraînement pour apprendre les motifs dans les données.

Ce que ByteDance construit réellement

Le modèle en question utilise une architecture Mixture of Experts (MoE). Plutôt que d'activer tous les paramètres pour chaque requête, les modèles MoE acheminent chaque entrée vers un sous-ensemble de sous-réseaux spécialisés appelés « experts ». Cela les rend beaucoup plus efficaces à l'exécution lors de l'inférence qu'un modèle dense de taille totale équivalente.

Publicité

L'équipe Seed AI de ByteDance, qui compterait environ 2 000 employés, mène cet effort. L'équipe possède une expérience antérieure dans l'extension des sessions d'entraînement, ayant précédemment formé des modèles jusqu'à 175 milliards de paramètres en utilisant environ 12 000 GPU. ByteDance a publié des recherches sur son infrastructure MegaScale, conçue pour gérer des systèmes d'entraînement distribué dépassant 10 000 GPU.

La phase de pré-entraînement n'est qu'une première étape. Après le premier lancement, le modèle subirait un raffinage avant toute éventuelle diffusion publique. Le fondateur de ByteDance, Zhang Yiming, aurait demandé à l'équipe Seed AI de se concentrer sur de véritables percées technologiques plutôt que de s'appuyer sur la distillation des systèmes d'intelligence artificielle occidentaux.

Pourquoi ByteDance pense pouvoir y parvenir

ByteDance dispose de quelques avantages structurels qui font de ce projet bien plus qu'une simple affaire de prestige. L'entreprise exploite TikTok, qui compte plus d'un milliard d'utilisateurs dans le monde, et Doubao, l'un des assistants IA les plus utilisés en Chine. Cette présence auprès des consommateurs génère un volume énorme de données d'interaction pouvant éclairer les décisions d'entraînement et de raffinage.

L’éléphant dans la pièce, bien sûr, ce sont les restrictions d’exportation américaines sur les puces d’intelligence artificielle avancées. Washington a progressivement renforcé les contrôles sur la vente de GPU Nvidia haut de gamme et d’autres accélérateurs aux entités chinoises. ByteDance n’a pas détaillé publiquement quels modèles de GPU précis elle prévoit d’utiliser pour cette session d’entraînement, mais la capacité de l’entreprise à mobiliser 30 000 de ces puces suggère qu’elle a trouvé un chemin viable pour contourner ces restrictions.

Le paysage concurrentiel que cela redéfinit

ByteDance n'est pas le seul laboratoire chinois d'IA avec de grandes ambitions. L'équipe Qwen d'Alibaba, Baidu et des startups comme DeepSeek et Moonshot AI ont toutes poussé les limites de l'échelle des modèles. Mais un modèle de 10 billions de paramètres représenterait un saut significatif au-delà de ce que l'un d'entre eux a publiquement annoncé ou déployé.

La cible place également ByteDance dans la conversation avec les laboratoires de la frontière occidentale. Les derniers systèmes d'Anthropic, que ByteDance viserait à égaler selon les rapports, représentent le plafond actuel des capacités d'IA publiquement connues.

La fenêtre de pré-formation de 3 à 6 mois signifie que les résultats ou complications pourraient commencer à apparaître avant la fin de 2026.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.