バイトダンスは、約10兆パラメーターのAIモデルを事前学習する準備を進めていると報じられている。この規模は、中国の既存のすべてのAIシステムを上回り、同社を最先端の西洋の研究機関と直接競合させるものとなる。この取り組みには約30,000個のGPUと、継続的に3〜6ヶ月の事前学習が必要と推定されている。
10兆パラメーターという規模を理解するため、Moonshot AIのKimi K3(2.8兆パラメーター)と比較すると、それは3倍以上に相当します。Kimi K3は現在、中国で開発された最大規模のモデルの一つにランクされています。パラメーターとは、AIモデルが学習中にデータのパターンを学ぶために調整する「調整钮」に相当します。
バイトダンスが実際に構築しているもの
対象のモデルは、Mixture of Experts(MoE)アーキテクチャを使用しています。MoEモデルは、すべてのパラメータをすべてのクエリに対して活性化するのではなく、各入力を特定の「エキスパート」サブネットワークのサブセットにルーティングします。これにより、同じ総サイズのディープモデルと比較して、推論時の実行効率が大幅に向上します。
約2,000人のスタッフで構成されるビットダンスのSeed AIチームがこの取り組みを主導している。同チームは、過去に約12,000台のGPUを使用して1750億パラメータまでのモデルを訓練する経験を持っている。ビットダンスは、10,000台以上のGPUを管理するために設計されたMegaScaleインフラストラクチャに関する研究を公開している。
事前学習段階は最初のステップにすぎません。初期実行後、モデルは公開リリース前に微調整が行われます。バイトダンスの創設者である張一鳴は、西側のAIシステムからの蒸留に頼るのではなく、真の技術的ブレークスルーにSeed AIチームの焦点を当てるよう指示したと報告されています。
なぜバイトダンスがこれを実現できると考えているのか
バイテンドは、単なる見栄えのためのプロジェクト以上のものを実現するためのいくつかの構造的優位性を有しています。同社は、世界で10億人以上のユーザーに利用されているTikTokと、中国で最も広く使われているAIアシスタントの一つであるDoubaoを運営しています。この消費者層の広がりは、トレーニングおよび微調整の意思決定に役立つ膨大なインタラクションデータを生み出します。
もちろん、部屋の象は、先進的なAIチップに対する米国の輸出制限である。ワシントンは、高級なNvidia GPUおよびその他のアクセラレータを中国の企業に販売することに対する規制を段階的に強化してきた。バイトダンスは、このトレーニングに使用する具体的なGPUモデルについて公に詳細を明らかにしていないが、同社が3万個ものGPUを確保できたことから、この制限を乗り越える実行可能な道を見出していることが示唆される。
これによって再構築される競合環境
バイテンドンは、大きな野心を抱える中国のAIラボではない。アリババのQwenチーム、百度、そしてDeepSeekやMoonshot AIなどのスタートアップも、モデルの規模の限界を押し広げてきた。しかし、10兆パラメータのモデルは、これらすべての企業が公に発表または導入したものをはるかに上回る飛躍を意味する。
ターゲットは、バイトダンスを西方フロンティアラボと対話に巻き込んでいる。アンソロピックの最新システム、バイトダンスが対抗しようとしている競合ベンチマークは、現在公に知られているAI能力の上限を表している。
3〜6か月の事前トレーニング期間により、結果や課題は2026年末までに現れ始める可能性があります。
