يُذكر أن ByteDance تستعد لتدريب مسبق لنموذج ذكاء اصطناعي يحتوي على حوالي 10 تريليون معلمة، وهو حجم يفوق جميع أنظمة الذكاء الاصطناعي الصينية المعروفة ويدخل الشركة في منافسة مباشرة مع أكثر المختبرات الغربية تقدمًا. وسيتطلب هذا الجهد حوالي 30,000 وحدة معالجة رسومية وفترة تدريب مسبق مستمرة تقدر بـ 3 إلى 6 أشهر.
لوضع 10 تريليون معلمة في السياق، فهي أكثر من ثلاثة أضعاف حجم نموذج Moonshot AI Kimi K3 الذي يبلغ 2.8 تريليون معلمة، وهو حاليًا من بين أكبر النماذج المُنتجة في الصين. المعلمات هي في جوهرها العوامل التي يضبطها نموذج الذكاء الاصطناعي أثناء التدريب لتعلم الأنماط في البيانات.
ما الذي يبنيه ByteDance فعليًا
النموذج المذكور يستخدم بنية مزيج من الخبراء (MoE). بدلاً من تفعيل كل المعلمات لكل استعلام، تقوم نماذج MoE بتوجيه كل مدخل إلى مجموعة فرعية من الشبكات الفرعية المتخصصة "الخبراء". وهذا يجعلها أكثر كفاءة بكثير أثناء وقت الاستنتاج مقارنة بنموذج كثيف بنفس الحجم الإجمالي.
فريق Seed AI التابع لـ ByteDance، والذي يُقال إنه يضم حوالي 2000 موظف، يقود هذا الجهد. يتمتع الفريق بخبرة سابقة في توسيع عمليات التدريب، حيث سبق له تدريب نماذج تصل إلى 175 مليار معلمة باستخدام حوالي 12,000 وحدة معالجة رسومية (GPU). نشرت ByteDance أبحاثًا حول بنية MegaScale الخاصة بها، والتي تم تصميمها لإدارة أنظمة التدريب الموزعة التي تتجاوز 10,000 وحدة معالجة رسومية (GPU).
مرحلة التدريب المسبق هي مجرد الخطوة الأولى. بعد التشغيل الأولي، سيخضع النموذج للضبط الدقيق قبل أي إصدار عام محتمل. ووفقًا للتقارير، أصدر مؤسس بايت دانس زhang ييمينغ تعليمات لفريق Seed AI بالتركيز على إنجازات تكنولوجية حقيقية بدلاً من الاعتماد على التقطيع من أنظمة الذكاء الاصطناعي الغربية.
لماذا تعتقد بايت دانس أنها تستطيع تحقيق هذا
تمتلك ByteDance بعض الميزات الهيكلية التي تجعل هذا المشروع أكثر من مجرد مشروع للزينة. تعمل الشركة على TikTok، الذي يخدم أكثر من مليار مستخدم عالميًا، وDoubao، أحد أكثر المساعدين الذكاء الاصطناعي استخدامًا في الصين. هذا الحضور الاستهلاكي يولد حجمًا هائلاً من بيانات التفاعل التي يمكن أن توجه قرارات التدريب والضبط الدقيق.
الفيّل في الغرفة، بالطبع، هو القيود الأمريكية على تصدير رقائق الذكاء الاصطناعي المتقدمة. لقد شدّدت واشنطن تدريجيًا الضوابط على بيع وحدات معالجة الرسومات (GPUs) عالية الأداء من Nvidia ووحدات تسريع أخرى للكيانات الصينية. لم تفصح ByteDance علنًا عن النماذج المحددة لوحدات معالجة الرسومات التي تخطط لاستخدامها في هذه الدورة التدريبية، لكن قدرة الشركة على تجميع 30,000 منها تشير إلى أنها وجدت طريقًا قابلاً للتطبيق للتجاوز من خلال القيود.
مشهد المنافسة الذي يعيد تشكيله
لا تُعد ByteDance المختبر الصيني للذكاء الاصطناعي الوحيد ذو الطموحات الكبيرة. فقد كان فريق Qwen من Alibaba، وBaidu، وشركات ناشئة مثل DeepSeek وMoonshot AI جميعها تدفع حدود حجم النماذج. لكن نموذجًا بحجم 10 تريليون معلمة سيكون قفزة كبيرة جدًا مقارنة بما أعلنته أو نشرته أي من هذه الجهات علنًا.
كما يضع الهدف ByteDance في المحادثة مع مختبرات الحدود الغربية. تمثل أنظمة Anthropic الأحدث، والتي يُزعم أن ByteDance تسعى للوصول إلى مستواها كمعيار تنافسي، السقف الحالي لقدرات الذكاء الاصطناعي المعروفة علنًا.
تعني فترة التدريب المسبقة من 3 إلى 6 أشهر أن النتائج أو المضاعفات قد تبدأ بالظهور قبل نهاية عام 2026.
