رسالة ChainThink، 8 أغسطس، وفقًا للمعلومات من مشروع مفتوح المصدر للمطورين kimi-k3-in-c، حاول مطور تشغيل نموذج Kimi K3 بـ 2.78 تريليون معلمة على جهاز بذاكرة 8 جيجابايت فقط.
يبلغ حجم هذا المشروع حوالي 176 كيلوبايت، وهو مكتوب بلغة C99 النقية، ولا يعتمد على GPU أو CUDA أو PyTorch أو BLAS، ويمكنه إجراء استنتاج النموذج عبر وحدة المعالجة المركزية.
يُستخدم في تنفيذه هيكل MoE الخاص بـ Kimi K3، حيث يتم تفعيل 16 خبيرًا فقط من بين 896 خبيرًا في كل طبقة، وبالتالي لا يلزم تحميل أوزان النموذج الكامل البالغة حوالي 1.56 تيرابايت في الذاكرة، بل يتم تخزين أوزان معظم الخبراء على أقراص NVMe وقراءتها في الوقت الفعلي حسب متطلبات الاستنتاج.
لا يزال هناك قيود أداء واضحة في هذا الحل حاليًا: في وضع ذاكرة 8 جيجابايت، يستغرق توليد رمز واحد حوالي 32.7 ثانية، ويتطلب مساحة تخزين عالية السرعة تقارب 1.7 تيرابايت.
يُشير المطورون إلى أن هذا الحل يقترب أكثر من تجربة استكشافية في اتجاه تحسين بنية تحتية الاستدلال للنماذج الكبيرة، ولا يمتلك قيمة استخدام إنتاجية بعد.
