ChainThink повідомляє, 8 серпня, згідно з інформацією з відкритого проекту розробника kimi-k3-in-c, розробник спробував запустити модель Kimi K3 з 2,78 трильйона параметрів на пристрої з лише 8 ГБ пам’яті.
Розмір проекту становить приблизно 176 КБ, він написаний чистим C99 і не залежить від GPU, CUDA, PyTorch або BLAS; висновок моделі може виконуватися за допомогою CPU.
Його реалізація використовує архітектуру MoE Kimi K3, у якій на кожному рівні активується лише 16 експертів із 896, тому не потрібно завантажувати повні ваги моделі обсягом приблизно 1,56 ТБ у пам’ять — замість цього більшість ваг експертів зберігаються на NVMe-диску і читаються в реальному часі згідно з вимогами висновку.
Наразі ця схема має значні обмеження продуктивності: у режимі 8 ГБ оперативної пам’яті генерація одного токена займає приблизно 32,7 секунди, а також вимагає майже 1,7 ТБ швидкодіючого сховища.
Розробники зазначили, що цей план є експериментальним дослідженням у напрямку оптимізації інфраструктури висновку великих моделей і не має практичної цінності для виробництва.
