ChainThink сообщение, 8 августа, согласно информации из открытого проекта разработчика kimi-k3-in-c, разработчик попытался запустить модель Kimi K3 с 2,78 триллиона параметров на устройстве с всего 8 ГБ памяти.
Размер проекта составляет около 176 КБ, написан на чистом C99, не зависит от GPU, CUDA, PyTorch или BLAS, и может выполнять вывод модели с помощью CPU.
Он использует архитектуру MoE Kimi K3, при которой на каждом слое активируются только 16 экспертов из 896, поэтому не требуется загружать в память полные веса модели объемом около 1,56 ТБ; вместо этого большая часть весов экспертов хранится на NVMe-диске и считывается в реальном времени по мере необходимости при выводе.
В настоящее время у этой схемы остаются значительные ограничения по производительности: в режиме с 8 ГБ оперативной памяти генерация одного токена занимает около 32,7 секунды и требует почти 1,7 ТБ быстродействующего хранилища.
Разработчики отметили, что этот подход представляет собой экспериментальное исследование в направлении оптимизации инфраструктуры для вывода больших моделей и пока не имеет практической применимости.
