Inilabas ng developer ang open-source na C engine upang panaig ang 2.78T-param na Kimi K3 sa 8GB RAM

icon MarsBit
I-share
AI summary iconSummary
Isinilid ng isang developer ang isang project announcement na may pamagat na kimi-k3-in-c, na nagpapagana sa Kimi K3 model na may 2.78 trilyong parameter sa 8GB RAM. Ang 176KB C99 project ay gumagamit ng CPU-only inference, na nagpapagana ng 16 sa 896 na experts bawat layer. Ito ay naglo-load ng weights mula sa NVMe storage ayon sa pangangailangan, ngunit nangangailangan ng 32.7 segundo bawat token at 1.7TB ng mabilis na storage. Tawag ng developer sa project na isang on-chain news-worthy experiment, hindi pa handa para sa production.

Ayon sa Mars Finance, noong Agosto 8, may developer na nag-open source ang proyektong kimi-k3-in-c na nagsubok na panaan ang Kimi K3 model na may 2.78 trilyong parameter sa isang device na may 8GB lamang ng memorya. Ang proyektong ito ay may laki lamang ng 176KB, isinulat sa puro C99, at hindi nakasalalay sa GPU, CUDA, PyTorch, o BLAS—nagaganap lamang ang model inference gamit ang CPU. Ang solusyong ito ay gumagamit ng mga katangian ng MoE (Mixture of Experts) arkitektura ng Kimi K3. Bagaman ang kabuuang sukat ng parameter ng model ay umabot sa 2.78T, ang bawat layer ay nagpapagana lamang ng 16 sa 896 na mga expert. Kaya hindi nila iniloload ang buong 1.56TB na weights ng model sa memorya; kundi iniiwasan nila ang karamihan sa mga weights ng expert sa NVMe hard drive at binabasa ito nang real-time batay sa pangangailangan ng inference. Samantala, ang ilang dense layers ay ginagamit naman ang stream-based loading per layer. Gayunpaman, mayroon pa ring malinaw na limitasyon sa performance ang solusyong ito. Sa mode na may 8GB memorya, kinakailangan ng model na 32.7 segundo upang makagawa ng isang token, at kailangan nito ng halos 1.7TB na high-speed storage space. Sinabi ng developer na ang solusyong ito ay mas isang eksperimento para sa direksyon ng pag-optimize ng infrastructure para sa model inference, at hindi pa may practical na value para sa production. Gayunpaman, ang paraan nito na “streaming load mula sa hard drive + sparse activation ng MoE” ay nagtataguyod ng isang bagong ideya para sa pagpapanaan ng sobrang malalaking models sa mababang gastos sa hinaharap.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.