Mensahe ni ChainThink, Agosto 8, ayon sa impormasyon ng open-source project ng developer na kimi-k3-in-c, may developer na sinubukan na panaig ang Kimi K3 na may 2.78 trilyong parameter sa isang device na may 8GB lamang ng memorya.
Ang projekto ay may sukat na halos 176KB, isinulat sa pure C99, at hindi nakadepende sa GPU, CUDA, PyTorch o BLAS; maaari itong gawin ang model inference sa pamamagitan ng CPU.
Ginagamit nito ang MoE architecture ng Kimi K3, kung saan ang bawat layer ay nagpapagana ng 16 sa 896 na mga eksperto, kaya hindi kailangang i-load ang buong 1.56TB na weights ng model sa memorya; sa halip, ang karamihan sa weights ng mga eksperto ay naka-store sa NVMe hard drive at binabasa sa real-time batay sa pangangailangan ng inference.
Kasalukuyang may malinaw na limitasyon sa performance ang solusyon na ito: sa mode na 8GB na memorya, kailangan ng humigit-kumulang 32.7 segundo para makagawa ng isang token, at kailangan ng malapit sa 1.7TB na espasyo sa mabilis na storage.
Sinabi ng mga developer na mas malapit ang scheme sa eksperimentong pag-aaral tungkol sa pag-optimize ng infrastruktura para sa inference ng malalaking modelo at hindi pa may halagang gamitin sa produksyon.
