source avatarNeilXbt

I-share

Ang karamihan sa mga tao ay naniniwala na ang pinakamalalaking model ay kailangan ng pinakamaraming VRAM! Sa katotohanan, gamit ang AirLLM, ang Kimi K3, isang model na may 2.8 trilyong parameter, ay kailangan ng mas kaunting VRAM kaysa sa isang 70B dense model. Ang dahilan ay ang K3 ay isang sparse mixture-of-experts model, kaya ang AirLLM ay stream lamang ang mga espesipikong expert na tinatawag ng isang token, sa halip na i-load ang buong dense layer. Kasama na rito ang pag-load lamang ng isang layer sa GPU nang isang oras. Dito nagkakaroon ng puwang ang DeepSeek-V3 (671B) sa 12GB, at ang isang 2.8 trilyong parameter model ay nasisilid sa mas kaunti sa 4GB, nang walang quantization, distillation, o pruning. I-bookmark ito para hindi mo kalimutan! Repo: https://t.co/dO2TABPfqr Sundin si @neil_xbt para sa higit pa!

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.