source avatarNeilXbt

共有

ほとんどの人は、最も大きなモデルほどVRAMを最も多く必要とすると考えています! 実際、AirLLMを使用すると、2.8兆パラメータのKimi K3は、70Bの密なモデルよりも少ないVRAMで動作します。 その理由は、K3がスパースなエキスパート混合モデルであるため、AirLLMはトークンが実際にルーティングされる特定のエキスパートのみをストリーミングし、フルの密なレイヤーを読み込む必要がないからです。 さらに、GPUには一度に1層のみを読み込むことで実現しています。 これにより、量子化・蒸留・プリニングを一切使用せずに、DeepSeek-V3(671B)が12GBで、2.8兆パラメータのモデルが4GB未満で動作します。 後で見失わないようにブックマークしてください! リポジトリ:https://t.co/dO2TABPfqr さらに詳しくは@neil_xbtをフォローしてください!

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。