Більшість людей вважають, що найбільші моделі потребують найбільше VRAM! Насправді, з AirLLM, Kimi K3 — модель з 2,8 трильйона параметрів — потребує менше VRAM, ніж щільна модель з 70 млрд параметрів. Причина в тому, що K3 — це розріджена модель з сумішшю експертів, тому AirLLM потоково передає лише тих експертів, до яких фактично маршрутизуються токени, замість завантаження повної щільної шари. У поєднанні з завантаженням лише одного шару на GPU за раз. Ось чому DeepSeek-V3 (671 млрд) поміщається в 12 ГБ, а модель з 2,8 трильйона параметрів — менше ніж в 4 ГБ, без квантування, дистиляції чи вирізання. Збережіть це, щоб не втратити! Репозиторій: https://t.co/dO2TABPfqr Підпишіться на @neil_xbt для більшого!
NeilXbtПоділитися
Джерело:Показати оригінал
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації.
Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.