Большинство считают, что самые крупные модели требуют больше всего VRAM! На самом деле, с AirLLM модель Kimi K3 с 2,8 триллиона параметров требует меньше VRAM, чем плотная модель с 70 млрд параметров. Причина в том, что K3 — это разреженная модель со смесью экспертов, поэтому AirLLM потоково загружает только тех экспертов, которым действительно назначается токен, а не всю плотную слойную структуру. В сочетании с загрузкой только одного слоя на GPU за раз. Именно поэтому DeepSeek-V3 (671 млрд) помещается в 12 ГБ, а модель с 2,8 триллиона параметров — менее чем в 4 ГБ, без квантования, дистилляции и обрезки. Сохраните, чтобы не потерять! Репозиторий: https://t.co/dO2TABPfqr Подписывайтесь на @neil_xbt для большего!
NeilXbtПоделиться
Источник:Показать оригинал
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации.
Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.