A maioria das pessoas assume que os modelos maiores precisam de mais VRAM! Na verdade, com o AirLLM, o Kimi K3, um modelo de 2,8 trilhões de parâmetros, precisa de menos VRAM do que um modelo denso de 70B. A razão é que K3 é um modelo esparsa de mistura de especialistas, então o AirLLM transmite apenas os especialistas específicos para os quais um token é roteado, em vez de carregar uma camada densa completa. Combinado com o carregamento de apenas uma camada na GPU por vez. É assim que o DeepSeek-V3 (671B) cabe em 12GB e um modelo de 2,8 trilhões de parâmetros cabe em menos de 4GB, sem quantização, sem distilação e sem poda envolvidas. Salve para não perder! Repositório: https://t.co/dO2TABPfqr Siga @neil_xbt para mais!
NeilXbtCompartilhar
Fonte:Mostrar original
Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações.
Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.