La mayoría de las personas asumen que los modelos más grandes necesitan más VRAM. En realidad, con AirLLM, Kimi K3, un modelo de 2.8 billones de parámetros, necesita menos VRAM que un modelo denso de 70B. La razón es que K3 es un modelo disperso de mezcla de expertos, por lo que AirLLM transmite solo los expertos específicos a los que un token se dirige, en lugar de cargar una capa densa completa. Combinado con la carga de solo una capa en la GPU a la vez. Así es como DeepSeek-V3 (671B) cabe en 12 GB y un modelo de 2.8 billones de parámetros cabe en menos de 4 GB, sin cuantización, sin distilación y sin poda involucradas. Guarda este enlace para no perderlo. Repositorio: https://t.co/dO2TABPfqr Sigue a @neil_xbt para más.
NeilXbtCompartir
Fuente:Mostrar original
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información.
Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.