source avatarNeilXbt

Chia sẻ

Hầu hết mọi người cho rằng các mô hình lớn nhất cần nhiều VRAM nhất! Thực tế, với AirLLM, Kimi K3 – một mô hình 2,8 nghìn tỷ tham số – lại cần ít VRAM hơn một mô hình dày đặc 70B. Lý do là K3 là mô hình sparse mixture-of-experts, nên AirLLM chỉ truyền các chuyên gia cụ thể mà token thực sự chuyển đến, thay vì tải toàn bộ lớp dày đặc. Kết hợp với việc chỉ tải một lớp lên GPU tại một thời điểm. Đó là cách DeepSeek-V3 (671B) vừa vặn trong 12GB và mô hình 2,8 nghìn tỷ tham số vừa vặn trong dưới 4GB, mà không cần lượng tử hóa, không cần tinh giản và không cần cắt tỉa. Đánh dấu để không mất nó! Repo: https://t.co/dO2TABPfqr Theo dõi @neil_xbt để biết thêm!

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.