DeepSeek ra mắt mô hình V4.1-Flash với 552 tỷ tham số và cửa sổ ngữ cảnh 1 triệu token

iconCryptoBriefing
Chia sẻ
AI summary iconTóm tắt
DeepSeek đã ra mắt một token mới vào ngày 10 tháng Chín với mô hình V4.1-Flash, có 552 tỷ tham số và cửa sổ ngữ cảnh 1 triệu token. Mô hình sử dụng kiến trúc MoE, kích hoạt 8 tỷ tham số cho đầu vào và 16 tỷ cho đầu ra. Nó bổ sung thiết kế Causal Encoder-Decoder bất đối xứng và giảm 75% việc sử dụng KV cache. Mô hình này vượt trội hơn DeepSeek V4-Pro và hiện đã có sẵn qua API với mức giá cập nhật từ ngày 14 tháng Chín. Trọng số đã được mở nguồn trên Hugging Face theo giấy phép MIT, mang đến tin tức mới về việc ra mắt token cho các nhà phát triển và nhà giao dịch.

DeepSeek vừa ra mắt một mô hình xử lý một triệu token ngữ cảnh trong khi kích hoạt ít tham số hơn một số mô hình mã nguồn mở được phát hành cách đây hai năm. V4.1-Flash, được ra mắt vào ngày 10 tháng Chín, đại diện cho nỗ lực mới nhất của công ty AI Trung Quốc nhằm thay đổi kinh tế học của các mô hình ngôn ngữ lớn.

Mô hình chứa 552 tỷ tham số trong kiến trúc Mixture-of-Experts (MoE), nhưng chỉ kích hoạt khoảng 8 tỷ tham số cho các tác vụ đầu vào và 16 tỷ cho đầu ra. Kết quả là một mô hình hoạt động vượt xa so với mức chi phí tính toán thực tế của nó.

Kiến trúc làm cho nó hoạt động

V4.1-Flash giới thiệu kiến trúc Mã hóa-Giải mã Nhân quả bất đối xứng mà DeepSeek gọi là, xử lý đầu vào và tạo đầu ra thông qua các con đường khác nhau được tối ưu hóa cho từng nhiệm vụ, thay vì chạy tất cả qua một đường ống duy nhất.

Quảng cáo

Cửa sổ ngữ cảnh được mở rộng lên 1 triệu token. Để hỗ trợ ngữ cảnh khổng lồ này là bộ nhớ đệm KV tiêu thụ khoảng 890 byte mỗi token, khoảng một phần tư so với yêu cầu của mô hình V4-Flash trước đó.

Việc giảm bộ nhớ đệm này quan trọng hơn những gì bạn có thể tưởng tượng. Bộ nhớ KV cache là điểm nghẽn bộ nhớ xác định số lượng người dùng đồng thời mà mô hình có thể phục vụ và thời gian kéo dài của các cuộc hội thoại. Việc giảm 75% nghĩa là các nhà vận hành có thể phục vụ khoảng bốn lần nhiều người dùng hơn trên cùng một phần cứng, hoặc xử lý các ngữ cảnh dài hơn bốn lần mà không cần nâng cấp cụm GPU của họ.

Trên các bài kiểm tra hiệu năng, DeepSeek tuyên bố V4.1-Flash vượt trội hơn mô hình V4-Pro của chính công ty và cạnh tranh trực tiếp với GPT-5.6 và Kimi K3. Công ty đã bắt đầu chuyển các yêu cầu từ V4-Pro sang mô hình mới, với mức giá cập nhật có hiệu lực từ ngày 14 tháng 9.

Mở trọng số, mở chiến lược

DeepSeek đã phát hành trọng số mô hình dưới giấy phép MIT trên Hugging Face. Mô hình mới có thể truy cập thông qua API của DeepSeek qua điểm cuối “deepseek-flash”. Sự kết hợp giữa trọng số mở và khả năng truy cập API tạo ra hai con đường triển khai: các nhà phát triển muốn chạy suy luận trên cơ sở hạ tầng riêng có thể tải về và triển khai tại chỗ, trong khi những người ưa chuộng dịch vụ được quản lý có thể gọi API theo các mức giá mới của DeepSeek.

Hệ quả của IPO và vị thế cạnh tranh

Thời điểm ra mắt V4.1-Flash không phải là ngẫu nhiên. DeepSeek dự kiến sẽ niêm yết trên Thị trường STAR của Thượng Hải, và việc thể hiện đà kỹ thuật liên tục là yếu tố giúp các buổi trình bày roadshow trở nên thuyết phục hơn.

Hiểu biết đa phương tiện được tích hợp trong V4.1-Flash, bao gồm cả dữ liệu hình ảnh và văn bản, thu hẹp cơ hội phân biệt của các đối thủ, bao gồm OpenAI và Moonshot AI, nhà phát triển Kimi K3.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.