DeepSeek vừa ra mắt một mô hình xử lý một triệu token ngữ cảnh trong khi kích hoạt ít tham số hơn một số mô hình mã nguồn mở được phát hành cách đây hai năm. V4.1-Flash, được ra mắt vào ngày 10 tháng Chín, đại diện cho nỗ lực mới nhất của công ty AI Trung Quốc nhằm thay đổi kinh tế học của các mô hình ngôn ngữ lớn.
Mô hình chứa 552 tỷ tham số trong kiến trúc Mixture-of-Experts (MoE), nhưng chỉ kích hoạt khoảng 8 tỷ tham số cho các tác vụ đầu vào và 16 tỷ cho đầu ra. Kết quả là một mô hình hoạt động vượt xa so với mức chi phí tính toán thực tế của nó.
Kiến trúc làm cho nó hoạt động
V4.1-Flash giới thiệu kiến trúc Mã hóa-Giải mã Nhân quả bất đối xứng mà DeepSeek gọi là, xử lý đầu vào và tạo đầu ra thông qua các con đường khác nhau được tối ưu hóa cho từng nhiệm vụ, thay vì chạy tất cả qua một đường ống duy nhất.
Cửa sổ ngữ cảnh được mở rộng lên 1 triệu token. Để hỗ trợ ngữ cảnh khổng lồ này là bộ nhớ đệm KV tiêu thụ khoảng 890 byte mỗi token, khoảng một phần tư so với yêu cầu của mô hình V4-Flash trước đó.
Việc giảm bộ nhớ đệm này quan trọng hơn những gì bạn có thể tưởng tượng. Bộ nhớ KV cache là điểm nghẽn bộ nhớ xác định số lượng người dùng đồng thời mà mô hình có thể phục vụ và thời gian kéo dài của các cuộc hội thoại. Việc giảm 75% nghĩa là các nhà vận hành có thể phục vụ khoảng bốn lần nhiều người dùng hơn trên cùng một phần cứng, hoặc xử lý các ngữ cảnh dài hơn bốn lần mà không cần nâng cấp cụm GPU của họ.
Trên các bài kiểm tra hiệu năng, DeepSeek tuyên bố V4.1-Flash vượt trội hơn mô hình V4-Pro của chính công ty và cạnh tranh trực tiếp với GPT-5.6 và Kimi K3. Công ty đã bắt đầu chuyển các yêu cầu từ V4-Pro sang mô hình mới, với mức giá cập nhật có hiệu lực từ ngày 14 tháng 9.
Mở trọng số, mở chiến lược
DeepSeek đã phát hành trọng số mô hình dưới giấy phép MIT trên Hugging Face. Mô hình mới có thể truy cập thông qua API của DeepSeek qua điểm cuối “deepseek-flash”. Sự kết hợp giữa trọng số mở và khả năng truy cập API tạo ra hai con đường triển khai: các nhà phát triển muốn chạy suy luận trên cơ sở hạ tầng riêng có thể tải về và triển khai tại chỗ, trong khi những người ưa chuộng dịch vụ được quản lý có thể gọi API theo các mức giá mới của DeepSeek.
Hệ quả của IPO và vị thế cạnh tranh
Thời điểm ra mắt V4.1-Flash không phải là ngẫu nhiên. DeepSeek dự kiến sẽ niêm yết trên Thị trường STAR của Thượng Hải, và việc thể hiện đà kỹ thuật liên tục là yếu tố giúp các buổi trình bày roadshow trở nên thuyết phục hơn.
Hiểu biết đa phương tiện được tích hợp trong V4.1-Flash, bao gồm cả dữ liệu hình ảnh và văn bản, thu hẹp cơ hội phân biệt của các đối thủ, bao gồm OpenAI và Moonshot AI, nhà phát triển Kimi K3.
