Alibaba đã phát hành và mở nguồn mô hình Qwen 3.8 Flash, sử dụng kiến trúc MoE 125B, chỉ kích hoạt khoảng 6B tham số mỗi token, hỗ trợ native ngữ cảnh 262144 token và có thể mở rộng lên 1M token thông qua YaRN. Điểm đột phá của mô hình này là khả năng chạy trên card đồ họa tiêu dùng 4090, mang lại khả năng xử lý văn bản dài cấp trung tâm dữ liệu trên phần cứng tiêu dùng. Hơn nữa, giá cả của nó rất cạnh tranh: 0,8 nhân dân tệ cho mỗi triệu token đầu vào và 2,7 nhân dân tệ cho mỗi triệu token đầu ra, chỉ bằng một phần ba giá của DeepSeek-V4-Flash. Các bài kiểm tra thực tế cho thấy mô hình có thể hoàn thành việc viết nội dung trên bốn nền tảng trong 2 phút, và thực hiện trích xuất biên bản cuộc họp, sắp xếp bảng và tạo email trong 4 phút. Qwen 3.8 Flash đã được triển khai trên nền tảng Qwen Office, đồng thời API đã được mở sẵn. Cùng ngày, Zhipu cũng đã mở nguồn GLM-5.3-Flash, có hiệu năng tương đương Claude Opus 4.8 nhưng giá chỉ bằng một phần bốn mươi.Bài viết bởi, nguồn: Quantum Bit
Mô hình mới của Alibaba Qwen lại nâng cao tiêu chuẩn lên một cấp độ mới.
Họ đã phát hành và mở nguồn Qwen 3.8 Flash-Next, không chỉ có giá rẻ hơn hẳn DeepSeek-V4-Flash, mà ngay khi ra mắt đã chiếm vị trí số một trên Huggingface!

Cộng đồng trên Twitter cũng sôi nổi, thậm chí còn có kỹ sư đăng video thực nghiệm khen ngợi:
Qwen 3.8 Flash đã xóa bỏ rào cản VRAM,mô hình ngôn ngữ lớn xử lý văn bản dài cấp trung tâm dữ liệu, giờ đây có thể chạy trên card đồ họa 4090 dành cho người dùng phổ thông!
Một số người đã hào hứng áp dụng nó vào công việc của họ.
Trong chưa đầy 8 phút, nó đã hoàn thành toàn bộ quy trình làm việc bao gồm lập trình Python, phân tích nhiều bảng và tạo báo cáo nghiên cứu:

Các hiệu ứng bảo đài cũng không thành vấn đề:

Wow, is it really that cool? We definitely have to give it a try too.

Chỉ 0,8 nhân dân tệ cho mỗi triệu token đầu vào
Qwen3.8-Flash sử dụng kiến trúc MoE 125B, chỉ kích hoạt khoảng 6B tham số mỗi token, hỗ trợ nativ lên đến 262144 token và có thể mở rộng lên 1M token thông qua YaRN.
Đồng thời, đây cũng là bản trình diễn trước về kiến trúc mới của Qwen4.
So với Qwen 3.7 Plus, Qwen 3.8 Flash không chỉ giảm số lượng tham số kích hoạt xuống 1/3, mà chi phí huấn luyện cũng chỉ bằng 1/9, đồng thời các khả năng chung, suy luận toán học và lập trình đều mạnh mẽ hơn.
Đáng chú ý hơn là giá cả: Qwen 3.8 Flash chỉ mất 0,8 nhân dân tệ cho mỗi triệu token đầu vào và 2,7 nhân dân tệ cho đầu ra, 0,1 nhân dân tệ khi đạt cache hit, giá thấp nhất chỉ bằng 1/3 so với DeepSeek-V4-Flash.
Độ giảm giá còn lớn hơn nhiều so với việc chặt một nhát trên Pinduoduo (bushi)

Được rồi, được rồi,既然价格已经卷到了这个份上,那咱也不客气了,直接上强度,用两个实测来探探Qwen 3.8 Flash在办公场景实际的干活能力吧。
Thực nghiệm 1: Thiết kế bốn bản văn bản phù hợp với các nền tảng có phong cách khác nhau cho sản phẩm máy ảnh
Chúng tôi đã tổ chức một “Cuộc thi viết nội dung cạnh tranh”, để Qwen 3.8 Flash sử dụng ngân sách 1 nhân dân tệ, chuyển đổi một tài liệu sản phẩm máy ảnh gần mười nghìn chữ thành các bản文案 cho Xiaohongshu, Weibo, Douyin và Moments, xem nó có thể hoàn thành bao nhiêu nhiệm vụ.
Prompt như sau:

Sau khi gửi lệnh nhắc nhở, tôi đến phòng trà ở công ty lấy nước, toàn bộ quá trình chưa đầy 2 phút.
Quay lại xem, bốn bản văn bản từ các nền tảng khác nhau đã được viết xong hết, và @ đúng thương hiệu, phong cách, các hashtag cũng nắm rất chuẩn (trừ việc tôi sẽ không đăng dài như vậy trên朋友圈 thôi hhh):




Chưa đầy 2 phút hoàn thành bốn bản文案, tay tốc độ của “người lao động cyber” coi như đạt yêu cầu.
Nhưng trong môi trường công sở, điều khiến người ta đau đầu thực sự thường không phải là viết nội dung, mà là sau cuộc họp xong, ai sẽ dọn dẹp những thứ hỗn loạn còn lại.
Vì vậy, chúng tôi đã giao cho nó một công việc thứ hai để kiểm tra khả năng làm việc thực tế của nó.
Thực nghiệm 2: Biến một cuộc họp sản phẩm hàng tuần thành kế hoạch có thể thực hiện
Chúng tôi đã sao chép nguyên bản một bản ghi cuộc họp dài hàng nghìn từ, với nhiều lỗi chính tả đồng âm và xen lẫn những cuộc trò chuyện lặt vặt, với chủ đề “Cuộc họp đánh giá yêu cầu và công nghệ cho Agent Hỗ trợ Khách hàng Thông minh V2.0”, và để Qwen3.8-Flash hoàn thành đồng thời ba nhiệm vụ: trích xuất tóm tắt, sắp xếp bảng và soạn email thông báo sau cuộc họp.
△Ảnh được tạo bởi AI, nghe “token” thành “偷啃” thật là rất đời thường
Prompt như sau:

Ở chế độ mặc định, chỉ chưa đầy 4 phút, Qwen3.8-Flash đã hoàn thành toàn bộ nhiệm vụ một cách xuất sắc, với các kết luận cốt lõi được tóm tắt chính xác, nội dung phân công trong bảng và định dạng email đúng chuẩn, người nhận cũng tương ứng chính xác với nội dung cuộc họp.



△ Một số hình ảnh kết quả kiểm tra
Ngay cả khi không được yêu cầu, nó cũng tự động sắp xếp giúp chúng ta những vấn đề chưa có kết luận trong cuộc họp, để chúng ta có thể tiếp tục thảo luận ở lần họp tới, be like:

Và đến bước này, hạn mức của tôi vẫn chưa dùng hết nhé!
Haha, cảm giác không bị giới hạn thật sự đã khoẻ quá!
Hiện tại, Qwen 3.8 Flash đã chính thức ra mắt trên nền tảng “Thiên Vấn Văn Phòng”, đồng thời API đã được mở đồng bộ, mọi người hãy thử ngay!

Một điều nữa
Cuộc chiến giá của các mô hình lớn trong nước trở nên khốc liệt hơn.
Gần như cùng thời điểm với việc mở nguồn Qwen 3.8 Flash, Zhipu cũng đã mở nguồn mô hình đa phương tiện bản địa đầu tiên trong chuỗi GLM-5, GLM-5.3-Flash, tức là mô hình lớn “Niú Lái” Ox Alpha từng gây sốt trên mạng.
Trong bài đánh giá, hiệu suất của mô hình ngang ngửa Claude Opus 4.8, nhưng giá đã được giảm xuống chỉ bằng 1/10 so với GLM-5.3.

Ngoài ra, GLM-5.3-Flash còn ưu đãi giảm nửa giá trong vòng hai tuần, có nghĩa là trong thời gian khuyến mãi, giá của GLM-5.3-Flash chỉ bằng 1/20 giá của GLM-5.3 và 1/40 giá của Opus4.8.

Ngoài ra, Qwen 3.8 Flash và GLM-5.3-Flash còn có một điểm chung là lần này cả hai đều bất ngờ đánh gục DeepSeek-V4-Flash với mức giá siêu thấp (DeepSeek lẩm bẩm rời đi):
△Biểu đồ so sánh giá của DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash
Không thể nói gì hơn, quá cạnh tranh.
