Alibaba merilis dan mengopen-source model Qwen 3.8 Flash, yang menggunakan arsitektur MoE 125B, hanya mengaktifkan sekitar 6B parameter per token, mendukung konteks asli hingga 262.144 token, dan dapat diperluas hingga 1 juta token melalui YaRN. Inovasi model ini terletak pada kemampuannya berjalan di GPU konsumen 4090, mewujudkan migrasi model teks panjang tingkat pusat data ke perangkat konsumen. Lebih kompetitif lagi, harganya: input satu juta token seharga 0,8 yuan, output seharga 2,7 yuan, hanya sepertiga dari harga DeepSeek-V4-Flash. Uji coba menunjukkan bahwa model ini dapat menyelesaikan penulisan konten untuk empat platform dalam 2 menit, serta ekstraksi catatan rapat, penyusunan tabel, dan pembuatan email dalam 4 menit. Qwen 3.8 Flash telah tersedia di platform Qwen Office, dengan antarmuka API yang juga dibuka secara bersamaan. Pada hari yang sama, Zhipu juga mengopen-source GLM-5.3-Flash, yang performanya sebanding dengan Claude Opus 4.8 namun harganya hanya satu per empat puluh.Penulis artikel, sumber: Quantum Bit
Model baru Alibaba Qwen, kembali menaikkan standar baru.
Mereka merilis dan mengopensource Qwen 3.8 Flash-Next, yang tidak hanya menghancurkan harga DeepSeek-V4-Flash, tetapi juga langsung menduduki peringkat pertama di Huggingface sejak peluncurannya!

Netizen di Twitter juga bergemuruh, bahkan ada insinyur yang membagikan video uji coba langsung dan berseru:
Qwen 3.8 Flash menghilangkan hambatan VRAM,model bahasa panjang tingkat pusat data kini dapat dijalankan di kartu grafis konsumen 4090!
Masih ada yang sudah antusias menggunakannya di pekerjaan mereka.
Dalam waktu kurang dari 8 menit, ia menyelesaikan seluruh alur kerja yang mencakup pemrograman Python, analisis multi-tabel, dan pembuatan laporan penelitian:

Efek pagoda juga tidak menjadi masalah:

Wah, benar-benar keren? Kita juga harus mencobanya.

Hanya Rp0,8 per juta token input
Qwen3.8-Flash menggunakan arsitektur MoE 125B, hanya mengaktifkan sekitar 6B parameter per token, secara native mendukung konteks 262144 token, dan dapat diperluas hingga 1M token melalui YaRN.
Sementara itu, ini juga merupakan pra-penyajian arsitektur baru Qwen4.
Dibandingkan dengan Qwen 3.7 Plus, Qwen 3.8 Flash tidak hanya mengurangi parameter aktif menjadi sepertiganya, tetapi juga biaya pelatihannya hanya sepertujuhnya, sementara kemampuan umum, penalaran matematika, dan pemrograman semakin kuat.
Yang lebih mengejutkan lagi adalah harganya: input Qwen 3.8 Flash hanya 0,8 yuan per juta token, output 2,7 yuan, cache hit 0,1 yuan, harga terendah mencapai 1/3 dari DeepSeek-V4-Flash.
Ini jauh lebih besar daripada potongan harga di Pinduoduo (bushi)

Baiklah, karena harganya sudah sampai pada tingkat ini, kita tidak akan segan-segan lagi, langsung tingkatkan intensitasnya, gunakan dua uji coba nyata untuk menguji kemampuan sebenarnya dari Qwen 3.8 Flash dalam skenario perkantoran.
Uji coba nyata 1: Merancang empat teks yang disesuaikan dengan platform berbeda untuk produk kamera
Kami mengadakan "Kompetisi Penulisan Konten Cyber", di mana Qwen 3.8 Flash harus menulis ulang dokumen produk kamera yang hampir sepuluh ribu kata menjadi teks untuk Xiaohongshu, Weibo, Douyin, dan Moments, dengan anggaran hanya satu yuan, untuk melihat berapa banyak tugas yang dapat diselesaikannya.
Prompt berikut ini:

Setelah mengirimkan prompt, saya pergi ke dapur umum kantor untuk mengambil air, total kurang dari 2 menit.
Ketika kembali melihat, keempat teks dari platform yang berbeda sudah selesai ditulis, dan @brand, gaya, serta tagar topiknya tepat sekali (selain saya tidak akan memposting sepanjang itu di朋友圈 hhh):




Dalam waktu kurang dari dua menit, empat draft selesai dikerjakan — kecepatan tangan "pekerja cyber" sudah cukup memadai.
Tapi yang sering membuat pusing di tempat kerja bukanlah menulis konten, melainkan siapa yang akan membersihkan kekacauan setelah rapat selesai.
Karena itu, kami memberinya pekerjaan kedua untuk menguji kemampuan praktisnya di tempat kerja.
Uji coba nyata 2: Mengubah rapat produk mingguan menjadi rencana yang dapat dieksekusi
Kami merekam ulang secara akurat sebuah transkrip rapat asli sepanjang sepuluh ribu kata, dengan gaya yang sama persis seperti yang diterima peserta setelah rapat mingguan—penuh kesalahan ejaan homofon dan obrolan sepele—dengan tema “Rapat Tinjauan Kebutuhan dan Teknis Agent Layanan Pelanggan Cerdas V2.0”, dan Qwen3.8-Flash berhasil menyelesaikan tiga tugas sekaligus: mengekstrak ringkasan, menyusun tabel, dan membuat email pemberitahuan setelah rapat.
△ Gambar dihasilkan oleh AI, mendengar "token" sebagai "偷啃" benar-benar sangat hidup
Prompt berikut ini:

Dalam mode default, Qwen3.8-Flash menyelesaikan semua tugas dalam waktu kurang dari 4 menit, dengan ringkasan lima kesimpulan inti dan pembagian tugas tabel yang akurat, format email sesuai standar, dan penerima email sesuai dengan isi rapat.



△ Sebagian gambar hasil pengujian
Bahkan tanpa diminta, ia dengan ramah menyusun hal-hal yang belum dibahas dalam rapat, sehingga kami dapat melanjutkan diskusi di rapat berikutnya, be like:

Dan sampai tahap ini, kuota saya belum habis!
Ahahaha, rasanya sangat menyenangkan bisa bebas seperti ini.
Sekarang, Qwen 3.8 Flash telah diluncurkan secara perdana di platform "Qianwen Office", dan antarmuka API juga telah dibuka secara bersamaan, silakan coba!

Satu Hal Lagi
Perang harga untuk model besar buatan dalam negeri semakin sengit.
Pada waktu yang hampir bersamaan dengan peluncuran open-source Qwen 3.8 Flash, Zhipu juga membuka sumber GLM-5.3-Flash, model multimodal asli pertama dari seri GLM-5, yang sebelumnya menjadi viral online sebagai model besar Ox Alpha.
Dalam evaluasi, kinerja model ini sebanding dengan Claude Opus 4.8, tetapi harganya dipotong menjadi 1/10 dari GLM-5.3.

Selain itu, GLM-5.3-Flash juga secara murah hati membuka promosi setengah harga selama dua minggu, yang berarti harga GLM-5.3-Flash selama periode promosi hanya 1/20 dari harga GLM-5.3 dan 1/40 dari harga Opus4.8.

Selain itu, Qwen 3.8 Flash dan GLM-5.3-Flash juga memiliki kesamaan, yaitu keduanya kali ini mengejutkan DeepSeek-V4-Flash dengan harga yang sangat rendah (DeepSeek pergi sambil mengeluh):
△Grafik perbandingan harga DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash
Tak bisa dipungkiri, terlalu kompetitif.
