Ipinakilala at inilabas ng Alibaba ang Qwen 3.8 Flash model, na gumagamit ng 125B MoE architecture, na nag-activate ng halos 6B parameters bawat token, na may native suporta sa 262144 token context, at maaaring i-expand sa 1M token gamit ang YaRN. Ang pangunahing pagbabago ng model na ito ay ang kakayahang mag-run sa consumer-grade 4090 GPU, na nagdadala ng long-context models na data center-level patungo sa consumer-grade hardware. Mas kompetitibo ang presyo nito: ₱0.8 bawat milyong tokens sa input, ₱2.7 sa output—tanging isang-katlo lamang ng presyo ng DeepSeek-V4-Flash. Ang mga pagsusuri ay nagpapakita na ang model ay maaaring matapos ang paggawa ng apat na uri ng content sa loob ng 2 minuto, at ang pagkuha ng transcript ng meeting, pag-ayos ng table, at paggawa ng email sa loob ng 4 minuto. Ang Qwen 3.8 Flash ay nasa pagsisimula na sa platform na Qwen Office, at ang API interface ay naka-open nang sabay. Sa parehong araw, inilabas din ng Zhipu ang GLM-5.3-Flash, na may performance na katumbas ng Claude Opus 4.8, ngunit ang presyo nito ay isang-patlubing bahagi lamang.May-akda ng artikulo, pinagkukunan: Quantum Bit
Ang bagong model ng Alibaba Qwen ay naglagay ulit ng mas mataas na antas.
Ang kanilang ipinakalabas at inilabas bilang open-source na Qwen 3.8 Flash-Next ay hindi lamang nagpapakita ng presyo na diretso nang lalong mabilis kaysa sa DeepSeek-V4-Flash, kundi agad ring nakuha ang unang pwesto sa Huggingface!

Nagkaron din ng pagkabigla ang mga tagasunod sa Twitter, at kahit may mga inhinyero ang naglabas ng mga video ng real-time test at nagpahayag na epiko:
Ang Qwen 3.8 Flash ay nagbaba ng hadlang sa VRAM,ang malaking modelo para sa mahabang teksto sa antas ng data center, maaari na ring tumakbo sa 4090 GPU para sa konsumidor!
May mga tao na agad na ginamit ito sa kanilang trabaho.
Hindi nagmumula sa 8 minuto, natapos na nito ang buong workflow na kumakapal ng Python programming, maraming tabla na pagsusuri, at pagbuo ng研究报告:

Hindi problema ang tower effect:

Wow, talagang ganyan? Kailangan nating subukan din.

Only ₱0.8 per million tokens input
Gumagamit ang Qwen3.8-Flash ng 125B MoE architecture, na nag-activate ng humigit-kumulang 6B na parameter bawat token, at nagtataglay ng natatanging suporta sa 262144 token na konteksto, na maaaring i-expand patungo sa 1M token gamit ang YaRN.
Samantala, ito ay isang early preview ng bagong arkitektura ng Qwen4.
Kumpara sa Qwen 3.7 Plus, ang Qwen 3.8 Flash ay hindi lamang binawasan ang aktibong parameter sa 1/3, kundi ang gastos sa pagtuturo ay tanging 1/9 nito, at mas malakas pa ang mga kakayahan sa pangkalahatan, pagsusuri sa matematika, at paggawa ng code.
Mas matinding bagay ay ang presyo: ang Qwen 3.8 Flash ay nagkakahalaga ng tanging 0.8 yuan bawat milyong Tokens para sa input at 2.7 yuan para sa output, at 0.1 yuan kung ang cache ay nakakasali, na nagiging mas mababa kaysa sa 1/3 ng presyo ng DeepSeek-V4-Flash.
Talagang mas malakas kaysa sa Pinduoduo's cut-one-more-time (bushi)

Sige na, dahil nasa ganitong antas na ang presyo, hindi na tayo magmumura, direktang isasabuhay natin ang dalawang praktikal na pagsubok upang subukan ang tunay na kakayahan ng Qwen 3.8 Flash sa mga办公场景.
Real-world test 1: Design four copy variants tailored for different platform styles for camera products
Isinulong namin ang isang “Challenge sa Pagsusulat ng Kriptowaluta” kung saan ang Qwen 3.8 Flash ay may budget na 1 yuan upang i-revise ang isang libo-libong salitang dokumento ng camera para maging mga post sa Xiaohongshu, Weibo, TikTok, at WeChat Moments, upang makita kung gaano karaming gawain ang kayang tapusin nito.
Ang mga prompt ay sumusunod:

Pagkatapos ipasa ang prompt, pumunta ako sa kusina ng kumpanya para uminom, at nangyari ito sa loob ng higit sa 2 minuto.
Nakatingin muli, ang apat na iba’t ibang teksto para sa iba’t ibang platform ay naisulat na lahat, at tama ang pagtagalog sa brand, istilo, at mga hashtag (kung saan hindi ako magpapalabas ng ganitong habang post sa朋友圈 hhh):




Hindi nakalipas ang dalawang minuto, natapos na ang apat na bersyon ng teksto—ang bilis ng “cyber worker” ay nakapasa.
Ngunit sa workplace, ang tunay na nagdudulot ng problema ay hindi ang pagsusulat ng mga ulat, kundi kung sino ang magpapakasal sa pag-aayos ng mga kalat pagkatapos ng meeting.
Kaya inilagay namin ito sa pangalawang trabaho upang subukan ang kanyang praktikal na kakayahan sa opisina.
Real-world test 2: Turn a product weekly meeting into an actionable plan
Isinulat namin ang isang orihinal na transkripsyon ng panayam na may libo-libong salita, na may maraming pagkakamali sa pagbigkas at kakaibang usapan, na may paksa na “Mungkahi at Teknikal na Pagsusuri para sa Smart Customer Service Agent V2.0,” at pinayagan ang Qwen3.8-Flash na tapusin ang tatlong gawain nang isang beses: pagkuha ng buod, pag-ayos ng mga talahanayan, at paglikha ng e-mail na pagsusumite pagkatapos ng panayam.
△ Ginawa ng AI ang larawan, ang pagkakarinig ng “token” bilang “stink啃” ay talagang may buhay.
Ang mga prompt ay sumusunod:

Sa default mode, natapos ng Qwen3.8-Flash ang lahat ng mga gawain sa loob ng higit sa apat na minuto, at tama at walang kamalian ang limang pangunahing konklusyon, ang pagkakahati ng mga gawain sa talahanayan, ang format ng email, at ang mga tatanggap ay tumutugma nang tama sa nilalaman ng pagpupulong.



△ Ilan sa mga resulta ng pagsubok
Hindi pa itinaguyod, nag-iisip na ito para sa amin ng mga isyu na hindi pa nalutas sa pagpupulong, upang madali naming pag-usapan muli sa susunod na pagpupulong, be like:

At sa puntos na ito, wala pa akong naiwan sa aking limit!
Ahaha, sobrang sarap sa pakiramdam ng walang limitasyon.
Ngayon, ang Qwen 3.8 Flash ay nagsimula na sa platform na “Qianwen Office”, at ang API interface ay naka-open na rin—subukan na ninyo!

Isang Bagay Pa
Mas napakalakas ang pakikidigma sa presyo ng mga malalaking lokal na modelo.
Sa parehong panahon na isinilang ang Qwen 3.8 Flash, binuksan din ng ZhiPu ang unang orihinal na multimodal na modelo sa GLM-5 series, ang GLM-5.3-Flash, na kilala na rin bilang ang malaking modelo na “Niu Lai” Ox Alpha.
Sa pagsusuri, ang performance ng model na ito ay katumbas ng Claude Opus 4.8, ngunit ang presyo ay bawasan sa 1/10 ng GLM-5.3.

At ang GLM-5.3-Flash ay nag-aalok ng 50% discount para sa dalawang linggo, na nangangahulugan na ang presyo nito sa panahon ng promosyon ay tanging 1/20 ng presyo ng GLM-5.3 at 1/40 ng presyo ng Opus4.8.

Bukod dito, ang Qwen 3.8 Flash at ang GLM-5.3-Flash ay may isang karagdagang pagkakatulad: pareho silang sumakop sa DeepSeek-V4-Flash sa sobrang mababang presyo (nag-alis ang DeepSeek habang nagmumura):
△Tsart ng pagkukumpara ng presyo ng DeepSeek-V4-Flash, Qwen 3.8 Flash, at GLM-5.3-Flash
Walang pag-aatubili, sobrang kompetisyon.
