Binalik ng DeepSeek ang isang modelong nakapagproseso ng isang milyong token ng konteksto habang ginagamit ang mas kaunting parameter kaysa sa ilang open-source na modelong ipinakilala dalawang taon na ang nakalipas. Ang V4.1-Flash, na ipinakilala noong Setyembre 10, ay ang pinakabagong hakbang ng Chinese AI startup upang muliing isulat ang ekonomiks ng mga malalaking modelong wika.
Ang modelo ay naglalaman ng 552 bilyong parameter sa isang Mixture-of-Experts (MoE) arkitektura, ngunit nagpapagana lamang ng humigit-kumulang 8 bilyong parameter para sa mga input task at 16 bilyon para sa output. Ang resulta ay isang modelo na nagtataglay ng mas malakas na kakayahan kaysa sa ano ang ipinapakita ng aktibong compute footprint nito.
Ang arkitektura na nagpapagana nito
Ang V4.1-Flash ay nagtatampok ng isang asymmetric Causal Encoder-Decoder architecture, na nagproseso ng input at naglalabas ng output sa pamamagitan ng iba’t ibang pathways na optimal para sa bawat gawain, sa halip na pagpapalagi sa isang solong pipeline.
Ang context window ay umabot sa 1 milyong tokens. Ang pagpapalakas sa napakalaking context ay isang KV cache na naglalabas ng halos 890 bytes bawat token, halos isang-kwarter ng kung ano ang kailangan ng dating V4-Flash model.
Mas mahalaga ang pagbawas ng cache kaysa sa maaaring mangyari. Ang KV cache ay ang bottleneck sa memorya na nagtatakda kung ilang magkakasamang user ang maaaring servisyan ng isang model at kung gaano kalabas ang kanilang mga usapan. Ang pagbawas nito ng 75% ay nangangahulugan na ang mga operator ay maaaring servisyan ng apat na beses na maraming user sa parehong hardware, o mag-handle ng mga konteksto na apat na beses na mahaba nang hindi nag-uupgrade ng kanilang GPU clusters.
Sa mga benchmark, sinasabi ng DeepSeek na mas mataas ang performance ng V4.1-Flash kaysa sa sariling V4-Pro model ng kumpanya at direktang kumikita sa GPT-5.6 at Kimi K3. Ang kumpanya ay nangangalap na ang mga kahilingan mula sa V4-Pro patungo sa bagong model, na may updated na presyo na magpapalabas noong Setyembre 14.
Buksan ang timbang, buksan ang estratehiya
Ipinakalabas ng DeepSeek ang weights ng model sa ilalim ng lisensya ng MIT sa Hugging Face. Ang bagong model ay ma-access sa pamamagitan ng API ng DeepSeek sa endpoint na “deepseek-flash.” Ang kombinasyon ng open weights at API access ay bumubuo ng dalawang landas sa pagtatangkilik: ang mga developer na gustong jalurin ang inference sa kanilang sariling infrastructure ay maaaring i-download at i-deploy nang lokal, habang ang mga nagpapahalaga sa managed services ay maaaring i-call ang API sa bagong presyo ng DeepSeek.
Mga epekto ng IPO at posisyon sa kompetisyon
Hindi pangyayari ang oras ng paglunsad ng V4.1-Flash. Inaasahan na magiging publiko ang DeepSeek sa STAR Market ng Shanghai, at ang pagpapakita ng patuloy na teknikal na momentum ay uri ng bagay na nagiging mas kumbinsente sa mga presentasyon ng roadshow.
Ang multimodal na pag-unawa na nakabuilt sa V4.1-Flash, na sumasakop sa parehong visual at text data, ay nagpapaliit sa mga pagkakataon para sa pagkakaiba ng mga kalaban kabilang ang OpenAI at Moonshot AI, na nagpapaunlad ng Kimi K3.
