DeepSeek baru sahaja melancarkan model yang mampu memproses satu juta token konteks sambil mengaktifkan parameter kurang daripada beberapa model sumber terbuka yang dilancarkan dua tahun lalu. V4.1-Flash, yang dilancarkan pada 10 September, mewakili usaha terkini syarikat AI China ini untuk menulis semula ekonomi model bahasa besar.
Model ini mengemas 552 bilion parameter ke dalam arsitektur Mixture-of-Experts (MoE), tetapi hanya mengaktifkan sekitar 8 bilion untuk tugas input dan 16 bilion untuk output. Hasilnya adalah model yang berkinerja jauh melebihi apa yang diharapkan dari jejak komputasi aktifnya.
Arsitektur yang membuatnya berfungsi
V4.1-Flash memperkenalkan apa yang disebut DeepSeek sebagai arsitektur Asimetris Encoder-Decoder Kausal, yang memproses input dan menghasilkan output melalui laluan berbeza yang dioptimakan untuk setiap tugas, bukan menjalankan semuanya melalui satu saluran tunggal.
Tingkap konteks membentang hingga 1 juta token. Menyokong konteks besar itu adalah cache KV yang mengambil kira sekitar 890 bait setiap token, kira-kira seperempat daripada yang diperlukan oleh model V4-Flash sebelumnya.
Pengurangan cache ini lebih penting daripada yang mungkin terdengar. KV cache adalah bottleneck memori yang menentukan berapa banyak pengguna serentak yang boleh dilayan oleh model dan berapa lama perbualan mereka boleh berterusan. Mengurangkan sebanyak 75% bermakna operator boleh melayani kira-kira empat kali lebih ramai pengguna pada peranti yang sama, atau menangani konteks empat kali lebih panjang tanpa meningkatkan cluster GPU mereka.
Dalam ujian pembanding, DeepSeek menyatakan bahawa V4.1-Flash mengungguli model V4-Pro sendiri dan bersaing secara langsung dengan GPT-5.6 dan Kimi K3. Syarikat tersebut sudah menghala permintaan dari V4-Pro ke model baharu, dengan harga yang dikemaskini berkuat kuasa pada 14 September.
Bobot terbuka, strategi terbuka
DeepSeek telah merilis bobot model tersebut di bawah lesen MIT di Hugging Face. Model baru ini boleh diakses melalui API DeepSeek melalui endpoint “deepseek-flash.” Kombinasi bobot terbuka dan akses API mencipta dua lintasan pengambilan: pembangun yang ingin menjalankan inferens di infrastruktur sendiri boleh memuat turun dan menghuraikan secara tempatan, sementara mereka yang lebih suka perkhidmatan yang dikelola boleh memanggil API pada tier harga baharu DeepSeek.
Implikasi IPO dan kedudukan persaingan
Masa pelancaran V4.1-Flash bukanlah kebetulan. DeepSeek dijangka akan disenaraikan di Pasar STAR Shanghai, dan menunjukkan momentum teknikal yang berterusan adalah perkara yang membuatkan persembahan roadshow lebih meyakinkan.
Pemahaman multimodal yang dibina dalam V4.1-Flash, yang merangkumi data visual dan teks, mempersempit peluang pembezaan yang tersedia kepada pesaing termasuk OpenAI dan Moonshot AI, yang membangunkan Kimi K3.
