DeepSeek, iki yıl önce yayınlanan bazı açık kaynak modellerden daha az parametre aktive ederek milyonlarca token bağlamını işleyen bir model çıkardı. 10 Eylül'de başlatılan V4.1-Flash, Çinli yapay zeka startup'ının büyük dil modellerinin ekonomisini yeniden yazma çabasının en son adımıdır.
Model, 552 milyar parametreyi Bir Uzmanlar Karışımı (MoE) mimarisine sıkıştırır, ancak girdi görevleri için sadece yaklaşık 8 milyarını ve çıktı için 16 milyarını aktif hale getirir. Sonuç olarak, aktif hesaplama iziyle karşılaştırıldığında çok daha yüksek performans gösteren bir model elde edilir.
İşleyişini sağlayan mimari
V4.1-Flash, DeepSeek'in asimetrik Nedenli Kodlayıcı-Çözücü mimarisini tanıtır; girdiyi işler ve çıktı üretirken, her görev için optimize edilmiş farklı yollar kullanır, tüm işlemleri tek bir hat üzerinden çalıştırmaz.
Bağlam penceresi 1 milyon belirtece kadar uzanıyor. Bu büyük bağlamı desteklemek, her belirteç başına yaklaşık 890 bayt tüketen bir KV önbelleği gerektiriyor, bu da önceki V4-Flash modelinin gerektirdiği miktarın yaklaşık dörtte biridir.
Bu önbellek azaltması, duyulandan daha önemli. KV önbelleği, bir modelin aynı anda kaç kullanıcıya hizmet edebileceğini ve görüşmelerinin ne kadar uzun sürebileceğini belirleyen bellek darboğazıdır. %75 azaltmak, operatörlerin aynı donanımda yaklaşık dört kat daha fazla kullanıcıya hizmet etmesini veya GPU kümelerini yükseltmeden dört kat daha uzun bağlamları işlemesini sağlar.
Benchmark'larda DeepSeek, V4.1-Flash'ın şirketin kendi V4-Pro modelini aştığını ve doğrudan GPT-5.6 ile Kimi K3 ile rekabet ettiğini iddia ediyor. Şirket, V4-Pro'dan gelen istekleri yeni modele yönlendirmeye başladı ve güncellenen fiyatlandırma 14 Eylül'de yürürlüğe girecek.
Ağırlıkları açın, stratejiyi açın
DeepSeek, model ağırlıklarını Hugging Face üzerinde MIT lisansı altında yayınladı. Yeni model, DeepSeek’in API’si üzerinden “deepseek-flash” uç noktası aracılığıyla erişilebilir. Açık ağırlıklar ve API erişiminin birleşimi, iki yolculu bir kabul modeli oluşturur: Kendi altyapılarında çıkarım yapmak isteyen geliştiriciler, ağırlıkları indirip yerel olarak dağıtabilir; yönetilen hizmetleri tercih edenler ise DeepSeek’in yeni fiyatlandırma katmanları üzerinden API’yi çağırabilir.
İPO etkileri ve rekabet pozisyonu
V4.1-Flash'in başlatılma zamanlaması rastgele değildir. DeepSeek'in Şangay STAR Pazarı'nda halka açılması bekleniyor ve sürekli teknik ivme göstermek, yol gösterici sunumları daha ikna edici hale getiren bir şeydir.
V4.1-Flash'a gömülü çok modlu anlama, hem görsel hem metin verilerini kapsayarak, OpenAI ve Kimi K3'ü geliştiren Moonshot AI gibi rakipler için farklılaşma fırsatlarını daraltır.
