Zhipu, GLM-5.3-Flash modelini 100.000 yerel çipte başlatıyor ve NVIDIA ile rekabet ediyor

iconMetaEra
Paylaş
AI summary iconÖzet
Zhipu AI, GLM-5.3-Flash modelünü piyasaya sürdü ve bu model şimdi 100.000'den fazla yerel çipden oluşan bir kümeye dağıtıldı. Ox Alpha olarak bilinen bu model, NVIDIA GPU verimliliği ve token maliyetiyle eşit düzeyde performans gösterirken, AA Zeka Endeksi'nde 57 puan aldı. Önde gelen rakiplerden daha düşük fiyatlar sunuyor ve GLM-5 serisinin ilk yerel çok modlu modeli. Zincir içi veriler, AI altyapısına yönelik ilginin arttığını gösteriyor; zincir içi analizler, maliyet etkin yerel çözümlere doğru olan geçişi vurguluyor.
ZhiPu, en yeni modeli GLM-5.3-Flash'ı duyurdu. Bu model, daha önce anonim olarak Ox Alpha adıyla test platformunda ücretsiz olarak sunulmuş ve 5 gün içinde 50 trilyon tokenin üzerinde trafik toplamıştır. Model, 100.000'den fazla yerel çip kümesi kullanılarak çıkarım hizmetleri sunmaktadır; donanım verimliliği ve tek token maliyeti NVIDIA GPU'larla eşdeğer seviyede olmuştur. Performans açısından, model AA Genel Akıllılık İndeksi'nde 57 puan alarak Claude Opus 4.8 ile eşitlenmiştir. Fiyatlandırma olarak, her milyon token girdi için 0,8 yuan, çıktı için 2,8 yuan olup, rekabetçi ürünlerden çok daha düşüktür. Mimari, seyrek ve doğrusal dikkat karışımı tasarımı kullanır ve GLM-5 serisinin ilk yerel çok modelli modelidir. Yerel AI modellerinin hepsinin fiyatlarını artırdığı bu dönemde, ZhiPu düşük fiyat stratejisiyle piyasada yer kazanmaktadır.

Yazar ve kaynak: Geç NoktaLatePost

26 Ağustos'ta Zhipu, geliştirici topluluğunda büyük ilgi gören anonim model Ox Alpha'nın (Çin topluluğunda "Niu Lai" olarak bilinir) en son duyurulan GLM-5.3-Flash olduğunu resmen doğruladı. Model kod adı, son zamanlarda Çin'de gösterime giren film "Niu Lai"den esinlenmiştir.

Bu model, resmi olarak tanıtılmadan önce OpenRouter ve OpenCode üzerinde anonim olarak ücretsiz test amacıyla açıldı ve 5 gün içinde birikmiş trafiği 50 trilyon tokeni aştı, bu da iki platformun trafiğinde yeni bir rekora imza attı. Şu anda kullanım miktarı, DeepSeek'in iki katından fazladır. Ancak piyasa ilgisini gerçekten körükleyen, Zhipu'nun ardından açıkladığı bir ayrıntıydı: Bu trafiğin tamamı, yerel çip teknolojisiyle destekleniyordu.

ZhiPu, resmi teknik belgesinde, bu modelin çıkarım hizmeti için 100.000'den fazla yerel çip kümesinin çağrıldığını belirtti: "Donanım verimliliği ve tek token maliyeti, ana akım NVIDIA GPU'larıyla eşdeğer seviyeye ulaştı."

Yarı iletken araştırma kuruluşu SemiAnalysis, X platformunda şu yorumu yayınladı: “Tüm trafiğin yükü yerel çipler taşımaktadır; donanım verimliliği ve tek token maliyeti, NVIDIA GPU’larla kıyaslanabilir seviyeye ulaşmıştır. Jalapeño (OpenAI’nin kendi geliştirdiği çıkarım çipi)’nin dün duyurulmasının ardından CUDA’nın koruma duvarı yeniden sınanmaktadır.”

100.000 yerli kart: Testten üretime kadar ZhiPu, bu yerli çip kümesinin dağıtım ayrıntılarını teknik belgesinde açıkladı.

Tek bir çipin ana sınırlaması, bellek kapasitesi ve bant genişliğidir; 1 milyon token'a kadar bağlam uzunluğunu desteklemek özellikle zordur. Bu nedenle, Zhipu, SGLang üzerine dayalı özel bir çıkarım motoru geliştirdi, W8A8 kuantizasyonu, INT8/FP8/BF16 karışık önbellek kuantizasyonu ve düğüm içi tensör paralelliği gibi teknikleri kullandı ve üretim seviyesinde Encode–Prefill–Decode (EPD) ayrıştırılmış mimariyi ekledi; multimodal kodlama, prompt ön-doldurma ve token bazlı dekodlama işlemlerini bağımsız olarak planlanabilir iş havuzlarına ayırdı.

ZhiPu, aynı donanım üzerindeki ilk temel veriyle karşılaştırıldığında, uçtan uca hizmet performansının üç kat arttığını belirtti.

LatePost'e göre, bu çiplerin tedarikçileri Huawei, Moore Threads veya Hygon olabilir. ZhiPu resmi olarak bu konuda yorumda bulunmadı ve teknik belgelerde belirli çip modelleri açıkça belirtilmedi.

SemiAnalysis, yorumunda daha önce yalnızca en üst düzey ileri laboratuvarların günlük 100 trilyon token hesaplama kapasitesine sahip olabileceğini düşünen görüşlere özellikle işaret etti: “Burada günlük 100 trilyon tokenlik ücretsiz trafiğin tamamı yerli çipler üzerinde çalışıyor.”

Model kendisi: DeepSeek ile karşılaştırılır, fiyat Claude Opus 4.8'in 1/40'ıdır. GLM-5.3-Flash'in toplam parametre sayısı 320B, etkin parametre sayısı 18B'dir ve parametre miktarı, önceki nesil lider model GLM-5.3'ün yaklaşık %40'ı kadardır ve DeepSeek V4 Flash ile neredeyse aynı seviyededir.

Performans açısından, Zhipu'nun resmi değerlendirmesine göre GLM-5.3-Flash, Artificial Analysis Intelligence Index (AA Bütünleşik Akıllılık Endeksi)’nde 57 puan alarak önceki nesil lider model GLM-5.2’yi geçti, Anthropic’ın Claude Opus 4.8 ile eşitlendi ve DeepSeek’in lider modeli V4 Pro resmi sürümünün 53 puanını aştı.

Fiyatlandırma açısından, GLM-5.3-Flash için her milyon token girdi 0,8 yuan, çıktı 2,8 yuan, önbellek uyumu fiyatı ise 0,23 yuan olup, GLM-5.3'ün onda biridir. İlk iki hafta yarı fiyatla sunulacaktır.

ZhiPu, GLM-5.3-Flash'ın fiyatının GLM-5.3'ün onda biri, sınırlı süreli indirim kapsamında GLM-5.3'ün yirmide biri, Claude Opus 4.8'ün kırkta biri olduğunu belirtti.

DeepSeek V4 Flash'a kıyasla (gece saatlerinde giriş 1,5 yuan, çıkış 4,5 yuan), GLM-5.3-Flash çoğu yaygın kullanım senaryosunda daha ucuza mal oluyor.

Yapısal yenilik: Aktif parametre ve katman sayısı neredeyse yarıya indi—GLM-5.3-Flash, GLM-5.3 ile tamamen farklı bir mimariye sahiptir ve bu da daha düşük maliyetle daha yüksek performans elde etmesinin temel nedenidir.

GLM-4.5 ile karşılaştırıldığında, GLM-5.3-Flash toplam parametre sayısı benzerdir (355B vs. 320B), ancak etkin parametre sayısı 32B'den 18B'ye düşmüş, katman sayısı 92'den 45'e inmiş ve neredeyse yarıya inmiştir.

ZhiPu, GLM-5.3-Flash'ın, seyrek dikkat ve doğrusal dikkat karışık mimarisini kullanan ilk açık kaynak öncü model olduğunu açıkladı. GLM-5.3'e kıyasla, dikkat hesaplama miktarı ve KV önbellek boyutu sırasıyla 3,01 ve 4,44 kat azaldı.

Ayrıca, bu model, GLM-5 serisinin ilk yerel çok modelli modelidir ve görüntü ile video girişi destekler; aynı zamanda ZhiPu'nun coding üzerine odaklanmaya başlamasından bu yana çok modelli yeteneklere sahip ilk yeni modelidir.

Fiyat artış dalgasında düşük fiyatla çıkış: GLM-5.3-Flash, Çin AI modeli piyasasında birlikte fiyat artışları sonrasında yayımlandı.

Kimi K3, her milyon token başına 100 yuan'a kadar çıktı fiyatı sunuyor ve önceki nesil K2.6'nın üç katından fazlası; ZhiPu'nun ilk yarısındaki fiyat artışıyla çıktı fiyatı 28 yuan'a ulaştı; DeepSeek V4 Pro, 6 yuandan 13,5 yuana yükseldi, yoğun saatlerde 27 yuan; DeepSeek V4 Flash çıktı fiyatı 2 yuandan 4,5 yuana çıktı, yoğun saatlerde 9 yuan.

Fiyat artışının doğrudan sonucu talebin sızmasıdır. LatePost, DeepSeek V4 Flash'in fiyatının artırılmasının ardından OpenCode platformundaki çağrı miktarının yarısına düştüğünü belirtti; bu talep, yerel model üreticileri için yeni bir büyüme alanı haline geldi.

GLM-5.3-Flash'in fiyatlandırma stratejisi, tam olarak bu boşluğu hedefliyor.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.