Sadece 2 milyar parametreye sahip bir model, Artificial Analysis Intelligence Index v4.2’de 4 milyar parametreden küçük açık modeller arasında 15 puanla birinci oldu. OpenBMB’in MiniCPM5-2B’si, Tsinghua Üniversitesi NLP laboratuvarı ve ModelBest ile ortaklaşa geliştirildi ve hesaplama kaynaklarının lüks olduğu, değil verildiği telefonlar, dizüstü bilgisayarlar ve diğer cihazlarda çalışmak üzere tasarlandı.
Benchmark'in aslında neyi ölçtüğü
Artificial Analysis, 4 Eylül 2026 tarihinde İstihbarat Endeksi'nin 4.2 sürümünü yayınladı ve bu, MiniCPM5-2B'nin lanzmanından tam üç gün önceydi. Güncellenen endeks, AI modellerinin değerlendirilmesi yöntemine anlamlı değişiklikler getirdi.
Özel test setleri artık toplam ağırlığın %40'ını oluşturuyor, önceki sürümlere göre artarak. Bu önemlidir çünkü özel testlerin oynanması daha zordur. Model geliştiricileri sınav sorularını önceden göremediğinde, puanlar gerçek yeteneklerin daha güvenilir sinyalleri haline gelir.
v4.2 güncellemesi, AA-Briefcase agentic değerlendirme ve Surge’in GDP.pdf uzun bağlam testi olmak üzere iki yeni değerlendirme bileşeni de ekledi. Bu eklemeler, sadece genel bilgi sorularına iyi cevap verebilen modellerden ziyade, özerk olarak hareket edebilen ve çok uzun belgeleri işleyebilen modeller üzerine endüstrinin artan ilgisini yansıtmaktadır.
Genel liderlik tablosunun tepesinde, özgün modeller hâlâ baskındır. Anthropic’ın Claude Fable 5.1 liderlikte. Ancak verimlilik ve erişilebilirlik, kuvvetten daha önemli olan 4B parametreden küçük kategoride, MiniCPM5-2B açık ağırlıklı sıralamada birinci sırada yer alıyor.
Küçük model, geniş hedefler
MiniCPM5-2B, çıkarım sırasında her parametrenin aktif olduğu, uzmanlar karışımı mimarisi üzerinden yönlendirme yapmayan yoğun bir transformer'dır. Yoğun modeller, kaynak tüketimleri açısından daha öngörülebilir olma eğilimindedir; bu da AI'yi kenar cihazlara dağıtırken tam olarak istediğiniz özelliktir.
Model, yapılandırmaya bağlı olarak 131K ile 512K token arasında değişen bağlam pencerelerini destekler. Referans olarak, 512K token yaklaşık olarak 1.000 sayfa bir kitabı tek bir geçişte işlemeye eşdeğerdir.
OpenBMB, MiniCPM5-2B'yi AMD, Intel, MediaTek ve Qualcomm çipleri için optimize etti.
Yetenek yönünden, ekip kodlama, matematik, uzun bağlam anlama, araç kullanımı ve ajan tabanlı iş akışları kapsamında parametre aralığı içinde en ileri düzeyde performans sağladığını iddia ediyor.
Modelin eğitimi, pekiştirmeli öğrenme uyumu ve OpenBMB tarafından yüksek kaliteli trajektöriler olarak tanımlanan, modelin karmaşık, sıralı karar verme işlemlerini nasıl yönettiğini geliştirmeye yönelik teknikler içerdi.
MiniCPM soyu
MiniCPM5-2B, bir geçmişe dayanmaktadır. Önceki versiyonu MiniCPM5-1B, daha önce Yapay Analiz Endeksi'nin bir önceki versiyonunda 17,9 puan alarak 2 milyar parametreden küçük modeller arasında birinci pozisyonu elde etti.
İki model arasındaki puan farkı, 1B sürümü için 17,9 ve 2B sürümü için 15, endeks yöntemindeki değişimleri yansıtmaktadır, geriye doğru bir adım değildir. 4.2 sürümünün özel test setlerine ve yeni değerlendirme kategorilerine daha fazla bağımlılığı, sürümler arasında puanların doğrudan karşılaştırılabilir olmadığını anlamına gelmektedir.
Cihazda AI için bunun ne anlama geldiğini
Küçük modeller için rekabet ortamı kalabalıklaşıyor. Meta'nın Llama serisi, Microsoft'un Phi modelleri ve Google'ın Gemma varyantları tümü benzer parametre aralıklarında rekabet ediyor. MiniCPM5-2B'nin 4B altı kategorisindeki performans liderliği dikkat çekici, ancak performans liderliği ve gerçek dünya faydası her zaman aynı hızda ilerlemiyor.
Modelin iddia edilen performansının bağımsız doğrulanması henüz kamuoyuna açıklanmamıştır. Yapay zeka performans ölçümünde, sonuçların üçüncü taraf tarafından tekrarlanabilmesi, bir basın açıklaması ile kanıtlanmış bir yetenek arasındaki farktır.
