“En güçlü model”in raf ömrü kısalıyor.Yazan: Defokyo
Bir ay içinde, 9 adet üst düzey model aynı anda piyasaya sürüldü, bu büyük modeller endüstrisinde yaygın değildir.
İlk günlerde Tencent HuanYuan Hy3'ün resmi sürümü açık kaynak olarak yayınlandı, son günlerde Anthropic Claude Opus 5'i duyurdu; bu süre içinde Kimi K3, Qwen3.8-Max önizleme sürümü ve Grok 4.5 gibi modeller sırayla ortaya çıktı. Temmuz, son bir yılın nadir görülen bir yayın zirvesi oldu.

Her şirket farklı zaman noktaları seçti. Bazı üreticiler rakip güncellemelerin ardından aralıkları takip ederek yayınladı, bazıları Dünya Yapay Zeka Konferansı öncesi ve sonrası sırasında ortaya çıktı, bazıları ise fiyat ayarlamalarıyla rekabeti yanıtladı.
Ancak Temmuz, sadece model yayınlarının sayısı açısından değil, bu yayın dalgasının yansıttığı iki değişiklik açısından da dikkat çekiyor.
Birincisi, modeller arasındaki yetenek farkı daralmaktadır. Artificial Analysis'ın en son genel akıllılık endeksi, öncü modeller arasındaki puan farkının açıkça daraldığını göstermektedir. Sürüm hızla güncellenirken, "en güçlü model" pozisyonunun uzun süre korunması giderek zorlaşmaktadır ve tüm taraflar tek bir boyutta mutlak öncülük peşinde değil, farklı görevlerde avantaj aramaya başlamıştır.
İkinci olarak, açık kaynak modeller birinci gruba girmeye başlıyor. Temmuz'da yayınlanan yeni modeller arasında Tencent Hunyuan Hy3 ve Kimi K3 gibi modeller, ağırlıkları açık hale getirerek (açık model parametreleri, geliştiricilerin indirip kendi sunucularında dağıtmasına izin veriyor). Bunlardan Kimi K3, Code Arena ön uç programlama sıralamasında GPT-5.6 Sol ve Claude Fable 5'i geçerek birinci oldu. Geçtiğimiz iki yıl boyunca açık kaynak modeller genellikle kapalı kaynak modellerin peşinde koşanlar olarak görülüyordu; ancak bu rekabet döngüsü, açık kaynak modellerin bazı geliştirme senaryolarında kapalı kaynak modellerle doğrudan rekabet etmeye başladığını gösteriyor.
Peki, bu ayın yoğun yayınları neleri değiştirdi ve ne anlama geliyor?
01. Artık sadece kimin daha akıllı olduğuna bakılmıyor
Geçtiğimiz yıllarda büyük modeller endüstrisi, kimin bilgi yelpazesi daha geniş ve kimin yanıtları daha doğru olduğuna odaklanmıştı. Ancak şimdi rekabet boyutu değişti.
Bu turda kodlama becerisi en belirgin rekabet alanı haline geldi.
OpenAI, programlama ve karmaşık muhakeme yeteneklerini güçlendirmeye devam ediyor ve Codex ekosistemini genişletmeye devam ederek geliştirici kullanıcıları araçlarla bağlamayı hedefliyor. Anthropic, kod anlayışı ve güvenlik denetimi üzerine odaklanarak geliştiricilerin büyük projelerdeki karmaşık mühendislik sorunlarıyla başa çıkmasına yardımcı oluyor. Grok 4.5 ise hız ve düşük maliyeti vurguluyor ve günlük geliştirme senaryolarını kapsayan AI programlama aracı Cursor ile entegre oluyor.
Büyük model araştırmacısı Yao Yuhang, 'Dingjiao One' a her şirketin programlama yeteneğine büyük yatırım yaptığını ve farkların hızla kapanmakta olduğunu söyledi; örneğin, Kimi K3'ün kodlama yeteneğindeki ilerleme belirgin şekilde başta gelen kapalı kaynak modellerinin seviyesine yaklaşmaktadır.

Kaynak: Pexels
Ajan, her birinin rekabet ettiği başka bir yön. GPT-5.6 Sol, Codex ile otomatik programlama keşfetmektedir; Opus 5 uzun vadeli görev yürütme üzerinde vurgu yapmaktadır; Kimi K3, karmaşık görevleri tamamlamak için sürekli çalışabilme yeteneğini sergilemektedir; Tencent HuanYuan Hy3 ise WeChat ekosistemiyle entegre ederek ajan uygulamalarını araştırmayı amaçlamaktadır.
Ancak Agentler gerçek iş ortamında hâlâ olgun değil. Bağımsız geliştirici Bei Cheng, şu anda bazı akıllı ajan ürünlerinin eksikliklerinin araç çağırma yeteneği değil, görev zamanlama yeteneğinde olduğunu söylüyor. Örneğin, Codex'in Ultra modu birçok alt ajanı etkinleştirir; farklı alt ajanlar aynı dosyayı tekrar tekrar okur, benzer analizler yapar ve sonuçta Token tüketimi artar, ancak gerçek olarak yapılan iş artmaz. Onun görüşüne göre, ajanların yeteneklerini artırmak sadece alt ajan sayısını artırmakla değil, hangi görevlerin analiz edilmesi değerli olduğunun ve hangi adımların atlanabileceğinin belirlenebilmesiyle mümkündür.
Yao Yuhang'ın görüşü benzer. O da agentlerin şu anda en dikkat edilmesi gereken yön olduğunu düşünüyor, ancak tam olarak olgunlaşmamış durumda. Ona göre, sağlık, finans gibi dikey alanlardaki agenterler hâlâ büyük fırsatlar sunuyor; bir sonraki aşamada fark yaratan faktör, sadece model kapasitesi değil, aynı zamanda agenterin belirli senaryolarda ne kadar kullanışlı olduğu ve müşterilerin ödeme yapmak isteyip istemediği.
Yerel modeller, farklı yeteneklerdeki gelişmelerle bir çıkış noktası arıyor. Kimi K3, uzun bağlam, ön uç programlama ve ürün tasarımı yeteneklerini güçlendirerek, birçok programlama testinde lider pozisyonlara ulaşıp, yurtdışı kapalı kaynaklı başucu modellerine yakın bir seviyeye ulaştı.
Parametre boyutu ile çıkarım verimliliği arasındaki rekabet, başka bir ana hat haline geldi.
Temmuz'da yayınlanan birçok model, trilyon hatta birkaç trilyon parametre aralığına girdi, ancak parametre boyutu artık doğrudan yetenek düzeyiyle eş anlamlı değil. MoE mimarisinin gelişmesiyle, modeller daha büyük parametre kapasitesine sahip olabiliyor ve çıkarım yaparken sadece bir kısmını etkinleştirerek gerçek hesaplama maliyetini düşürüyor.
Endüstri, bu şekilde iki yol oluşturdu: biri, daha büyük parametrelerle daha güçlü yetenekler elde etmek; diğeri, daha küçük etkin parametrelerle lider model düzeyinde bir etki sağlamaktır.
Fiyat, Temmuz model yarışmasının en doğrudan değişkeni haline geldi.
Yabancı üreticiler daha fazla farklılaştırılmış fiyatlandırma stratejisi benimsemiştir. OpenAI, GPT-5.6'yı farklı sürümlere ayırmak suretiyle pazarı daha da incelemeye almış ve kullanıcıların görev karmaşıklığına göre uygun modeli seçmesini sağlamıştır; Anthropic ise yüksek performanslı üst düzey model yolunu korumaya devam ederek Opus serisiyle yüksek değerli geliştirme ve kurumsal senaryoları kapsamaktadır; Grok 4.5 ise düşük fiyat stratejisi izlemekte ve çıktı fiyatı Opus serisinin dörtte biri olacak şekilde Cursor ile entegrasyon yoluyla geliştiricileri çekmektedir.
Yerel üreticiler ise maliyet avantajını daha çok vurguluyor. Geçen altı ayda, birçok yerel model üreticisi API fiyatlarını sürekli olarak düşürerek, düşük maliyetle kullanım engelini azaltmayı ve geliştirici ile kurumsal kullanıcı kitlesini genişletmeyi hedefliyor.
Temmuz'da büyük modeller arasındaki rekabet, tek bir yetenek karşılaştırmasından kod, ajan, parametre verimliliği ve fiyat gibi çok sayıda boyuta genişledi.
02. Kim beklentileri aştı, kimde iki yönlü değerlendirme var?
Önceki nesille karşılaştırıldığında genel değişiklikler, liste performansı ve geliştirici geri bildirimleri doğrultusunda, Temmuz'da yayınlanan modellerin seviyesi üç kategoriye ayrılabilir.
Öncelikle beklentilerin üzerindekileri inceleyelim: Kimi K3, Grok 4.5, Hy3 Karışımı.
En çok dikkat çeken model Kimi K3'tür. Bu model, MoE mimarisini kullanır ve toplam parametre boyutu trilyonlarca seviyesindedir; uzun bağlam, ön uç programlama ve ürün tasarımı yetenekleri özellikle güçlendirilmiştir. Yayınlandığı gün, Kimi K3, Code Arena ön uç programlama sıralamasında 1679 puanla birinci oldu ve önceki nesil Kimi K2.6'nın 18. sıradan 17 basamak ilerleyerek bu başarıyı elde etti. Bir hafta sonra Arena genel sıralamasında ise Kimi K3, ilk kez küresel Top 10'a girdi.
Ancak Kimi K3'ün açıkça belirgin bir kapasite sınırı vardır. Artificial Analysis'ın bilgi güvenilirliği testinde, Kimi K2.6'nın %39 olan illüzyon oranı %51'e çıkmıştır ve çıktı hızı yaklaşık 33 Token/s olup, benzer modellere göre çok daha düşüktür.
Geliştiricilerin gerçek kullanım deneyimleri de bu “tek taraflılığı” doğrulamaktadır. Beicheng, Kimi K3'ün önceki nesile göre gerçekten belirgin bir ilerleme sağladığını, avantajların özellikle ön uç geliştirme, UI tasarımı ve ürün ifadesinde yoğunlaştığını düşünmektedir. Örneğin, web sitesi UI'sini optimize etme veya uygulama arayüzü tasarlama gibi görevlerde Kimi K3 daha iyi ürünler üretmektedir, ancak karmaşık mühendislik görevlerinde performansı istikrarlı değildir.

Kaynak: Pexels
Aynı şekilde ilgi gören bir diğer ürün de Grok 4.5'tir. 9 Temmuz'da yayınlanmasının ardından, Artificial Analysis akıllı endeksinde öne çıkmış ve bazı araç çağırma testlerinde öne çıkmıştır; birçok geliştirici tarafından maliyet-verim oranının yüksek olduğu bir seçim olarak görülmektedir.
Beycheng, Grok 4.5'in en büyük avantajının hız olduğunu düşünüyor; aynı bir talep için Grok 4.5 ile üç beş dakikada bitirilebilirken, GPT-5.6 ile bazen yirmi dakika hatta yarım saat sürüyor ve fiyatın daha düşük olması, hızlı geliştirme ihtiyaçlarında kullanmak için uygundur. Yao Yuhang, Grok 4.5'in programlama yeteneğinin özel olarak optimize edildiğini ve Cursor ile birlikte kullanılmasının genel deneyimi çok iyi olduğunu düşünüyor. Arka planda, SpaceX daha önce Cursor'un ana şirketini olan Anysphere'yi satın alma kararı aldı ve işlem üçüncü çeyrekte tamamlanması bekleniyor; xAI ile Cursor arasındaki veri iş birliğinin, Grok 4.5'in programlama deneyimini optimize etmeye yardımcı olduğu düşünülüyor.
Hy3, verimlilik yolunda bir atılımı temsil eder. Bu modelin toplam parametre sayısı 295B, etkin parametre sayısı ise yalnızca 21B'dir. Bayrak modelinin beşte birinden az parametre boyutuyla, birçok açık referans testinde daha büyük rekabetçi modellere yakın performans gösterir. Ancak SWE-Bench Pro'da Hy3'ün 57,9 puanı, Claude Opus'ün 69,2 puanıyla açık bir fark göstermektedir; bu da karmaşık kod onarım yeteneğinin hâlâ geride kaldığını göstermektedir.
Yao Yuhang, Hy3'ün Tencent'in önceki modellerine kıyasla ilerleme sağladığını, açık kaynak ve küçük boyut tasarımıyla orta ölçekli modeller arasında iyi bir seçenek olduğunu düşünüyor.
İlk sıraya sabitlenmiş ancak şaşırtıcı bir şey sunmayan bir diğer kategori: GPT-5.6 Sol ve Claude Opus 5.
GPT-5.6 Sol ve Claude Opus 5, hâlâ birinci kadroyu koruyor ancak önemli bir değişiklik getirmiyor. GPT-5.6 Sol, karmaşık çıkarım ve ajan programlama yeteneklerini güçlendirdi ve Terminal-Bench (modellerin komut satırı ortamında gerçek görevleri tamamlama yeteneğini test eden bir benchmark) 2.1 testinde %88,8'e ulaştı; Ultra modu ise bu oranı %91,9'a çıkardı. Claude Opus 5 ise karmaşık görevlerdeki üstünlüğünü korumaya devam ediyor ve karmaşık mühendislik, kod anlama ve güvenlik analizi senaryolarında güvenilirliği vurguluyor. Opus 5'in avantajı, Fable 5'e yakın performansa sahip olup fiyatının sadece yarısı olması.
İki model hâlâ birinci grupta, ancak büyük bir atılım sağlamadı.
Beyşehir, GPT-5.6'nın günlük geliştirme ihtiyaçlarının büyük bir kısmını karşıladığını belirtti, ancak özellikle karmaşık sorunlarla karşılaşıldığında Opus 5'i kullanıyor. Ancak daha güçlü yetenekler, daha yüksek maliyetler anlamına da geliyor. Onun için Opus 5, kritik sorunları çözmek için çağrılan bir “uzman” konumunda.
Son olarak, geri bildirimlerin ayrıştığı ve henüz doğrulanmamış bir grup: Gemini 3.6 Flash ve Qwen3.8-Max önizleme sürümleri.
En tipik örnek Gemini 3.6 Flash'tır. Yapay Analiz akıllı indeks listesinde 50 puan alarak önceki nesil 3.5 Flash ile aynı seviyede kalır. Geliştirici topluluğundan gelen genel geri bildirimler, bu neslin önceki nesle göre belirgin bir iyileşme sağlamadığını ve aynı dönemdeki rakiplerden daha düşük performans gösterdiğini göstermektedir. Ancak bazıları, hafif bir model olarak Gemini 3.6 Flash'ın çıktı kalitesinin temel düzeyde yeterli olduğunu düşünmektedir.
Kapdim, bağımsız geliştirici olarak, Gemini 3.6 Flash'ın günlük kullanım deneyiminin iyi olduğunu düşünüyor; programlama yeteneği öne çıkmıyor olsa da, çok modlu anlama hâlâ oldukça etkileyici. Herhangi bir dosya formatını destekliyor ve günlük sohbetlerdeki dil tarzı ve deneyimi birçok rakip üzerinde üstünlük sağlıyor.
Qwen3.8-Max önizleme sürümü Temmuz'da piyasaya sürüldükten sonra model performansı istikrarsız oldu ve pazar geri bildirimleri farklı oldu. Kuzey Şehir'in en büyük algısı, Qwen3.8-Max önizleme sürümünün düşünme derinliğinin yüksek olduğunu ancak bazen uzun süreli akıl yürütme içine girdiğini, "kendini kendi içinde döndürmüş gibi" hissettirdiğini, ancak nihayetinde etkili bir çözüm sunmadığını söyledi. Kapdim ise Qwen3.8-Max önizleme sürümünün beklentilerin altında kaldığını düşünüyor; kendi ön uç estetik değerlendirme setiyle test yaptığı zaman, gerçek yeteneklerin tanıtım ile açıkça farklı olduğunu fark etti. Hâlâ ayarlanan bir önizleme ürünü olarak, nihai performansın doğrulanması için resmi sürümün yayınlanması bekleniyor.
Temmuz ayında tüm boyutlarda önde gelen bir model ortaya çıkmadı, farklı modeller belirli senaryolar etrafında görev bölüşümüne başladı.
Kuzey Şehir örneğinde, görevlere göre araçları seçer: GPT-5.6 günlük geliştirme için, Grok 4.5 hızlı talepler için, Kimi K3 ürün ve ön uç senaryoları için, Claude Opus 5 ise karmaşık sorunlar için kullanılır. Kapdim'in kombinasyonu farklıdır; planlama için Claude'nin Fable 5 veya Opus 5 modellerini kullanır, ardından GPT-5.6 Sol ile yürütür.
03. Yayınlar giderek hızlanıyor, açık kaynak ile kapalı kaynak arasındaki tartışma artıyor
Bu yoğun yayın dalgasının ardında, modelin neden giderek daha hızlı evrim geçtiğini, neden tüm bunların Temmuz ayında yoğunlaştığını ve açık kaynak kodun mevcut iş modellerini nasıl etkileyeceğini analiz etmeye değer.
Öncelikle, model güncellemelerinin yöntemi değişiyor. Geçmişte, büyük modellerin yeteneklerindeki ilerleme, daha büyük ölçekli modelleri yeniden eğitme yoluyla sağlanıyordu; bu süreç uzun sürer ve maliyetliydi. Ancak pekiştirme öğrenimi, sonrası eğitim (temel modelin eğitimi tamamlandıktan sonra ince ayar ve pekiştirme öğrenimi gibi yöntemlerle model performansının devam eden optimizasyonu) gibi teknolojilerin olgunlaşmasıyla, model yükseltmeleri artık eğitim sonrası optimizasyona daha çok dayanmaya başlamıştır.
Yao Yuhang, '定焦One' a, son iki yıl içinde model yayın hızının açıkça arttığını, bunun önemli bir nedeninin ise sektörün daha olgun bir sonrası eğitim yöntemlerini kazanması olduğunu söyledi. Şimdi birçok modeldeki iyileştirmeler, yeni bir model eğiterek değil, mevcut temel modeller üzerinde强化 öğrenme, kendi kendine yineleme gibi yollarla kapasiteyi artırarak sağlanmaktadır.
Bu, model yarışmasının döngüsünün kısalma anlamına gelir. Geçmişte, öncü bir model birkaç ay boyunca avantajını koruyabilirdi; şimdi, sürüm güncellemeleriyle elde edilen avantaj penceresi sadece birkaç hafta olabilir. Yayın hızı bunu takip edemiyorsa, yeni sürümlerle çok hızlıca geçilir. Üreticiler için, model yayınlamak sadece bir teknik gösteri değil, yayın zamanlaması da rekabetin bir parçası haline gelmiştir.

Kaynak: Pexels
İkinci olarak, Temmuz, birden fazla önemli etkinliğin çakıştığı bir dönemdir. Yerel üreticiler için, Dünya Yapay Zeka Konferansı (WAIC) Temmuz'da düzenlenir ve üreticiler bu dönemde model yayınlamaya ve teknoloji ilerlemelerini sergilemeye odaklanır. Yabancı üreticiler için ise birçok önde gelen şirket, geliştirici ekosistemi ve ticari rekabette avantaj elde etmek amacıyla bu dönemde modellerini günceller.
Ayrıca, endüstrideki rekabet kuralları değişiyor. Modelin yetenekli olması artık tek hedef değil; rekabet, modelin nasıl kullanıldığına ve gelire nasıl dönüştürüldüğüne kadar uzanıyor.
Bu, neden açık kaynak ve kapalı kaynak tartışmalarının Temmuz'da yeniden ısındığını açıklıyor. Uzun süredir açık kaynak modeller ile kapalı kaynak modeller arasında bir performans farkı vardı. Ancak bazı açık kaynak modellerin birinci gruba girmesiyle daha gerçekçi bir sorun ortaya çıktı: Yüksek performanslı modeller ücretsiz elde edilebiliyorken, model şirketlerinin API çağrıları ve abonelik gelirleri yönlendirilir mi?
Açık kaynak yanlıları, açık ağırlıkların teknolojik engelleri düşürerek daha fazla şirket ve geliştiricinin AI yeniliğine katılmasını sağlayacağını düşünüyor. Açık kaynak, teknoloji sağlayıcılarının bir kısmını çıkarımdan vazgeçerek ekosistemi geliştirmek anlamına gelir; ancak kapalı kaynak taraftarları, kullanıcılarının açık kaynak modeller tarafından çekileceğini endişe ediyor. Anthropic gibi şirketler, model yetenekleri arttıkça, açık ağırlıkların güvenlik riskleri yaratabileceğini ve daha katı bir yönetimi gerektirdiğini düşünüyor.
Bu tartışmanın arkasında aslında farklı şirketlerin çıkarları yer alıyor. NVIDIA gibi altyapı şirketleri için modelin açık olması, daha fazla dağıtım talebi ve daha büyük bir hesaplama gücü pazarı anlamına geliyor. OpenAI, Anthropic gibi model şirketleri için ise kapalı kaynak modeli, API çağrısı ve abonelik gelirlerini korumayı sağlıyor. Ancak diğer bir yön de göz önünde bulundurulmalı: açık kaynak, gerçekten dağıtım talebini genişletir, ancak parametre verimliliği arttıkça, birim görev başına hesaplama gücü tüketimi de azalabilir ve hesaplama gücü pazarındaki artış, modelin açık olma düzeyiyle aynı oranda olmayabilir. Yerel üreticiler için, ağırlıkların açık olması sadece bir teknik seçim değil, aynı zamanda geliştirici ekosistemi, bulut hizmetleri ve sonraki ticarileştirme girişimleri için bir fırsat kazanma mücadelesidir.
Temmuz sonrası büyük modeller arasındaki rekabet devam edecektir. Geliştirici topluluğu, DeepSeek V4 resmi sürümünün, Fable 5.1'in ve GPT-6'nın Ağustos'ta sırayla yayınlanacağını genel olarak bekliyor.
Model yetenek farkları daralıyor ve yalnızca daha güçlü bir model yayınlamak, uzun vadeli bir avantaj oluşturmak için giderek daha zor hale geliyor. Sonraki izlenecek noktalar şunlar: DeepSeek V4 resmi sürümünün açık kaynak modellerinin yetenek üst sınırını nereye taşıyacağı, API fiyatlarının devam edip etmeyeceği, agentlerde kararlı ödeme senaryolarının ortaya çıkıp çıkmayacağı ve açık kaynak modellerinin daha fazla şirketin özel dağıtımına girebilip giremeyeceği. Bu soruların cevapları, listelerdeki sıralamalardan daha fazlasını bu çatışmanın gerçekten neyi değiştirdiğini açıklayacaktır.
*Banner resmi Pexels'den alınmıştır.
