Çok fazla.
Eylül sadece 3 gün geçti ve zaten beş ileri model yayınlandı!
Anthropic'ın Fable 5.1 ve Mythos 5.1'i, Google'ın Gemini 3.8 Flash ve Cyber'ı, Meta'nın Muse Spark1.3'ü... RSI, kesinlikle geldi.
Dün gece, Google'ın Gemini 3.8 Flash hafif sınıfın efendisi haline gelirken, Meta hemen meydan okumaya başladı.
Zuckerberg, X üzerinde resmi olarak duyuruyor: Muse Spark 1.3 bugün resmen lanzedir; öncü performansıyla neredeyse ölçüsüz derecede ucuz bir deneyim sunar. Bu, programlama ve ajan çalışmalarında şimdiye kadar gerçekleştirdiğimiz en büyük ilerlemedir!

Meta Süper Zeka Laboratuvarı'nın lideri Alexandr Wang, bu "patlayıcı" adımın temel silahını açığa çıkarmak için üç adet X gönderdi.
O, Muse Spark 1.3'ün Muse Spark 1.2'ye kıyasla geçersiz tur sayısını azalttığını, araç çağrısı sayısında %20 azalma ve token tüketiminde %25 azalma olduğunu, uzun dönemli görevlerde ihtiyaçları daha iyi koruduğunu belirtti: "Kullanıcılar bu sıçramayı açıkça hissedecek."

Muse Spark 1.3 yayınlandığında, dün gece yayınlanan Gemini 3.8 Flash biraz geride kaldı.
Run split gösteriyor, bu Muse Spark 1.3 yükseltmesi daha büyük.
Bu, GPT-5.6 Sol ve Fable 5'in performansını aşmanın yanı sıra, Max çıkarım gücü altında Artificial Analysis zeka indeksi 62 puana ulaşmış ve şu anki ilk gruba tamamen girmiştir.

Beş ay içinde, Meta zaten 4 Muse Spark sürümünü güncelledi.
Alexander, Google'u alay ediyor: "Başka modellerin egzoz gazını emiyor"
Son zamanlarda AI'nın ilk kadrosu oldukça kalabalık. GPT-5.6 tahtında oturuyor, Fable 5.1 hızla yükseliyor ve Gemini 3.8 Flash kırmızı ışıkta geçiş yapıyor.
Muse Spark 1.3'ün çıkışı, herkesin planını alt üst etti.
DeepSWE v1.1 benchmarkinde modelin gerçek uzun menzilli programlama yeteneğini en iyi şekilde yansıtan testte, Muse Spark 1.3, Opus 5 ve GPT-5.6 Sol'u doğrudan geçerek, yeni çıkan Gemini 3.8 Flash'ı da arkada bırakarak şu ana kadar en yüksek puanı aldı.
Muse Spark 1.3: 75,4 puan
Claude Opus 5: 74,0 puan
GPT-5.6 Sol: 73,0 puan

Ayrıca, diğer birkaç temel geliştirici ölçütünde de Muse Spark 1.3, dikkat çekici bir performans sergiliyor.
SWEAtlas CodeBase QnA'da 59,4 puan alarak GPT-5.6 Sol ve Opus 5'i geçti.
Terminal-Bench 2.1, 88,8 puan aldı.
MRCR 512K-1M üzerinde 98,1 puan elde etti! (Karşılaştırma olarak, GPT-5.6 Sol bu alanda sadece 73,8 puan aldı, tamamen ezici bir fark.)

Agent yetenekleri açısından, JobBench, OSWorld gibi testlerde Opus 5 ile sadece birkaç yüzde farkla hemen hemen en前沿 seviyeye ulaşmıştır.

Artificial Analysis üzerinde Muse Spark 1.3, Gemini 3.8 Flash'ı açıkça geride bırakıyor.
Akıllı indekste 62 puan alarak Claude Fable 5 ile eşitlenerek en üst sıralara girdi.

Geliştiricilerin en çok dikkat ettiği maliyet açısından, Muse'nin girdi maliyeti Fable 5'e göre 8 kat daha düşük, çıktı maliyeti ise neredeyse 12 kat daha düşük, maliyet-verim oranı maksimum seviyede.
Bu kadar parlak performans karşısında Meta'nın Baş Yapay Zeka Görevlisi Alexandr Wang, şöyle dedi: "Artificial Analysis akıllı endeksinde, Gemini hiçbir şey değil, sadece diğer modellerin araba egzoz gazını soluyor."
Google gerçekten düşmüş.

Bazıları şaka yaparak şöyle diyor: “Google dört ayda dört Gemini Flash sürümü çıkarttı, Meta ise beş ay içinde dört Muse Spark⁺ sürümünü aynı anda geliştirdi. Ancak Google birkaç saat öne geçtikten hemen sonra Meta tarafından geçiştirildi, bu senaryo çok etkileyici.”

Az, Daha Fazlasıdır: 1 Dolarla 2 Saatlik Performans Canavarı
Yüksek performans elbette etkileyici, ancak günümüzün AI dünyasında geliştiricileri gerçekten heyecanlandıran, kullanışlı ve ucuz olmaktır.
Muse Spark 1.3, hem hızlı hem de özellikle tasarruf sağlayan bir cihaz olduğu için maliyet-verim oranı açısından en iyi seçenek olarak bilinir.
Alexandr Wang'ın söylediğine göre, Muse Spark 1.3 'çok ucuz', 'öncü performans, maliyet sadece küçük bir kısmını oluşturuyor'.


Tamamen önceki büyük modellerin "büyük kuvvetle mucize yapmak, parametreleri çılgınca biriktirmek" yolundan farklı olarak, eksiltme yapmıştır.
Uzun döngülü programlama ve daha iyi komut uyumu için Muse Spark 1.3, gereksiz etkileşim döngülerini azaltmak ve çıktıları daha öz hale getirmek amacıyla özel olarak eğitildi.

Daha akıllı ve temiz hale geldi, kod stili daha temiz, gereksiz sözler azaldı.
Bu çıkarma işleminin doğrudan sonucu, maliyetlerde dik bir düşüş oldu.
Aşağıda oldukça etkileyici gerçek bir test örneği yer almaktadır.
Geliştirici @SPAC89, Muse Spark 1.3 Ultra Contributor modunu Fable 5.1 xHigh ile karşılaştırdı.

Verdiği Prompt'ta, bağımsız jüri puanı 9,5/10'in altında kalırsa, akıllı sistemin kodu iyileştirmeye ve yeniden denemeye devam etmesi zorunlu bir "kendi kendini geliştirme kuralı" bulunmaktadır.
Bu iki model yaklaşık iki saat boyunca çalıştı ve sonuçlar şaşırtıcıydı.
Muse Spark 1.3, tamamen yorulmayan bir süper çalışan gibi, 20 tur kendini geliştirme döngüsü gerçekleştirdi ve her seferinde 3 akıllı ajan başlattı—bu, 2 saat içinde 60'tan fazla ajan çalıştırması demektir.
Ancak bu son derece büyük ve karmaşık uzun mesafeli akıl yürütme görevini tamamlamak için toplam maliyet 1 doların altında!

Bu geliştirici hayranlıkla şöyle dedi: “Bu tamamen beklentilerimin dışına çıktı, bu şey aslında bir sanat eseri!”
Makro fiyatlandırmada, Meta büyük bir niyet gösterdi. Yeni model, milyon token girdi başına 1,25 dolar ve çıktı başına 4,25 dolar fiyatını korudu.

Fiyatlandırma açısından, Muse Spark 1.3'ün katkıda bulunanlar sürümü olan "muse-spark-1.3-contributor", yurt dışı modellerin fiyat alt sınırını oluşturuyor. (Bu, verilerin Meta ürünlerini geliştirmek için kullanılması anlamına gelir.)

Codedamn kurucusu ve geliştiricisi Mehul Mohan şöyle diyor:
Muse Spark 1.3'ün katkı katmanı fiyatlandırması gerçek dışı kadar abartılı, bu ABD AI laboratuvarlarının « DeepSeek Fiyatlandırma anı.

Artificial Analysis verilerine göre, aynı zeka seviyesinde (59 puanın üzerinde) bulunan modeller arasında Muse Spark 1.3'ün tek görev maliyeti sadece 0,55 dolar olup, kesinlikle en iyi çözüm.
Karşılaştırmada, aynı zeka puanına (61) sahip Grok 4.6'nın maliyeti 0,94 dolar, GPT-5.6 Sol'un maliyeti 0,95 dolar, Claude Opus 5 ise 1,23 dolar olarak belirlenmiştir.
Hatta geliştirici Kartik, Muse Spark 1.3'ün Sol ve Fable gibi bir "döngüsel derinlik" akıl yürütme yeteneğine sahip gibi göründüğünü belirtti.
Bu, cevabı anında üretmez, içsel olarak mantıksal çıkarımlar yapar ve bu da token verimliliğini inanılmaz derecede artırır.

Alexandr Wang'ın hızla yükselişi, küçük Zuck'un nihai hevesi
Muse Spark 1.3'ün ortaya çıkışı, arkasındaki işlemcilerden ayrılamaz.
Yılın Temmuz ayında Meta, Muse Spark 1.1'i 1M uzunlukta uzun bağlam ve bilgisayar işlemleriyle tanıttı.
İki aydan kısa bir sürede, 1.3 sürümü uzun menzilli kodlama yeteneğini GPT-5.6 seviyesine çıkardı.
Bu kadar hızlı yineleme, Alexandr Wang'ın Meta Süper Zeka Laboratuvarı'nı devralmasının sonucudur.
Onların nihai hedefi nedir? Zuck ve Alexandr Wang'ın sürekli vurguladığı iki kelime: «Ajan» ve «Yok sayılacak kadar ucuz».
Yani Meta, bir sonraki ASI fırsatı olan "Ajan Mühendisliği"ne bakıyor.
Meta AI lideri Alexandr Wang, Axios röportajında tüm kullanılabilirlik iyileştirmelerinin, Mark Zuckerberg'in defalarca vurguladığı, 7×24 saat boyunca faal bireysel ajanlar oluşturmak amacıyla yapıldığını açıkça belirtti.

Bir yapay zeka aracının e-postaları 24 saat işlemesine, kod yazmasına ve veri analizi yapmasına izin vermek için iki koşul gereklidir.
1. Aşırı akıllı ve kararlı: Uzun diyalog zincirlerini yönetebilmeli ve birden fazla iş akışını paralel olarak işleyebilmelidir.
Talimatlar belirsiz olduğunda, aktif olarak soru sormalı; engellerle karşılaştığında insanlardan yardım istemeli; kritik işlemler yapmadan önce onay vermelidir. En önemlisi, hayal kurmamalıdır.
2. Aşırı ucuz: Eğer bireysel akıllı ajanın bir gün boyunca çalıştırma maliyeti onlarca dolar olursa, bu asla azınlığın oyuncağı kalacaktır.
Muse Spark 1.3'ün ortaya çıkışı, temelde 7×24 saat kişisel ajanlar için yol açmaktadır.
Bu, olgun bir deneyimli mühendis gibi, bir hedef verdiğinizde kendi kendine plan yapar, kendi kendine hataları düzeltir ve teslim eder.
Bu amaçla, Pekin Üniversitesi mezunu ve Meta araştırmacısı Sun Zhiqing, Meta ekibinin önceki Avokado (avocado) modelini tekrar eğiterek daha iyi bir test ölçeklendirmesi sağladığını açıkladı.

Şölenin ardında: "Sıralamayı dolandırıldık mı?"
Ancak Muse Spark 1.3 aynı şekilde eleştirildi.
Ünlü AI kurumu BridgeMind, düşündürücü bir açıklama yaptı:
Gemini 3.8 Flash ve Muse Spark 1.3 bugün aynı anda yayınlandı. İkisi de performans testlerinde çok iyi görünüyor.
Muse Spark 1.3, şu anda Fable 5 ile akıllı endekste eşit durumda... Heyecanlanmak istiyorum. Ama hissetmedim.
Çünkü bu ayın AI yayınlamaları birbirinin aynısı, puanlar yükseldi ama gerçek dünya deneyiminde hiçbir ilerleme kaydedilmedi.
Bu hayal kırıklığı verici. Her hafta benchmarklara olan güvenim azalıyor ve benchmarkları oynayan laboratuvarlara olan güvenim ise neredeyse tamamen yok.

Bu cümle, mevcut büyük model endüstrisinin acı noktalarını tam olarak hedefliyor.
Bazı kullanıcılar, Muse Spark 1.3 ve Gemini Flash 3.8z modellerini arka plan 3D kısıtlamaları altında stres testine tabi tuttu ve iki modelin de gerçek kapasiteleri ortaya çıktı:
Muse Spark 1.4 o kadar iyi değil, Gemini Flash 3.5 ise sadece sıralamada yer almak için çalışıyor.

Şu anda, çeşitli laboratuvarlar "puan alma amacıyla eğitim" döngüsüne girmiş durumda. Bir model yayınlandığında, mutlaka rakipleri ezip geçen radar grafikleri ve sıralama ekran görüntülerine eşlik eder.
DeepSWE, Tau3-Bench, GPQA, herkesin çılgınca “soru çözmeye” yöneldiği hedefler oldu.
Muse Spark 1.3 de kusuru ortaya çıkardı.
Artificial Analysis'ın derin raporunda bunun biraz gerileme olduğunu da görebiliyoruz.
Örneğin, AA-Omniscience testinde xhigh ve max sürümlerinde düşüş yaşanmıştır. Nedeni, «katılım oranı»nın artmasıdır—belirsiz olduğunda, yanlış bilgi vermek yerine cevap vermeme eğilimindedir.
Bu, illüzyon oranını düşürdü, ancak mutlak bilgi birikiminin puan artış kadar aşırı olmadığını da gösteriyor.

Büyük modelin ikinci yarısında tam olarak neye göre karşılaştırılıyor?
Bugün Muse Spark 1.3 ve Gemini 3.8 Flash'in yayınlanmasından şu çıkarımları yapabiliriz.
Öncelikle, temel modelin "parametre avantajı" zirve yapmaktadır.
Parametre boyutunu genişleterek zekâyı artırmak yolunda marjinal fayda giderek azalmaktadır.
Gelecekte, sistem mimarisinde "döngüsel derinlik" gibi bir çıkarım mekanizması getiren ve araç çağrısında uçuruma kadar "azaltma" yapan, gerçek bir deneyim sıçraması elde edecektir.
Ayrıca, "Ajan Mühendisliği" kazanın anahtarıdır.
Büyük modeller arasındaki rekabet, "kim daha iyi konuşuyor"dan "kim daha çok iş yapıyor"a doğru kaymıştır.
Geleceğin temel engeli tek bir performans puanı değil, çok düşük maliyetle uzun vadeli görevlerin gerçek hayatta başarıyla uygulanabilme kapasitesidir.
1 doların altında 60 deneme döngüsünü tamamlayan Muse Spark 1.3 gibi modeller, iş modellerini tamamen yeniden şekillendirecek.
Kaynaklar:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
Bu yazı, WeChat hesabı "Yeni Akıl" tarafından hazırlanmıştır, yazar: ASI Vahiyleri
