Meta, Muse Spark 1.3'ü tanıttı, AI performans testlerinde rakiplerini geride bıraktı

icon MarsBit
Paylaş
AI summary iconÖzet
Meta, Gemini 3.8 Flash ve GPT-5.6 Sol’u ana performans testlerinde geçerek Muse Spark 1.3 adlı bir AI modeli piyasaya sürdü. Meta’nın Süper Zeka Laboratuvarı tarafından geliştirilen bu model, DeepSWE v1.1’de 75,4 puan aldı ve daha düşük token kullanımı ile daha düşük fiyat sunuyor. Meta’nın Baş AI Ofisleri Alexandr Wang, bunu 24/7 AI ajanlarına doğru önemli bir adım olarak tanımladı. Bu AI + kripto haber güncellemesi, verimlilik kazançlarının benimsenmesiyle yeni bir token listeleme potansiyelini vurguluyor.

Çok fazla.

Eylül sadece 3 gün geçti ve zaten beş ileri model yayınlandı!

Anthropic'ın Fable 5.1 ve Mythos 5.1'i, Google'ın Gemini 3.8 Flash ve Cyber'ı, Meta'nın Muse Spark1.3'ü... RSI, kesinlikle geldi.

Dün gece, Google'ın Gemini 3.8 Flash hafif sınıfın efendisi haline gelirken, Meta hemen meydan okumaya başladı.

Zuckerberg, X üzerinde resmi olarak duyuruyor: Muse Spark 1.3 bugün resmen lanzedir; öncü performansıyla neredeyse ölçüsüz derecede ucuz bir deneyim sunar. Bu, programlama ve ajan çalışmalarında şimdiye kadar gerçekleştirdiğimiz en büyük ilerlemedir!

Ajan

Meta Süper Zeka Laboratuvarı'nın lideri Alexandr Wang, bu "patlayıcı" adımın temel silahını açığa çıkarmak için üç adet X gönderdi.

O, Muse Spark 1.3'ün Muse Spark 1.2'ye kıyasla geçersiz tur sayısını azalttığını, araç çağrısı sayısında %20 azalma ve token tüketiminde %25 azalma olduğunu, uzun dönemli görevlerde ihtiyaçları daha iyi koruduğunu belirtti: "Kullanıcılar bu sıçramayı açıkça hissedecek."

Ajan

Muse Spark 1.3 yayınlandığında, dün gece yayınlanan Gemini 3.8 Flash biraz geride kaldı.

Run split gösteriyor, bu Muse Spark 1.3 yükseltmesi daha büyük.

Bu, GPT-5.6 Sol ve Fable 5'in performansını aşmanın yanı sıra, Max çıkarım gücü altında Artificial Analysis zeka indeksi 62 puana ulaşmış ve şu anki ilk gruba tamamen girmiştir.

Ajan

Beş ay içinde, Meta zaten 4 Muse Spark sürümünü güncelledi.

Alexander, Google'u alay ediyor: "Başka modellerin egzoz gazını emiyor"

Son zamanlarda AI'nın ilk kadrosu oldukça kalabalık. GPT-5.6 tahtında oturuyor, Fable 5.1 hızla yükseliyor ve Gemini 3.8 Flash kırmızı ışıkta geçiş yapıyor.

Muse Spark 1.3'ün çıkışı, herkesin planını alt üst etti.

DeepSWE v1.1 benchmarkinde modelin gerçek uzun menzilli programlama yeteneğini en iyi şekilde yansıtan testte, Muse Spark 1.3, Opus 5 ve GPT-5.6 Sol'u doğrudan geçerek, yeni çıkan Gemini 3.8 Flash'ı da arkada bırakarak şu ana kadar en yüksek puanı aldı.

Muse Spark 1.3: 75,4 puan

Claude Opus 5: 74,0 puan

GPT-5.6 Sol: 73,0 puan

Ajan

Ayrıca, diğer birkaç temel geliştirici ölçütünde de Muse Spark 1.3, dikkat çekici bir performans sergiliyor.

SWEAtlas CodeBase QnA'da 59,4 puan alarak GPT-5.6 Sol ve Opus 5'i geçti.

Terminal-Bench 2.1, 88,8 puan aldı.

MRCR 512K-1M üzerinde 98,1 puan elde etti! (Karşılaştırma olarak, GPT-5.6 Sol bu alanda sadece 73,8 puan aldı, tamamen ezici bir fark.)

Ajan

Agent yetenekleri açısından, JobBench, OSWorld gibi testlerde Opus 5 ile sadece birkaç yüzde farkla hemen hemen en前沿 seviyeye ulaşmıştır.

Ajan

Artificial Analysis üzerinde Muse Spark 1.3, Gemini 3.8 Flash'ı açıkça geride bırakıyor.

Akıllı indekste 62 puan alarak Claude Fable 5 ile eşitlenerek en üst sıralara girdi.

Ajan

Geliştiricilerin en çok dikkat ettiği maliyet açısından, Muse'nin girdi maliyeti Fable 5'e göre 8 kat daha düşük, çıktı maliyeti ise neredeyse 12 kat daha düşük, maliyet-verim oranı maksimum seviyede.

Bu kadar parlak performans karşısında Meta'nın Baş Yapay Zeka Görevlisi Alexandr Wang, şöyle dedi: "Artificial Analysis akıllı endeksinde, Gemini hiçbir şey değil, sadece diğer modellerin araba egzoz gazını soluyor."

Google gerçekten düşmüş.

Ajan

Bazıları şaka yaparak şöyle diyor: “Google dört ayda dört Gemini Flash sürümü çıkarttı, Meta ise beş ay içinde dört Muse Spark⁺ sürümünü aynı anda geliştirdi. Ancak Google birkaç saat öne geçtikten hemen sonra Meta tarafından geçiştirildi, bu senaryo çok etkileyici.”

Ajan

Az, Daha Fazlasıdır: 1 Dolarla 2 Saatlik Performans Canavarı

Yüksek performans elbette etkileyici, ancak günümüzün AI dünyasında geliştiricileri gerçekten heyecanlandıran, kullanışlı ve ucuz olmaktır.

Muse Spark 1.3, hem hızlı hem de özellikle tasarruf sağlayan bir cihaz olduğu için maliyet-verim oranı açısından en iyi seçenek olarak bilinir.

Alexandr Wang'ın söylediğine göre, Muse Spark 1.3 'çok ucuz', 'öncü performans, maliyet sadece küçük bir kısmını oluşturuyor'.

Ajan

Ajan

Tamamen önceki büyük modellerin "büyük kuvvetle mucize yapmak, parametreleri çılgınca biriktirmek" yolundan farklı olarak, eksiltme yapmıştır.

Uzun döngülü programlama ve daha iyi komut uyumu için Muse Spark 1.3, gereksiz etkileşim döngülerini azaltmak ve çıktıları daha öz hale getirmek amacıyla özel olarak eğitildi.

Ajan

Daha akıllı ve temiz hale geldi, kod stili daha temiz, gereksiz sözler azaldı.

Bu çıkarma işleminin doğrudan sonucu, maliyetlerde dik bir düşüş oldu.

Aşağıda oldukça etkileyici gerçek bir test örneği yer almaktadır.

Geliştirici @SPAC89, Muse Spark 1.3 Ultra Contributor modunu Fable 5.1 xHigh ile karşılaştırdı.

Ajan

Verdiği Prompt'ta, bağımsız jüri puanı 9,5/10'in altında kalırsa, akıllı sistemin kodu iyileştirmeye ve yeniden denemeye devam etmesi zorunlu bir "kendi kendini geliştirme kuralı" bulunmaktadır.

Bu iki model yaklaşık iki saat boyunca çalıştı ve sonuçlar şaşırtıcıydı.

Muse Spark 1.3, tamamen yorulmayan bir süper çalışan gibi, 20 tur kendini geliştirme döngüsü gerçekleştirdi ve her seferinde 3 akıllı ajan başlattı—bu, 2 saat içinde 60'tan fazla ajan çalıştırması demektir.

Ancak bu son derece büyük ve karmaşık uzun mesafeli akıl yürütme görevini tamamlamak için toplam maliyet 1 doların altında!

Ajan

Bu geliştirici hayranlıkla şöyle dedi: “Bu tamamen beklentilerimin dışına çıktı, bu şey aslında bir sanat eseri!”

Makro fiyatlandırmada, Meta büyük bir niyet gösterdi. Yeni model, milyon token girdi başına 1,25 dolar ve çıktı başına 4,25 dolar fiyatını korudu.

Ajan

Fiyatlandırma açısından, Muse Spark 1.3'ün katkıda bulunanlar sürümü olan "muse-spark-1.3-contributor", yurt dışı modellerin fiyat alt sınırını oluşturuyor. (Bu, verilerin Meta ürünlerini geliştirmek için kullanılması anlamına gelir.)

Ajan

Codedamn kurucusu ve geliştiricisi Mehul Mohan şöyle diyor:

Muse Spark 1.3'ün katkı katmanı fiyatlandırması gerçek dışı kadar abartılı, bu ABD AI laboratuvarlarının « DeepSeek Fiyatlandırma anı.

Ajan

Artificial Analysis verilerine göre, aynı zeka seviyesinde (59 puanın üzerinde) bulunan modeller arasında Muse Spark 1.3'ün tek görev maliyeti sadece 0,55 dolar olup, kesinlikle en iyi çözüm.

Karşılaştırmada, aynı zeka puanına (61) sahip Grok 4.6'nın maliyeti 0,94 dolar, GPT-5.6 Sol'un maliyeti 0,95 dolar, Claude Opus 5 ise 1,23 dolar olarak belirlenmiştir.

Hatta geliştirici Kartik, Muse Spark 1.3'ün Sol ve Fable gibi bir "döngüsel derinlik" akıl yürütme yeteneğine sahip gibi göründüğünü belirtti.

Bu, cevabı anında üretmez, içsel olarak mantıksal çıkarımlar yapar ve bu da token verimliliğini inanılmaz derecede artırır.

Ajan

Alexandr Wang'ın hızla yükselişi, küçük Zuck'un nihai hevesi

Muse Spark 1.3'ün ortaya çıkışı, arkasındaki işlemcilerden ayrılamaz.

Yılın Temmuz ayında Meta, Muse Spark 1.1'i 1M uzunlukta uzun bağlam ve bilgisayar işlemleriyle tanıttı.

İki aydan kısa bir sürede, 1.3 sürümü uzun menzilli kodlama yeteneğini GPT-5.6 seviyesine çıkardı.

Bu kadar hızlı yineleme, Alexandr Wang'ın Meta Süper Zeka Laboratuvarı'nı devralmasının sonucudur.

Onların nihai hedefi nedir? Zuck ve Alexandr Wang'ın sürekli vurguladığı iki kelime: «Ajan» ve «Yok sayılacak kadar ucuz».

Yani Meta, bir sonraki ASI fırsatı olan "Ajan Mühendisliği"ne bakıyor.

Meta AI lideri Alexandr Wang, Axios röportajında tüm kullanılabilirlik iyileştirmelerinin, Mark Zuckerberg'in defalarca vurguladığı, 7×24 saat boyunca faal bireysel ajanlar oluşturmak amacıyla yapıldığını açıkça belirtti.

Ajan

Bir yapay zeka aracının e-postaları 24 saat işlemesine, kod yazmasına ve veri analizi yapmasına izin vermek için iki koşul gereklidir.

1. Aşırı akıllı ve kararlı: Uzun diyalog zincirlerini yönetebilmeli ve birden fazla iş akışını paralel olarak işleyebilmelidir.

Talimatlar belirsiz olduğunda, aktif olarak soru sormalı; engellerle karşılaştığında insanlardan yardım istemeli; kritik işlemler yapmadan önce onay vermelidir. En önemlisi, hayal kurmamalıdır.

2. Aşırı ucuz: Eğer bireysel akıllı ajanın bir gün boyunca çalıştırma maliyeti onlarca dolar olursa, bu asla azınlığın oyuncağı kalacaktır.

Muse Spark 1.3'ün ortaya çıkışı, temelde 7×24 saat kişisel ajanlar için yol açmaktadır.

Bu, olgun bir deneyimli mühendis gibi, bir hedef verdiğinizde kendi kendine plan yapar, kendi kendine hataları düzeltir ve teslim eder.

Bu amaçla, Pekin Üniversitesi mezunu ve Meta araştırmacısı Sun Zhiqing, Meta ekibinin önceki Avokado (avocado) modelini tekrar eğiterek daha iyi bir test ölçeklendirmesi sağladığını açıkladı.

Ajan

Şölenin ardında: "Sıralamayı dolandırıldık mı?"

Ancak Muse Spark 1.3 aynı şekilde eleştirildi.

Ünlü AI kurumu BridgeMind, düşündürücü bir açıklama yaptı:

Gemini 3.8 Flash ve Muse Spark 1.3 bugün aynı anda yayınlandı. İkisi de performans testlerinde çok iyi görünüyor.

Muse Spark 1.3, şu anda Fable 5 ile akıllı endekste eşit durumda... Heyecanlanmak istiyorum. Ama hissetmedim.

Çünkü bu ayın AI yayınlamaları birbirinin aynısı, puanlar yükseldi ama gerçek dünya deneyiminde hiçbir ilerleme kaydedilmedi.

Bu hayal kırıklığı verici. Her hafta benchmarklara olan güvenim azalıyor ve benchmarkları oynayan laboratuvarlara olan güvenim ise neredeyse tamamen yok.

Ajan

Bu cümle, mevcut büyük model endüstrisinin acı noktalarını tam olarak hedefliyor.

Bazı kullanıcılar, Muse Spark 1.3 ve Gemini Flash 3.8z modellerini arka plan 3D kısıtlamaları altında stres testine tabi tuttu ve iki modelin de gerçek kapasiteleri ortaya çıktı:

Muse Spark 1.4 o kadar iyi değil, Gemini Flash 3.5 ise sadece sıralamada yer almak için çalışıyor.

Ajan

Şu anda, çeşitli laboratuvarlar "puan alma amacıyla eğitim" döngüsüne girmiş durumda. Bir model yayınlandığında, mutlaka rakipleri ezip geçen radar grafikleri ve sıralama ekran görüntülerine eşlik eder.

DeepSWE, Tau3-Bench, GPQA, herkesin çılgınca “soru çözmeye” yöneldiği hedefler oldu.

Muse Spark 1.3 de kusuru ortaya çıkardı.

Artificial Analysis'ın derin raporunda bunun biraz gerileme olduğunu da görebiliyoruz.

Örneğin, AA-Omniscience testinde xhigh ve max sürümlerinde düşüş yaşanmıştır. Nedeni, «katılım oranı»nın artmasıdır—belirsiz olduğunda, yanlış bilgi vermek yerine cevap vermeme eğilimindedir.

Bu, illüzyon oranını düşürdü, ancak mutlak bilgi birikiminin puan artış kadar aşırı olmadığını da gösteriyor.

Ajan

Büyük modelin ikinci yarısında tam olarak neye göre karşılaştırılıyor?

Bugün Muse Spark 1.3 ve Gemini 3.8 Flash'in yayınlanmasından şu çıkarımları yapabiliriz.

Öncelikle, temel modelin "parametre avantajı" zirve yapmaktadır.

Parametre boyutunu genişleterek zekâyı artırmak yolunda marjinal fayda giderek azalmaktadır.

Gelecekte, sistem mimarisinde "döngüsel derinlik" gibi bir çıkarım mekanizması getiren ve araç çağrısında uçuruma kadar "azaltma" yapan, gerçek bir deneyim sıçraması elde edecektir.

Ayrıca, "Ajan Mühendisliği" kazanın anahtarıdır.

Büyük modeller arasındaki rekabet, "kim daha iyi konuşuyor"dan "kim daha çok iş yapıyor"a doğru kaymıştır.

Geleceğin temel engeli tek bir performans puanı değil, çok düşük maliyetle uzun vadeli görevlerin gerçek hayatta başarıyla uygulanabilme kapasitesidir.

1 doların altında 60 deneme döngüsünü tamamlayan Muse Spark 1.3 gibi modeller, iş modellerini tamamen yeniden şekillendirecek.

Kaynaklar:

https://x.com/SPAC89/status/2095284969614475744

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/AIatMeta/status/2095234385129963666?s=20

https://artificialanalysis.ai/zh/models/muse-spark-1-3

https://x.com/EdwardSun0909/status/2095236891574780275?s=20

Bu yazı, WeChat hesabı "Yeni Akıl" tarafından hazırlanmıştır, yazar: ASI Vahiyleri

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.