Meta, 128K Bağlam Desteği ile 30 Milyar Parametreli Muse Glimmer Ajan Modelini Yayınlıyor

iconMetaEra
Paylaş
AI summary iconÖzet
Meta, 30 milyar parametreli, 128K bağlamı destekleyen ve 24 GB GPU cihazlarla uyumlu olan Muse Glimmer adlı çok modlu Ajant modelini yayınladı. Model, Apache 2.0 altında açık kaynaklıdır ve KV Önbellek kullanımını azaltmak için GQA özelliğine sahiptir. Hibrit Yerel-Küresel Dikkat tasarımı kullanır ve çeşitli GPU kurulumları için kuantize edilmiş bir sürümü içerir. Model, görsel ve ekran görevleri için özel bir ViT Algılayıcı Kodlayıcı kullanır ve DFlash bileşenini ekleyerek RTX 5090'da dekodlama hızını üç katına çıkarır. MCP Atlas ve DeepSearch QA gibi benchmarklerde iyi performans gösterir, ancak OSWorld Verified gibi GUI tabanlı testlerde zorluklar yaşar. Küresel kripto politikaları gelişirken, Meta'nın bu hamlesi, AI ve blok zinciri entegrasyonu için zincir üstü haberler sunar.
Meta, 30B parametrelik, 128K bağlam desteği sunan ve 24 GB VRAM cihazlarda çalışabilen çok modalli bir Agent modeli olan Muse Glimmer’ı duyurdu. Model, Apache 2.0 lisansı altında açık kaynaklıdır; GQA kullanılarak KV Cache tüketimi azaltılmış, uzun bağlam hesaplama maliyetini düşürmek için Yerel ve Global Dikkat karışık mimarisi uygulanmış ve farklı VRAM kapasitelerine uyum sağlamak için iki kuantize versiyon sunulmuştur. Görsel modülü, ekran görüntüsü ve ekran bilgilerini işlemek için bağımsız bir ViT Algılama Kodlayıcıya sahiptir; eğitim aşamasında uzun görevlerdeki durum sapmalarını kapsayan On Policy Distillation yöntemi kullanılmıştır. DFlash çıkarım hızlandırma bileşeni, Block Diffusion ile paralel Token tahmini yaparak RTX 5090’da yaklaşık 3 kat daha hızlı dekodlama sağlar. Model, MCP Atlas ve DeepSearch QA gibi Agent benchmark’larında üstün performans gösterirken, OSWorld Verified gibi saf GUI senaryolarında iyileştirme alanları bulunmaktadır.

Yazı yazarı, kaynak: Leifengwang

Dün Meta, Muse Glimmer’i yayınladı. Bu, yaklaşık 30B parametreli, 128K düzeyinde bağlamı destekleyen, araç çağırma, kod yürütme, resim ve ekran bilgilerini işleme yeteneğine sahip çok modlu bir Agent modelidir.

Bu model, Apache 2.0 lisansı altında açık kaynaklıdır ve aynı zamanda iki adet 4bit kantize versiyonu, bağımsız görsel kodlayıcı ve DFlash çıkarım hızlandırma bileşenleri de dahil olmak üzere llama.cpp, MLX, ExecuTorch gibi yerel dağıtım yöntemleri sunar.

30 milyar parametre boyutu ve 128K bağlam bugün için nadir değil gibi görünse de, sorunun temelinde Meta'nın bununla sıradan bir sohbet değil, tam bir yerel Agent çalışma paradigmasi kurmak istemesi yatıyor.

Muse Glimmer, uzun süreli yerel Agent'lar için tasarlanmıştır ve sıkı mühendislik kısıtlamalarıyla karşı karşıyadır: sınırlı 24 GB GPU belleğinde sürekli oluşan ekran görüntülerini işlemek ve onlarca adımlık görev mantığını aynı anda sürdürmek zorundadır. Bir görev onlarca adım çalıştıktan sonra, önceki araç sonuçları, kod günlükleri, sayfa durumları ve çıkarım süreçleri sürekli olarak bağlamda kalır.

Bu anda, sohbet senaryolarında belirgin olmayan birçok sorun hızla büyüyebilir. 128K bağlam sınırlı GPU belleğine nasıl sığdırılır, ekran görüntüsü sayısı arttıkça geçmiş durumlar nasıl yönetilir, araç çağrısı başarısız olduktan sonra model nasıl ilerlemeye devam eder ve büyük miktarda Reasoning Token Decode’u ne kadar yavaşlatır.

Muse Glimmer teknik tasarımı, temel olarak bu sorular etrafında şekillenmiştir. Tüm sorunlara tek bir özellikle dikkat çeken yeni mimariyle çözüm sunmamıştır; bunun yerine Attention, KV Cache, eğitim yöntemi, kuantizasyon ve Decode üzerinde kararlı bir şekilde tercihlerde bulunmuştur.

Eski yerel modellerin "çalışır hale getirilebilir" olduğunu söylüyorsanız, Muse Glimmer'in hedefi "bulutta olduğu gibi kullanışlı ve sürekli çalışabilir" olmaktır.

Bu bölümleri birlikte görmek, Meta'nın bunu şu şekilde neden yaptığını, 30B veya 128K'yi tek başına görmekten daha kolay anlamanızı sağlar.

128K bağlamı 24 GB GPU belleğine nasıl sığdırılır

Muse Glimmer, 52 katmanlı Dense Transformer, 6656 gizli boyut ve 32 sorgu başlığı, ancak yalnızca 2 KV başlığı kullanır.

Dikkat, her katmanı tam olarak bağlamla işlemek yerine, üç Yerel Dikkat ve bir Küresel Dikkat döngüsü kullanır.

Local Attention yalnızca yakındaki 2048 token’ı işler, Global Attention ise daha uzak mesafelerdeki bilgi alışverişinden sorumludur.

Bu iki tasarım aslında uzun bağlam maliyetini aynı anda artırıyor. Model yeni bir Token ürettiğinde, önceki Token'ların Key ve Value'sunu, yani KV Önbelleğini önbelleğe alır. Bağlam ne kadar uzunsa, bu kısım o kadar fazla yer kaplar.

Muse Glimmer'in her katında yalnızca 2 KV Başlığı vardır ve her başlığın boyutu 128'dir. BF16 ile yaklaşık hesaplandığında, bir Token'in bir katındaki KV yaklaşık 1024 Bayt yer kaplar.

Eğer 52 katman tamamen 128K bağlam olarak saklanırsa, KV önbelleği yaklaşık 6,5 GiB gerektirir. Ancak Muse Glimmer aslında 39 yerel katman ve 13 küresel katmana sahiptir. Yerel katmanlar yalnızca yaklaşık 2048 belirteçlik kayan pencereyi korumalıdır; yalnızca küresel katmanlar tam uzun bağlamı saklamalıdır.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

Aynı şekilde tahmin edildiğinde, KV Önbelleği yaklaşık 1,7 GiB seviyesine düşebilir. Bu, resmi olarak duyurulan çalışma zamanı GPU belleği değil, yalnızca açık arşitektür parametrelerine dayalı teorik bir tahmindir; ancak bu yapı neden böyle tasarlandığını açıkça göstermektedir.

Eğer 2 KV başlığı yerine geleneksel MHA gibi 32 başlık için ayrı ayrı KV saklansa, aynı koşullarda KV önbelleği teorik olarak yaklaşık 16 kat büyüyecek ve doğrudan 20 GiB'in üzerine çıkacaktır.

Tek başına KV önbelleği, 24 GB'lık bir grafik kartını zaten aşıyor. Burada aslında iki yöntem kullanılıyor. GQA, her bir Token için kaç KV'nin saklanması gerektiğini azaltır; Local Attention ise tam KV'lerin uzun süre saklanması gereken katman sayısını azaltır.

Bu adımı tamamladıktan sonra ağırlık kuantizasyonu anlam kazanır. Muse Glimmer'in K Quant 17GB ağırlığı yaklaşık 16,8 GB, görsel modül yaklaşık 1,4 GB, DFlash ise yaklaşık 1,6 GB'dır; bu bileşenlerin toplamı zaten 20 GB'a yakındır. Bu sürüm 24 GB bellek kapasitesine sahip cihazlar için tasarlanmıştır; diğer bir 20 GB'lık Dynamic K Quant sürümü ise 32 GB cihazlar için yöneliktir.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

İki kuantizasyon sadece dosya boyutu açısından farklı değil. Meta'nın sunduğu 15 benchmark ortalama doğruluk kaybı arasında, Dynamic K Quant yaklaşık %0,2, K Quant 17 GB ise yaklaşık %1,0.

Yani, 24 GB sürümü, bellek kullanımını daha da azaltır ve daha az yer kaplar, ancak biraz daha belirgin bir performans kaybını kabul etmeniz gerekir. 32 GB sürümü ise orijinal modelin performansını maksimum düzeyde korumayı hedefler.

Muse Glimmer'in 128K bağlamı, bu kombinasyonla sağlanır. Önce Attention ile hesaplama yükü azaltılır, ardından GQA ile KV Önbelleği azaltılır ve nihayetinde nicelleştirme ile model ağırlıkları düşürülür.

Bu çözümün de bir maliyeti vardır. 39 Local katmanı yalnızca yakındaki 2048 Token'e doğrudan erişebilir; uzak mesafedeki bilgiler Global katmanı aracılığıyla yayılmalıdır. Bu nedenle 128K girişi yapabilmek, tamamen 128K'yi istikrarlı bir şekilde kullanabilmekle aynı şey değildir.

Meta'nın Beam128K sonucu, yerel ve küresel karışık yapının hala iyi bir uzun mesafeli bilgi kullanımına sahip olduğunu gösteriyor, ancak bu yapı Uzun Bağlamı çözüyor, uzun vadeli Belleği değil. Hangi bilgilerin saklanması gerektiği, hangilerinin geçersiz hale geldiği ve durumun ne zaman güncellenmesi gerektiği, hâlâ Agent Runtime tarafından işlenmelidir.

Bu sorun, görsel ajana daha belirgin şekilde yansır.

128K sonsuz alan değil

Muse Glimmer, ek olarak 1,8 milyar parametreli bir ViT G 14 Algılayıcı Kodlayıcıya sahiptir ve ekran görüntülerini, web sitelerini, grafikleri ve belgeleri işlemek için kullanılır. Bir resim en fazla 4096 görsel belirtece dönüştürülebilir.

Şu anda metin ve resim girişi ve metin çıktısıdır, tüm modallikleri aynı üretme modeline sokmaz.

Agent iş akışında, bu görsel yetenek ana olarak ortam durumunu okumakla sorumludur. Bilgisayar Kullanımı Agenti, mevcut ekranı görür, sayfa, düğmeler ve metinlerin konumlarını belirler, ardından bir işlem gerçekleştirir. Sayfa değiştiğinde, yeni bir ekran görüntüsünü okur ve bir sonraki adımı kararlaştırır.

Görsel girdi, bağlamda sürekli olarak girer. Eğer onlarca adımlık bir görevdeki tüm ekran görüntülerini tamamen korursanız, 128K bile olsa bağlam hızla Görsel Token’larla dolacaktır. Eski ekran görüntülerinin bazıları mevcut durumla çakışabilir. Sayfa değişti, ancak önceki düğmeler ve pencereler hâlâ bağlamda kalıyor; modelin hangisinin en son durum olduğunu ekstra olarak belirlemesi gerekir.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

Meta, OSWorld Doğrulanmış Değerlendirmesi'nde Screenshot Geçmişini sonsuza kadar saklamıyor, sadece en son bazı ekran görüntülerini bırakıyor. Bu, Perception Encoder ve Context Management'ın iki farklı sorun olduğunu gösteriyor.

İlki, mevcut ekranı modelin anlayabileceği bilgiye dönüştürmekten sorumludur, diğeri ise hangi geçmiş durumların değerli olduğunu ve hangilerinin silinmesi gerektiğini belirler. Bu nedenle 128K, durum yönetiminin kaldırılması yerine Agent'e daha büyük bir çalışma alanı sunar.

Ancak agent, çevresiyle sürekli etkileşim kurduktan sonra soru, modelin ne gördüğünden modelin tam olarak ne yaptığına doğru kaymaya başlıyor.

Bu, Muse Glimmer'in eğitim kısmına giriyor.

Agent sapmadan sonra nasıl devam edilir

Muse Glimmer, daha büyük Muse Spark'tan damıtılır.

Meta, eğitimi Ön Eğitim, Orta Eğitim ve Son Eğitim olarak bölüyor. Ön Eğitim, Logit Distillation kullanır; Orta Eğitim, daha fazla uzun bağlam, Reasoning Trace ve Agent verisi ekler; Son Eğitim ise SFT, On Policy Distillation ve RL'yi ekler.

Logit Distillation, büyük modelin cevabını kullanarak küçük modeli eğitmekten biraz farklıdır. Öğretmen, bir sonraki Token'u tahmin ederken, tüm Sözlük için bir olasılık dağılımı verir. Öğrenci, yalnızca seçilen Token'u değil, Öğretmen'in diğer adaylarla ilgili göreli yargılarını da öğrenir.

Bu, birçok senaryoda tek bir eylem bulunmadığı için Agent için faydalıdır. Bir web sayfası karşısında model, aramaya devam edebilir, bir sonucu açabilir veya başka bir araç kullanabilir. Öğretmenin olasılık dağılımı, yalnızca son çıktı metnini değil, bu eylemlere olan tercihlerini de içerir.

Mid Training'e ulaşıldığında, eğitim tek bir yanıt yerine tam görev izlerine doğru ilerlemeye başlar. Araçlar çalıştırıldıktan sonra ortam değişir. Arama yeni sonuçlar döndürür, kod çalıştırması başarısız olursa hata mesajı ortaya çıkar, GUI'de yanlış bir tıklama yapılırsa sayfa değişir. Yani, Agent'in çıktısı doğrudan bir sonraki girdiyi değiştirir.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

Öğretmen'in doğru yolu A'dan B'ye, ardından C'ye ve nihayet D'ye doğru olduğunu varsayalım. Eğer Öğrenci sadece Öğretmen'in verilerini öğrenirse, sürekli olarak A'dan B'ye ve B'den C'ye ulaşır. Ancak gerçek çalışma sırasında Öğrenci ilk adımda başka bir B durumuna ulaşabilir.

Bu noktadan itibaren çevre değişti ve eğitim setindeki B'den C'ye geçiş, şimdiki durumda nasıl davranması gerektiğini doğrudan söyleyemez. On Policy Distillation tam olarak burada işe yarar. Öğrenci önce kendi kendine Rollout yapar, gerçek olarak oluşacak durumlara girer, ardından bu durumlarda daha güçlü modelin denetimi altına alınır.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

Bu nedenle eğitim verilerinde yalnızca Öğretmenin ideal rotası değil, Öğrencinin kendi oluşturduğu hatalı durumlar da kapsanmaya başlandı. Bu, Muse Glimmer'in vurguladığı Hata Kurtarma ile bağlantılıdır.

Hatalı parametre girildikten sonra, model hata mesajını anlayabilirse, bir kez daha Araç Çağrısı yaparak görevi devam ettirebilir. Web sayfasında yanlış yola çıkıldığında, mevcut durumun yanlış olduğunu fark edebilirse geri dönülebilir veya başka bir yol tercih edilebilir. Gerçekten sorunlu olan, modelin hatayı fark etmeden ve hatalı duruma dayalı olarak çalışmaya devam ederek sapmanın birikmesidir.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

Bu nedenle, Agent'in yeteneği yalnızca bir Tool Call'in doğru olup olmadığına bakılarak değerlendirilemez; tam görevin sonunda tamamlanıp tamamlanmadığına ve ortaya çıkan hatalardan sonra kurtarılıp kurtarılamadığına da bakılmalıdır. Bu, Muse Glimmer'in bazı uzun süreçli Agent benchmark'larında daha iyi performans göstermesinin nedenini açıklar.

Görev tamamlanabiliyor olsa da, yerel çalıştırmanın sorunsuz olduğu anlamına gelmez. Karmaşık bir görev çok sayıda Reasoning Token üretirse, yeni darboğaz hızla Decode olacak.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

İki soru, birbirinin ardında

Muse Glimmer, low, medium, high, xhigh olmak üzere dört düzeyde Reasoning Strength desteği sunar. Bu ayar, çalışma zamanı çıkarım bütçesi olarak anlaşılabilir.

Daha yüksek seviyeler genellikle modelin daha fazla Nedenleme Token üretmesine neden olur, karmaşık Kodlama ve Agent görevlerinde daha yüksek başarı oranları elde edilebilir, ancak maliyeti doğrudan ortaya çıkar. Bağlam daha hızlı artar ve Decode süresi uzar.

Meta, açık benchmark'ta yüksek Mantık Gücü kullanıyor. Bu da DFlash'a yol açıyor.

Transformer'ın Decode'i otoregresifdir. 2. Token, 1. Token'un tamamlanmasını beklemelidir; 3. Token ise 2. Token'a bağımlıdır. Yüzlerce Token'lık bir yanıt kabul edilebilir, ancak bir Agent tek bir görevde binlerce hatta on binlerce Token üretebilir.

Spekülatif Çözümleme, daha küçük bir Taslak modeli eklemek anlamına gelir. Taslak, önce bir dizi token tahmin eder, ardından ana model bunları tek seferde doğrular. Birden fazla aday sürekli olarak kabul edilebilirse, 30B ana modelin Decode adımını gerçekleştirmesi azalır.

Geleneksel çözümün sorunu, Drafter'in genellikle kendisi de otoregresif bir model olmasıdır. 16 Token oluşturmak istiyorsa, yine tek tek üretmek zorundadır.

DFlash, bu bölümü Block Diffusion ile değiştirdi.

Muse Glimmer'in DFlash Blok Boyutu 16'dır ve bir dizi aday Token'ı paralel olarak tahmin edebilir. Ancak Drafter sadece hızlı olmak yeterli değildir. Tahminler yanlışsa, ana model birçok adayı reddeder ve önceki hız avantajı hızla kaybolur.

DFlash, Muse Glimmer'in 1., 13., 25., 37. ve 49. katlarındaki Gizli Özellikleri doğrudan okuyacak ve bu ara temsilleri yalnızca 5 katmanlı Drafter'e iletecektir. Bu sayede Drafter, tam Bağlamı yeniden anlamak zorunda kalmadan, 30B ana modelin zaten oluşturmuş olduğu iç temsilleri doğrudan kullanabilecektir.

Bu özellikler yalnızca girişte bir kez kullanılmaz, aksine Drafter'in tüm katmanlarına Key ve Value olarak sürekli olarak eklenerek ağ derinlendikçe zayıflaması önlenir.

Eğitim sırasında bir detay daha var. 16 Token'lık bir blokta, ilk Token'lar son Token'lardan daha önemlidir. Eğer ilk Token yanlışsa, sonrakileri doğru tahmin etmesine rağmen sürekli kabul uzunluğu çok kısa kalır.

DFlash, Block'un önünde yer alan Token'lara daha yüksek Kayıp Ağırlığı atar ve sonrakiler giderek azalır. Bu, 16 konumun ortalama doğruluğunu basitçe maksimize etmek yerine, mümkün olduğunca uzun kabul edilebilir önekleri optimize eder. Meta'nın sunduğu K Quant 17GB verisinde, RTX 5090 üzerinde Decode Hızı yaklaşık 74,9 Token/s'den 233,4 Token/s'ye yükseltildi.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

Bir Agent Görevi birikimli olarak 10.000 Token üretirse, yalnızca Decode'ye bakıldığında ilki yaklaşık 134 saniye, ikincisi yaklaşık 43 saniye sürer. Gerçek görevler Prefill, araç yürütme ve ağ bekleme sürelerini de içerir, ancak yüksek Reasoning Strength'e sahip Agent'lar için bu fark tam görev deneyimini açıkça etkiler.

High Reasoning Strength, Token üretimi artırır; DFlash bu süreyi kısaltır. Uzun Bağlam, KV Önbelleğini artırır; GQA ve Yerel Dikkat bellek kullanımını azaltır. Miktarlandırma ise model ağırlıklarını tüketici seviyesi grafik kartlarının taşıyabileceği sınırlarda tutar.

Ayrıca, Muse Glimmer, MCP Atlas, DeepSearch QA ve Gaia2 gibi Agent Benchmark'lerde iyi performans gösteriyor. Bu görevler uzun yürütme zincirleri gerektiriyor.

MCP Atlas, birden fazla MCP Sunucusu arasında araç seçimi ve çağrısı yapar. DeepSearch QA, sürekli olarak arama yapar, sayfaları açar, bilgi bulur ve yeni sonuçlara göre işlemi sürdürür. Gaia2, e-posta, takvim, iletişim listesi gibi durumlu uygulamaları simüle eder ve ortam, görev sırasında kendiliğinden değişir.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

Bu görevler Muse Glimmer'in eğitim yöntemiyle iyi uyum sağlıyor. Ancak OSWorld Verified, TerminalBench ve SWE Bench Verified'de aynı avantajı koruyamadı. Örneğin, OSWorld Verified'de Muse Glimmer 65,9 puan alırken, Qwen3.6 27B 75,6 puan aldı. TerminalBench 2.1'de Muse Glimmer 51,7 iken, rakibi 60,7 puan elde etti.

Bu nedenle yetenek dağılımı daha net. Research Agent, araç eş zamanlaması ve uzun süreçli durum görevleri daha güçlü; tamamen GUI, terminal ve bazı Coding Agent senaryolarında hâlâ belirgin iyileştirme alanı var. Bu puanlar geleneksel model sıralamaları gibi tamamen anlaşılmalıdır.

Agent Benchmark sonuçları, Sistem Promptu, Araç Tanımı, İskele, maksimum yürütme adımı, Örneklem parametreleri ve hatta Değerlendirme Modeli tarafından etkilenecektir. Meta kendi açıklamasında, üçüncü taraf modellerinin kullandığı Agent Araçları ve Sistem Promptlarının bunlar için en iyi şekilde optimize edilmiş olmayabileceğini belirtmiştir.

Bu nedenle Agent aşamasına gelindiğinde, Checkpoint'leri tek başına karşılaştırmak artık tam durumu açıklamak için giderek daha zor hale geliyor. Güvenlik de benzer bir sorun.

Yerelde çalıştırma, dosyaların, ekran görüntülerinin ve özel bağlamın sık sık buluta gönderilmesini azaltabilir, ancak bu yalnızca veri yolunu çözer. Prompt enjeksiyonu, hatalı Araç Çağrısı, izin aşımı ve geri alınamaz işlemler hâlâ mevcuttur. Meta, Agentic Risk, Gizlilik ve Prompt Enjeksiyonunu ayrı ayrı değerlendirdi ve gerçek dağıtımda Guardrail'leri artırma ve gerekli İnsanın Döngüde Kalmasını önerdi.

Muse Glimmer derinlemesine analiz: 24 GB GPU belleğiyle 30B Agent çalıştırmak, Meta tam olarak ne yaptı?

Net bir yetenek rotası

Muse Glimmer'in tam teknoloji yolu nihayetinde daha net bir zincir oluşturabilir.

Model boyutu yaklaşık 30B olarak sınırlanır, GQA ve Local Attention ile 128K bağlamın bellek maliyeti düşürülür, kuantizasyon sayesinde model 24GB ve 32GB cihazlara entegre edilir, Perception Encoder görsel ortamı okumadan sorumludur, On Policy Distillation uzun görevlerdeki sapma durumlarını kapsar, Reasoning Strength geliştiricilere çıkarım bütçesini kontrol etme imkanı sunar, DFlash ise çok sayıda Reasoning Token tarafından oluşturulan Decode gecikmesini yeniden işler.

Muse Glimmer, yerel 30B modelinin bulut Frontier Model'ini yerine geçirebileceğini kanıtlamadı, ancak yerel 30B modelinin nihai hedefinin sadece ölçekle ilgili olmadığını, aksine sistem düzeyi mühendisliğin çeşitli donanım kısıtlamalarına yönelik kapsamlı dengelemelerde olduğunu gösterdi. Bu model, yerel Agent’te en zorlu dört kısıtlama olan video belleği, bağlam, çevre durumu algısı ve çıkarım hızını aynı sistem tasarımı içinde birleştirdi.

Muse Glimmer, hâlâ bulut tabanlı üst modeli tamamen yerine geçemese de, "herkesin özel bir Agent'e sahip olması" hedefi için endüstriyel düzeyde uygulanabilir bir yol açtı.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.