मेटा ने म्यूज स्पार्क 1.3 का अनावरण किया, जो AI बेंचमार्क में प्रतिद्वंद्वियों को पीछे छोड़ देता है

icon MarsBit
साझा करें
AI summary iconसारांश
मेटा ने म्यूज़ स्पार्क 1.3 लॉन्च किया है, एक ऐसा एआई मॉडल जो प्रमुख बेंचमार्क में जेमिनी 3.8 फ्लैश और GPT-5.6 Sol को पीछे छोड़ देता है। मेटा के सुपर इंटेलिजेंस लैब द्वारा विकसित इस मॉडल ने DeepSWE v1.1 पर 75.4 का स्कोर प्राप्त किया, जिसमें कम टोकन उपयोग और कम कीमत है। मेटा के मुख्य एआई अधिकारी अलेक्जेंडर वांग ने इसे 24/7 एआई एजेंट्स की ओर एक महत्वपूर्ण कदम कहा है। यह एआई + क्रिप्टो समाचार अपडेट कुशलता में वृद्धि के कारण अपनाये जाने की संभावना के साथ एक नए टोकन की सूचीबद्धता को दर्शाता है।

बहुत ज्यादा प्रतिस्पर्धा है।

सिर्फ नवंबर के 3 दिन बीते हैं, और पांच अग्रणी मॉडल जारी कर दिए गए हैं!

Anthropic के Fable 5.1 और Mythos 5.1, Google के Gemini 3.8 Flash और Cyber, और Meta के Muse Spark1.3... RSI, निश्चित रूप से आ चुका है।

बस कल रात, गूगल का Gemini 3.8 Flash हल्के वर्ग का शासक बना, तभी मेटा ने चुनौती दे दी।

ज़कर्बर्ग ने X पर घोषणा की: Muse Spark 1.3 आज आधिकारिक रूप से लॉन्च हुआ है, जो अग्रणी प्रदर्शन के साथ लगभग मापने योग्य नहीं होने वाला अनुभव प्रदान करता है। यह हमारे प्रोग्रामिंग और एजेंट कार्यों में अब तक की सबसे बड़ी क्रांति है!

एजेंट

मेटा सुपरइंटेलिजेंट लैब के प्रमुख एलेक्सैंडर वांग ने भी तीन X पोस्ट किए, जिनमें इस "मैक्सी-वॉर" की कुंजी शक्ति का खुलासा किया गया।

उन्होंने कहा कि Muse Spark 1.2 की तुलना में Muse Spark 1.3 में अवैध राउंड कम हुए हैं, टूल कॉल्स में ~20% की कमी हुई है, टोकन खपत में ~25% की कमी हुई है, और लंबे समय तक के कार्यों में आवश्यकताओं को बेहतर ढंग से बनाए रखा जा सकता है, 'उपयोगकर्ता इस कूद को स्पष्ट रूप से महसूस करेंगे।'

एजेंट

Muse Spark 1.3 के लॉन्च के बाद, कल रात लॉन्च किया गया Gemini 3.8 Flash थोड़ा अजीब लग रहा है।

रनबर दर्शाता है कि इस बार Muse Spark 1.3 में बेहतरी अधिक है।

यह न केवल GPT-5.6 Sol और Fable 5 को परफॉरमेंस में पीछे छोड़ता है, बल्कि Max इन्फरेंस स्ट्रेंथ के तहत Artificial Analysis इंटेलिजेंस स्कोर 62 तक पहुँच गया है, जो वर्तमान में प्रथम समूह में स्थान लेता है।

एजेंट

पांच महीनों में, मेटा ने अनजाने में 4 म्यूज़ स्पार्क संस्करणों को अपडेट कर दिया है।

एलेक्जेंडर राजा ने गूगल का मजाक उड़ाया, "दूसरे मॉडल की धुएं पी रहे हैं"

हाल ही में, AI की पहली पंक्ति बहुत भीड़ भरी है। GPT-5.6 सिंहासन पर कब्जा किए हुए है, Fable 5.1 पीछे से आ रहा है, और Gemini 3.8 Flash ओवरटेक कर रहा है।

Muse Spark 1.3 के आने से सभी की व्यवस्था बिखर गई।

DeepSWE v1.1 बेंचमार्क में, जहां मॉडल की वास्तविक लंबी दूरी की प्रोग्रामिंग क्षमता सबसे अच्छी तरह से दिखाई देती है, Muse Spark 1.3 ने Opus 5 और GPT-5.6 Sol को सीधे पार कर दिया और हाल ही में लॉन्च किए गए Gemini 3.8 Flash को पीछे छोड़ते हुए वर्तमान सर्वोच्च स्कोर हासिल किया।

Muse Spark 1.3: 75.4 अंक

Claude Opus 5: 74.0 अंक

GPT-5.6 Sol: 73.0 अंक

एजेंट

Moreover, Muse Spark 1.3 has also demonstrated impressive performance in several other key developer metrics.

SWEAtlas CodeBase QnA में, इसने 59.4 अंक प्राप्त किए, जो GPT-5.6 Sol और Opus 5 को पार कर गया।

Terminal-Bench 2.1 में इसने 88.8 अंक प्राप्त किए।

MRCR 512K-1M पर, इसने अद्भुत 98.1 अंक प्राप्त किए! (तुलना के लिए, GPT-5.6 Sol ने केवल 73.8 अंक प्राप्त किए, जो पूरी तरह से दबा देने वाला है)।

एजेंट

एजेंट क्षमता पर, यह शीर्ष स्तर के साथ लगभग बराबर है, और JobBench, OSWorld जैसे परीक्षणों में Opus 5 से केवल कुछ प्रतिशत का छोटा अंतर है।

एजेंट

Artificial Analysis पर, Muse Spark 1.3 ने Gemini 3.8 Flash को स्पष्ट रूप से पीछे छोड़ दिया।

On the Smart Index, it scored 62, tying with Claude Fable 5 and entering the top tier.

एजेंट

विकासकों के सबसे अधिक ध्यान दिए जाने वाले लागत पहलू में, Muse की इनपुट लागत Fable 5 से 8 गुना कम है और आउटपुट लागत लगभग 12 गुना कम है, जिससे बेहतरीन मूल्य प्राप्त होता है।

इतनी उत्कृष्ट उपलब्धि के सामने, मेटा के मुख्य एआई अधिकारी अलेक्सांड्र वांग ने सीधे कहा: "Artificial Analysis स्मार्ट इंडेक्स पर, Gemini कुछ भी नहीं है, यह केवल दूसरे मॉडल की कार के धुएं को सांस ले सकता है।"

Google वास्तव में अपनी शक्ति खो चुका है।

एजेंट

कुछ लोग मजाक में कहते हैं: "गूगल ने चार महीने में चार Gemini Flash संस्करण लॉन्च किए, जबकि मेटा ने पांच महीनों में चार Muse Spark⁺ अपडेट किए। लेकिन गूगल केवल कुछ घंटों के लिए अग्रणी रहा, और फिर मेटा ने उसे पीछे छोड़ दिया—यह कहानी बहुत रोमांचक है।"

एजेंट

कम ही अधिक है: 1 डॉलर में 2 घंटे का परफॉर्मेंस जादूगर

उच्च रनिंग स्कोर अवश्य अच्छा है, लेकिन आज के AI दुनिया में, वास्तविक रूप से डेवलपर्स को उत्साहित करने वाला हमेशा उपयोग में आसान और सस्ता होता है।

Muse Spark 1.3 को बेस्ट वैल्यू फॉर मनी कहा जाता है क्योंकि यह न केवल तेज़ी से चलता है, बल्कि बचत करने में भी विशेषज्ञ है।

अलेक्सेंडर वांग के अनुसार, Muse Spark 1.3 "इतना सस्ता है कि इसका जिक्र नहीं करना चाहिए", "अग्रणी प्रदर्शन, लागत केवल एक छोटा सा हिस्सा है।"

एजेंट

एजेंट

यह अतीत के बड़े मॉडल्स के "बड़ी मात्रा में पैरामीटर्स का उपयोग करके चमत्कार प्राप्त करने" के रास्ते से पूरी तरह अलग राह अपनाता है—घटाव करना।

Muse Spark 1.3 को लंबे अवधि के प्रोग्रामिंग और बेहतर निर्देश पालन क्षमता के लिए विशेष रूप से प्रशिक्षित किया गया है, जिससे अनावश्यक इंटरैक्शन राउंड्स कम होते हैं और आउटपुट अधिक संक्षिप्त होता है।

एजेंट

यह अधिक बुद्धिमान और स्पष्ट हो गया है, कोड स्टाइल अधिक साफ है, और बेकार की बातें कम हैं।

और इस घटाव का सीधा परिणाम लागत में अचानक कमी है।

यह एक बहुत ही प्रभावशाली वास्तविक परीक्षण केस है।

डेवलपर @SPAC89 ने Muse Spark 1.3 Ultra Contributor मोड का उपयोग करते हुए Fable 5.1 xHigh के साथ तुलना की।

एजेंट

उसके द्वारा दिए गए प्रॉम्प्ट में एक कठोर "स्व-सुधार नियम" शामिल है: यदि स्वतंत्र निर्णायकों का स्कोर 9.5/10 से कम है, तो बुद्धिमान एजेंट को कोड में सुधार करना चाहिए और पुनः प्रयास करना चाहिए।

दोनों मॉडल लगभग 2 घंटे तक चले, और परिणाम आश्चर्यजनक थे।

Muse Spark 1.3 एक अथक सुपर वर्कर की तरह है, यह बिल्कुल नहीं रुकता, यह 20 राउंड के स्व-सुधार चक्र करता है, प्रत्येक बार 3 एजेंट्स को शुरू करता है—जिससे 2 घंटे में 60 से अधिक एजेंट रन होते हैं।

लेकिन इस अत्यंत विशाल और जटिल दीर्घ निष्कर्षण कार्य को पूरा करने की कुल लागत 1 डॉलर से कम है!

एजेंट

The developer exclaimed: "This completely exceeded my expectations; this thing is literally a work of art!"

मैक्रो प्राइसिंग के संदर्भ में, मेटा ने बड़ी ईमानदारी दिखाई है। नए मॉडल में मात्रा बढ़ाई गई है, लेकिन कीमत समान रखी गई है: प्रति मिलियन टोकन इनपुट के लिए 1.25 डॉलर और आउटपुट के लिए 4.25 डॉलर।

एजेंट

मूल्य निर्धारण में, Muse Spark 1.3 का योगदानकर्ता संस्करण 'muse-spark-1.3-contributor' विदेशी मॉडल के मूल्य निर्धारण का न्यूनतम स्तर है। (इसकी कीमत यह है कि डेटा का उपयोग Meta के उत्पादों को बेहतर बनाने के लिए किया जाएगा।)

एजेंट

कोडेडम के संस्थापक और डेवलपर मेहुल मोहन ने कहा:

Muse Spark 1.3 के कंट्रिब्यूटर लेयर प्राइसिंग का स्तर बिल्कुल अवास्तविक है, यही अमेरिकी AI प्रयोगशालाओं का « DeepSeek प्राइसिंग मोमेंट।

एजेंट

Artificial Analysis के आंकड़ों के अनुसार, समान बुद्धिमत्ता स्तर (59 अंक से अधिक) वाले मॉडल्स में, Muse Spark 1.3 की एकल कार्य लागत केवल 0.55 डॉलर है, जो निश्चित रूप से सर्वोत्तम हल है।

इसकी तुलना में, समान बुद्धिमत्ता (61 अंक) वाले Grok 4.6 की लागत 0.94 डॉलर है, GPT-5.6 Sol की लागत 0.95 डॉलर है, और Claude Opus 5 की लागत 1.23 डॉलर तक है।

इसके अलावा, डेवलपर कार्तिक ने बताया कि Muse Spark 1.3 में Sol और Fable जैसी 'साइक्लिक डीप' रीजनिंग क्षमता प्रतीत होती है।

यह एक ही क्षण में उत्तर उत्पन्न नहीं करता, बल्कि आंतरिक रूप से तर्कसंगत निष्कर्ष निकालता है, जिससे इसकी टोकन दक्षता अविश्वसनीय रूप से उच्च होती है।

एजेंट

अलेक्सांडर वांग की तेज़ उड़ान, छोटे ज़ा की अंतिम इच्छा

Muse Spark 1.3 का अचानक आगमन इसके पीछे के ट्रेडर्स के बिना संभव नहीं था।

इस साल जुलाई में, मेटा ने म्यूज़ स्पार्क 1.1 लॉन्च किया, जिसकी प्रमुख विशेषता 1M अत्यधिक लंबे कंटेक्स्ट और कंप्यूटर ऑपरेशन है।

केवल दो महीने से भी कम समय में, संस्करण 1.3 ने लंबी दूरी कोडिंग क्षमता को GPT-5.6 के स्तर तक पहुंचा दिया है।

ऐसी तेज़ इटरेशन, जो एलेक्सैंडर वांग ने मेटा सुपरइंटेलिजेंस लैब का नेतृत्व संभालने के बाद लाया है।

उनका अंतिम लक्ष्य क्या है? जैसा कि छोटे ज़ा और अलेक्सैंडर वांग ने बार-बार जोर देकर कहा है: 'एजेंट' और 'इतने सस्ते कि नज़रअंदाज़ कर दिए जाएँ'.

That is, Meta is looking at the next ASI opportunity—“Agent Engineering.”

मेटा AI के प्रमुख अलेक्सैंडर वांग ने एक्सियोस को दिए गए साक्षात्कार में स्पष्ट किया कि सभी उपलब्धता में सुधार, जेमी द्वारा बार-बार उल्लेख किए गए विशाल दृष्टिकोण—7×24 घंटे ऑनलाइन व्यक्तिगत एजेंट बनाने—की सेवा के लिए किए जा रहे हैं।

एजेंट

एक एजेंट को 24 घंटे आपके लिए ईमेल संभालने, कोड लिखने और डेटा विश्लेषण करने के लिए, इसे दो शर्तें पूरी करनी होंगी।

1. अत्यंत बुद्धिमान और स्थिर: इसे लंबी संवाद श्रृंखलाओं (लंबी थ्रेड्स) को संभालना होगा और कई कार्य प्रवाहों को समानांतर रूप से संसाधित करना होगा।

जब निर्देश अस्पष्ट हों, तो इसे सक्रिय रूप से प्रश्न पूछना चाहिए; जब बाधाएँ आएँ, तो इसे मानवीय सहायता के लिए आह्वान करना चाहिए; महत्वपूर्ण कार्रवाई करने से पहले, इसे पुष्टि करनी चाहिए। सबसे महत्वपूर्ण बात, भ्रम पैदा न करें।

2. अत्यंत सस्ता: यदि एक व्यक्तिगत एजेंट के एक दिन के चलाने की लागत कई दर्जन डॉलर है, तो यह हमेशा कुछ लोगों का खिलौना ही रहेगा।

Muse Spark 1.3 के आगमन से मूलतः 7×24 घंटे व्यक्तिगत बुद्धिमान एजेंट के लिए रास्ता तैयार होता है।

यह एक परिपक्व अनुभवी इंजीनियर की तरह है, आप एक लक्ष्य देते हैं, और यह स्वयं योजना बनाता है, स्वयं त्रुटियों को ठीक करता है, और स्वयं डिलीवर करता है।

इसके लिए, पीकू के एल्मन और मेटा रिसर्चर सुन ज़ीकिंग ने मेटा टीम द्वारा पिछले एवोकैडो मॉडल को फिर से ट्रेन करने की जानकारी दी, जिससे बेहतर परीक्षण स्केलिंग प्राप्त हुई।

एजेंट

महोत्सव के पीछे: क्या हमें 「रैंकिंग फ्रॉड」 का शिकार बनाया गया?

हालांकि, Muse Spark 1.3 को भी सवाल उठाया गया है।

प्रसिद्ध AI संस्थान BridgeMind ने एक गहरा विचार करने वाला कथन जारी किया:

Gemini 3.8 Flash और Muse Spark 1.3 आज एक साथ लॉन्च किए गए हैं। दोनों बेंचमार्क पर बहुत अच्छे दिख रहे हैं।

Muse Spark 1.3 अभी स्मार्ट इंडेक्स पर Fable 5 के साथ बराबरी पर है... मुझे उत्साहित होना चाहिए। लेकिन मुझे नहीं हो रहा है।

क्योंकि, इस महीने के AI अपडेट एक जैसे थे, स्कोर बढ़ गए, लेकिन वास्तविक दुनिया का अनुभव कोई प्रगति नहीं कर पाया।

यह निराशाजनक है। मेरा प्रदर्शन परीक्षण पर विश्वास हर सप्ताह कम हो रहा है, और जो प्रदर्शन परीक्षणों का खेल खेल रहे हैं, उन प्रयोगशालाओं पर मेरा विश्वास लगभग शून्य हो चुका है।

एजेंट

यह वाक्य वर्तमान बड़े मॉडल उद्योग के दर्द को सटीक रूप से छूता है।

कुछ नेटिज़न्स ने म्यूज़ स्पार्क 1.3 और जेमिनी फ्लैश 3.8z का बैकएंड-लेवल 3D कंस्ट्रेंट के तहत प्रेशर टेस्ट किया, और दोनों मॉडल्स की सच्चाई सामने आ गई:

Muse Spark 1.4 इतना अच्छा नहीं है, और Gemini Flash 3.5 सिर्फ रैंकिंग में बढ़ने की कोशिश कर रहा है।

एजेंट

अब, प्रमुख प्रयोगशालाएँ "स्कोर के लिए प्रशिक्षण" के चक्र में फँस गई हैं। एक मॉडल जारी होने पर, जरूर कुछ ऐसे रडार चार्ट और रैंकिंग स्क्रीनशॉट्स साथ आते हैं जो प्रतिद्वंद्वी को हरा देते हैं।

DeepSWE, Tau3-Bench, GPQA, सभी के लिए जबरदस्ती "अभ्यास करने" का लक्ष्य बन गए हैं।

और Muse Spark 1.3 भी अपनी असली पहचान दिखा चुका है।

Artificial Analysis की गहन रिपोर्ट में, हम इसकी एक छोटी सी पीछे की ओर बढ़ने की झलक भी देख सकते हैं।

उदाहरण के लिए, AA-Omniscience परीक्षण में, xhigh और max संस्करण दोनों में कमी आई। कारण इसकी 「अस्वीकृति दर」 में वृद्धि हुई—जब यह अनिश्चित होता है, तो यह गलत जानकारी देने के बजाय जवाब न देने को प्राथमिकता देता है।

यह भ्रम दर को कम करता है, लेकिन यह यह भी दर्शाता है कि इसका निरपेक्ष ज्ञान भंडार उतना अधिक नहीं बढ़ा है जितना कि प्रदर्शन स्कोर में सुधार हुआ है।

एजेंट

बड़े मॉडल के दूसरे चरण में, वास्तव में किसकी तुलना हो रही है?

आज Muse Spark 1.3 और Gemini 3.8 Flash के लॉन्च के साथ, हम निम्नलिखित निष्कर्ष निकाल सकते हैं।

सबसे पहले, बेस मॉडल का "पैरामीटर बोनस" अपने शिखर पर पहुंच रहा है।

पैरामीटर स्केल को बढ़ाकर बुद्धिमत्ता में सुधार करने का रास्ता अब लगातार कम लाभदायक होता जा रहा है।

भविष्य में, जो कोई भी सिस्टम आर्किटेक्चर में 'सर्कुलर डेप्थ' जैसे रीजनिंग मैकेनिज़म को शामिल करे और टूल कॉल पर अत्यधिक 'घटाव' करे, वही वास्तविक अनुभव में क्रांति ला पाएगा।

इसके अलावा, "एजेंट इंजीनियरिंग" ही निर्णायक है।

बड़े मॉडल की बहस अब «जो अधिक बोल सकता है» से «जो अधिक काम कर सकता है» की ओर बदल चुकी है।

भविष्य की मुख्य बाधा एकल परीक्षण स्कोर नहीं, बल्कि अत्यंत कम लागत पर दीर्घकालिक कार्यों की वास्तविक लागू क्षमता है।

जैसे Muse Spark 1.3 जैसा मॉडल, जो 1 डॉलर से कम में 60 बार ट्रायल एंड एरर साइकिल पूरा करता है, वह व्यापार मॉडल को पूरी तरह से बदल देगा।

संदर्भ:

https://x.com/SPAC89/status/2095284969614475744

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/AIatMeta/status/2095234385129963666?s=20

https://artificialanalysis.ai/zh/models/muse-spark-1-3

https://x.com/EdwardSun0909/status/2095236891574780275?s=20

यह लेख वेचेन ग्रुप "न्यूज़िज़यन" से आया है, लेखक: ASI उपदेश

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।