খুব প্রতিযোগিতামূলক।
শুধু সেপ্টেম্বরের ৩ দিন গেছে, এবার পাঁচটি অগ্রণী মডেল প্রকাশিত হয়েছে!
Anthropic-এর Fable 5.1 এবং Mythos 5.1, গুগলের Gemini 3.8 Flash এবং Cyber, এবং Meta-এর Muse Spark1.3... RSI, নিশ্চিতভাবে এসে গেছে।
গতকাল রাতেই গুগলের Gemini 3.8 Flash হালকা ওজন শ্রেণীর রাজা হয়ে উঠলে, মেটা এখন চ্যালেঞ্জ করতে এসেছে।
জুক এক্স-এ ঘোষণা করেছেন: মিউজ স্পার্ক 1.3 আজ অফিসিয়ালি প্রকাশিত হয়েছে, এটি অগ্রণী পারফরম্যান্সের মাধ্যমে প্� practically মূল্যহীন অভিজ্ঞতা নিয়ে আসে। এটি আমাদের প্রোগ্রামিং এবং এজেন্ট কাজে এখন পর্যন্ত সাধিত সবচেয়ে বড় প্রগতি!

মেটা সুপার ইন্টেলিজেন্ট ল্যাবের প্রধান অ্যালেক্সান্ডার ওয়াং তিনটি এক্স পোস্ট করেছেন, যেখানে এই "ম্যাক্স হিট" এর মূল হত্যাকারী অস্ত্রটি প্রকাশ করেছেন।
তিনি বলেন, মিউজ স্পার্ক 1.2 এর তুলনায় মিউজ স্পার্ক 1.3 অকার্যকর রাউন্ড কমিয়েছে, টুল কলের সংখ্যা ~20% কমেছে, টোকেন খরচ ~25% কমেছে এবং দীর্ঘ সময়ের কাজে চাহিদা বজায় রাখতে ভালোভাবে সক্ষম, 'ব্যবহারকারীরা এই বিপ্লবটি স্পষ্টভাবে অনুভব করবেন।'

মিউজ স্পার্ক 1.3 প্রকাশের সাথে সাথে, গত রাতে প্রকাশিত জেমিনি 3.8 ফ্ল্যাশ অপ্রয়োজনীয় হয়ে গেল।
রানবেন দেখায় যে এই Muse Spark 1.3-এর উন্নতি বেশি।
এটি শুধু GPT-5.6 Sol এবং Fable 5 কে পার করে গেছে, বরং Max রিজনিং স্ট্রেন্থের অধীনে Artificial Analysis ইন্টেলিজেন্স ইনডেক্স 62 পেয়েছে, যা বর্তমানে প্রথম স্তরে প্রবেশ করেছে।

পাঁচ মাসের মধ্যে, মেটা অজান্তেই 4টি Muse Spark ভার্সন আপডেট করেছে।
অ্যালেকজান্ডার রাজা গুগলকে হাসিমুখে বললেন, "অন্যান্য মডেলের পিছনের ধোঁয়া শোষণ করছেন"
সাম্প্রতিক সময়ে, এআই-এর শীর্ষ স্তরটি খুবই ব্যস্ত। GPT-5.6 মহারাজ্য দখল করে আছে, Fable 5.1 পিছন থেকে উঠে এসেছে, আর Gemini 3.8 Flash বাঁক পার হয়ে এগিয়ে যাচ্ছে।
মিউজ স্পার্ক 1.3 এর আবির্ভাব সবার পরিকল্পনা বিক্ষিপ্ত করে দিয়েছে।
DeepSWE v1.1 বেঞ্চমার্কে, যা মডেলের প্রকৃত দীর্ঘ-পরিসর প্রোগ্রামিং ক্ষমতা প্রদর্শন করে, Muse Spark 1.3 সরাসরি Opus 5 এবং GPT-5.6 Sol কে ছাড়িয়ে গিয়েছে এবং সাম্প্রতিকভাবে প্রকাশিত Gemini 3.8 Flash কেও পিছনে ফেলেছে, বর্তমানে সর্বোচ্চ স্কোর অর্জন করেছে।
মিউজ স্পার্ক 1.3: 75.4 পয়েন্ট
ক্লড ওপাস ৫: ৭৪.০ পয়েন্ট
GPT-5.6 সল: 73.0 পয়েন্ট

এছাড়াও, অন্যান্য কিছু গুরুত্বপূর্ণ ডেভেলপার মেট্রিক্সেও Muse Spark 1.3 অসাধারণ পারফরম্যান্স দেখিয়েছে।
SWEAtlas CodeBase QnA-এ 59.4 পাওয়া গেছে, যা GPT-5.6 Sol এবং Opus 5-কে ছাড়িয়ে গেছে।
টার্মিনাল-বেঞ্চ 2.1 এ 88.8 পয়েন্ট পেয়েছে।
MRCR 512K-1M-এ এটি অসাধারণ 98.1 পয়েন্ট পেয়েছে! (তুলনায়, GPT-5.6 Sol এই পরীক্ষায় মাত্র 73.8 পয়েন্ট পেয়েছে, যা পুরোপুরি অধিকার করেছে)।

এজেন্টের ক্ষমতার ক্ষেত্রে, এটি প্রায় সর্বোচ্চ পর্যায়ের সাথে সমান হয়ে গেছে, JobBench, OSWorld ইত্যাদি পরীক্ষায় Opus 5 এর সাথে কয়েক শতাংশের কম পার্থক্য রয়েছে।

Artificial Analysis-এ, Muse Spark 1.3 কে স্পষ্টভাবে Gemini 3.8 Flash-এর পিছনে ফেলে দিয়েছে।
স্মার্ট ইনডেক্সে, এটি 62 পয়েন্ট পেয়েছে, যা Claude Fable 5-এর সাথে সমান এবং শীর্ষস্থানীয়দের মধ্যে প্রবেশ করেছে।

ডেভেলপারদের মধ্যে সবচেয়ে বেশি মনোযোগ পাওয়া খরচের ক্ষেত্রে, মিউজের ইনপুট খরচ ফেবল 5 এর চেয়ে 8 গুণ কম এবং আউটপুট খরচ প্রায় 12 গুণ কম, যা অত্যন্ত মূল্যবান।
এত উজ্জ্বল কর্মক্ষমতার মুখে, মেটার প্রধান এআই অফিসার আলেক্সান্ডার ওয়াং সরাসরি বলেন: "Artificial Analysis স্মার্ট ইনডেক্সে, জেমিনি কিছুই নয়, শুধু অন্যান্য মডেলের কারের বায়ু খায়।"
গুগল সত্যিই এখন পড়ে আছে।

কেউ কেউ হাসিমুখে বলেছেন: "গুগল চার মাস ধরে কঠোর পরিশ্রম করে চারটি Gemini Flash ভার্সন প্রকাশ করেছে, আর মেটা পাঁচ মাসের মধ্যে একসাথে চারটি Muse Spark⁺ আপডেট করেছে। কিন্তু গুগল কয়েক ঘন্টা আগে এগিয়ে গেলেও, মেটা তা ছাড়িয়ে গেল, এই গল্পটা খুবই মজাদার।"

কমই বেশি: 1 ডলারে 2 ঘন্টা পারফরম্যান্স মনস্টার
উচ্চ পারফরম্যান্স অবশ্যই দারুণ, কিন্তু বর্তমান এআই জগতে, ডেভেলপারদের জন্য সত্যিকারের উত্তেজনা হলো সহজে ব্যবহারযোগ্য এবং সস্তা।
Muse Spark 1.3 কে মূল্যের সাথে অনুপাতের রাজা বলা হয় কারণ এটি শুধু দ্রুত চলে না, বরং খরচও বেশি বাঁচায়।
অ্যালেক্সান্ডার ওয়াংয়ের মতে, Muse Spark 1.3 এতটাই সস্তা যে এটি উপেক্ষণীয়, "অগ্রণী পারফরম্যান্স, খরচ মাত্র শূন্যের দিকে।"


এটি আগের বড় মডেলগুলির "বড় পরিমাণে প্যারামিটার জমা করে অসাধারণ ফলাফল পাওয়া" এর বিপরীতে একটি পথ অনুসরণ করেছে—বিয়োগ করা।
দীর্ঘ পিরিয়ড প্রোগ্রামিং এবং উন্নত নির্দেশ অনুসরণ ক্ষমতার জন্য Muse Spark 1.3 কে বিশেষভাবে প্রশিক্ষিত করা হয়েছে, যার ফলে অপ্রয়োজনীয় ইন্টারেকশন রাউন্ড কমে যায় এবং আউটপুট আরও সংক্ষিপ্ত হয়।

এটি আরও বুদ্ধিমান এবং পরিষ্কার হয়েছে, কোডের স্টাইল আরও পরিশুদ্ধ এবং অপ্রয়োজনীয় কথা কমেছে।
এবং এই বিয়োগের প্রত্যক্ষ পরিণতি হল খরচের হঠাৎ পতন।
নিচে একটি অত্যন্ত প্রভাবশালী বাস্তব পরীক্ষার উদাহরণ দেওয়া হল।
ডেভেলপার @SPAC89 মিউজ স্পার্ক 1.3 আল্ট্রা কন্ট্রিবিউটর মোড ব্যবহার করে Fable 5.1 xHigh-এর সাথে তুলনা করেছেন।

তার প্রম্পটে একটি কঠোর "স্ব-উন্নতি নিয়ম" রয়েছে: যদি স্বতন্ত্র বিচারকদের স্কোর 9.5/10-এর কম হয়, তবে স্মার্ট এজেন্টটিকে কোড উন্নত করে আবার চেষ্টা করতে হবে।
এই দুটি মডেল প্রায় 2 ঘন্টা চালানো হয়েছিল, ফলাফল অবিশ্বাস্য।
মিউজ স্পার্ক 1.3 একটি অথক সুপার কর্মচারীর মতো, এটি কখনও থামে না, এটি 20 টি স্ব-উন্নতি চক্র সম্পন্ন করেছে, প্রতিবার 3টি বুদ্ধিমান এজেন্ট শুরু করে—যা 2 ঘন্টার মধ্যে 60টিরও বেশি বুদ্ধিমান এজেন্ট চলনের সমান।
এই অত্যন্ত বিশাল এবং জটিল দীর্ঘ ধাপের যুক্তিগত কাজটি সম্পন্ন করতে মোট খরচ হয়েছে মাত্র 1 ডলারের কম!

এই ডেভেলপার চিৎকার করে উঠলেন: "এটা আমার প্রত্যাশার অতিক্রম করেছে, এটা তো একটা শিল্পকর্ম!"
ম্যাক্রো-প্রাইসিংয়ে, মেটা বড় ইচ্ছাশক্তি প্রদর্শন করেছে। নতুন মডেলটি পরিমাণ বাড়িয়েছে কিন্তু মূল্য অপরিবর্তিত রেখেছে, প্রতি মিলিয়ন টোকেন ইনপুটের জন্য 1.25 ডলার এবং আউটপুটের জন্য 4.25 ডলার মূল্য বজায় রেখেছে।

মূল্য নির্ধারণে, মিউজ স্পার্ক 1.3-এর কন্ট্রিবিউটর ভার্সন "muse-spark-1.3-contributor" বিদেশী মডেলের মূল্যের নিম্নতম সীমা। (এর বিনিময়ে, ডেটা মেটা পণ্যগুলি উন্নত করতে ব্যবহার করা হবে।)

কোডেডামের প্রতিষ্ঠাতা এবং ডেভেলপার মেহুল মোহন বলেছেন:
Muse Spark 1.3-এর অবদানকারী স্তরের মূল্যনির্ধারণ অবিশ্বাস্যভাবে অতিমাত্রায় বেশি, এটিই মার্কিন AI পরীক্ষাগারের « ডিপসিক মূল্যনির্ধারণের মুহূর্ত।

Artificial Analysis-এর পরিসংখ্যান অনুযায়ী, সমান বুদ্ধিমত্তা স্তর (59 এর বেশি স্কোর) সহ মডেলগুলির মধ্যে, Muse Spark 1.3-এর একক কাজের খরচ মাত্র 0.55 ডলার, যা পরম সেরা সমাধান।
একই বুদ্ধিমত্তা (61 পয়েন্ট) এর জন্য Grok 4.6 এর খরচ 0.94 ডলার, GPT-5.6 Sol এর খরচ 0.95 ডলার এবং Claude Opus 5 এর খরচ বেশি হয়ে 1.23 ডলার।
এমনকি, ডেভেলপার কার্তিক উল্লেখ করেছেন যে Muse Spark 1.3 এর মধ্যে Sol এবং Fable-এর মতো "সাইক্লিক ডেপথ" রিজনিং ক্ষমতা রয়েছে।
এটি একটি মুহূর্তে উত্তর তৈরি করে না, বরং অভ্যন্তরীণভাবে যুক্তি প্রয়োগ করে, যা এর token দক্ষতাকে অবিশ্বাস্যভাবে উচ্চ করে তোলে।

অ্যালেক্সান্ডার ওয়াংয়ের দ্রুত উত্থান, ছোট জাকের চূড়ান্ত আকাঙ্ক্ষা
মিউজ স্পার্ক 1.3-এর আবির্ভাবের পিছনে রয়েছে এর অপারেটর।
বছরের জুলাইয়ে, মেটা মিউজ স্পার্ক 1.1 প্রকাশ করে, যার মুখ্য বৈশিষ্ট্য হল 1M অত্যন্ত দীর্ঘ কনটেক্সট এবং কম্পিউটার অপারেশন।
কেবল দুই মাসের কম সময়ের মধ্যে, সংস্করণ 1.3 ইতিমধ্যে দীর্ঘ-পরিসর কোডিং ক্ষমতাকে GPT-5.6 এর মাত্রায় নিয়ে এসেছে।
এই এত দ্রুত ইটারেশন হয়েছে কারণ আলেক্সান্ডার ওয়াং মেটা সুপার ইন্টেলিজেন্স ল্যাবের দায়িত্ব নিয়েছেন।
তাদের চূড়ান্ত লক্ষ্য কী? যেমন ছোট জা এবং আলেক্সান্ডার ওয়াং বারবার উল্লেখ করেছেন: 'এজেন্ট' এবং 'অবহেল্যযোগ্য মূল্যে'।
অর্থাৎ, মেটা পরবর্তী এএসআই সুযোগ—「এজেন্ট ইঞ্জিনিয়ারিং」—এর দিকে তাকাচ্ছে।
মেটা এআই-এর প্রধান অ্যালেক্সান্ডার ওয়াং অ্যাক্সিওসকে দেওয়া একটি সাক্ষাত্কারে স্পষ্টভাবে বলেছেন যে, সমস্ত উপলব্ধতা উন্নতি ছোট জ্যাকের বারবার উল্লেখ করা বৃহৎ দৃষ্টিভঙ্গি—7×24 ঘন্টা অনলাইন ব্যক্তিগত এজেন্ট তৈরি করা—কে সেবা করার জন্য।

একটি এজেন্টকে ২৪ ঘন্টা আপনার জন্য ইমেইল প্রসেস করতে, কোড লিখতে এবং ডেটা বিশ্লেষণ করতে হলে, এটি দুটি শর্ত পূরণ করতে হবে।
1. অত্যন্ত বুদ্ধিমান এবং স্থিতিশীল: এটি অত্যন্ত দীর্ঘ কথোপকথন থ্রেড (লং-থ্রেড) সমর্থন করতে পারে এবং একাধিক কাজের প্রবাহ সমান্তরালভাবে প্রক্রিয়া করতে পারে।
যখন নির্দেশ অস্পষ্ট থাকে, তখন তাকে主动提问 করতে জানতে হবে; যখন বাধার সম্মুখীন হয়, তখন তাকে মানুষের কাছ থেকে সাহায্য চাইতে জানতে হবে; গুরুত্বপূর্ণ কার্যক্রম সম্পাদনের আগে, তাকে নিশ্চিত করতে জানতে হবে। সবচেয়ে গুরুত্বপূর্ণ হলো, যেন কোনো幻觉 তৈরি না করে।
২. অত্যন্ত সস্তা: যদি একটি ব্যক্তিগত এজেন্ট চালানোর দৈনিক খরচ কয়েক ডলার পর্যন্ত হয়, তাহলে এটি সর্বদা কয়েকজনের জন্যই একটি খেলনা হয়ে থাকবে।
মিউজ স্পার্ক 1.3 এর আবির্ভাব মূলত 7×24 ঘন্টা ব্যক্তিগত বুদ্ধিমত্তা পথ প্রশস্ত করে।
এটি একজন পরিপক্ক অভিজ্ঞ ইঞ্জিনিয়ারের মতো, আপনি একটি লক্ষ্য দিন, এটি নিজেই পরিকল্পনা করে, নিজেই ত্রুটি সংশোধন করে এবং নিজেই ডেলিভারি করে।
এর জন্য, পেকিং বিশ্ববিদ্যালয়ের প্রাক্তন শিক্ষার্থী এবং Meta-এর গবেষক সুন জিচিং জানান যে Meta দলটি আগের অ্যাভোকাডো মডেলটি আবার পোস্ট-ট্রেনিং করেছে এবং ভালো টেস্ট স্কেলিং অর্জন করেছে।

উৎসবের পেছনে: আমরা কি «র্যাঙ্কিং ফ্রড» এর শিকার হয়েছি?
তবে, মিউজ স্পার্ক 1.3 এরও সমালোচনা করা হয়েছে।
প্রখ্যাত এআই সংস্থা ব্রিজমাইন্ড একটি চিন্তাশীল বক্তব্য পোস্ট করেছে:
জেমিনি 3.8 ফ্ল্যাশ এবং মিউজ স্পার্ক 1.3 আজ একসাথে প্রকাশিত হয়েছে। উভয়েরই বেঞ্চমার্কে দুর্দান্ত পারফরম্যান্স দেখা যাচ্ছে।
মিউজ স্পার্ক 1.3 এখন স্মার্ট ইনডেক্সে ফেবল 5 এর সাথে টাই করেছে... আমি উত্তেজিত হতে চাই। কিন্তু আমি হই না।
কারণ, এই মাসের এআই প্রকাশনা একই রকম, স্কোর বেড়েছে, কিন্তু বাস্তব জীবনের অভিজ্ঞতা কোনও উন্নতি করেনি।
এটি নিরাশাজনক। আমি বেঞ্চমার্কের উপর সপ্তাহে সপ্তাহে কম বিশ্বাস রাখছি, এবং বেঞ্চমার্ক নিয়ে খেলা করা ল্যাবগুলির উপর আমার বিশ্বাস প্রায় শেষ হয়ে গেছে।

এই বাক্যটি বর্তমান বড় মডেল শিল্পের প্রতিটি বিষয়কে সঠিকভাবে স্পর্শ করে।
একজন ব্যবহারকারী মিউজ স্পার্ক 1.3 এবং জেমিনি ফ্ল্যাশ 3.8z-এর উপর ব্যাকএন্ড-লেভেল 3D কনস্ট্রেইন্টের অধীনে প্রেশার টেস্ট করেছেন, এবং দুটি মডেলেরই মূল দুর্বলতা প্রকাশ পেয়েছে:
মিউজ স্পার্ক 1.4 ততটা ভালো নয়, আর জেমিনি ফ্ল্যাশ 3.5 শুধু বোর্ডে উঠছে।

এখন, বিভিন্ন প্রযুক্তি প্রতিষ্ঠানগুলি "স্কোর বাড়ানোর জন্য প্রশিক্ষণ" এর একটি অদৃশ্য চক্রে আটকে গেছে। একটি মডেল প্রকাশ করা হলে, অবশ্যই কয়েকটি প্রতিদ্বন্দ্বীকে পরাজিত করার জন্য রাডার চার্ট এবং র্যাঙ্কিং স্ক্রিনশট সহ সংযুক্ত হয়।
DeepSWE, Tau3-Bench, GPQA এখন সবার জন্য প্রচণ্ড প্র্যাকটিসের লক্ষ্য।
এবং মিউজ স্পার্ক 1.3 ও নিজেকে প্রকাশ করেছে।
Artificial Analysis-এর গভীর রিপোর্টেও আমরা এর একটি ক্ষুদ্র পিছনে হটার দেখতে পাই।
উদাহরণস্বরূপ, AA-Omniscience টেস্টে, xhigh এবং max ভার্সন উভয়েরই পারফরম্যান্স কমেছে। কারণ এর «অংশগ্রহণ হার» বেড়েছে—যখন এটি অনিশ্চিত হয়, তখন এটি মিথ্যা তথ্য দেওয়ার পরিবর্তে উত্তর না দেওয়ার প্রবণতা রাখে।
এটি হ্যালুসিনেশন হারকে কমিয়েছে, কিন্তু এটি একইসাথে বোঝায় যে এর পরম জ্ঞান ভাণ্ডার পারফরম্যান্স বৃদ্ধির মতো অত্যধিক বৃদ্ধি পায়নি।

বড় মডেলের দ্বিতীয় অর্ধের প্রতিযোগিতা কী?
আজ Muse Spark 1.3 এবং Gemini 3.8 Flash-এর প্রকাশের মাধ্যমে আমরা নিম্নলিখিত কয়েকটি বিচার করতে পারি।
প্রথমত, বেস মডেলের "প্যারামিটার বোনাস" শীর্ষে পৌঁছেছে।
প্যারামিটার স্কেল বাড়িয়ে বুদ্ধিমত্তা বাড়ানোর পথে প্রান্তিক লাভ ক্রমশ কমে যাচ্ছে।
ভবিষ্যতে, যে কেউ সিস্টেম আর্কিটেকচারে 'সাইক্লিক ডেপথ'-এর মতো রিজনিং মেকানিজম চালু করবে এবং টুল কলে চরম 'সাবট্রাকশন' করবে, তিনিই সত্যিকারের অভিজ্ঞতা বৃদ্ধি পাবেন।
এছাড়াও, "এজেন্ট ইঞ্জিনিয়ারিং" হল বিজয়ের চাবিকাঠি।
বড় মডেলের প্রতিযোগিতা এখন "যে বেশি ভালো কথা বলে" থেকে "যে বেশি ভালো কাজ করে" এর দিকে সরে গেছে।
ভবিষ্যতের মূল বাধা হল একক স্কোর নয়, বরং অত্যন্ত কম খরচে দীর্ঘমেয়াদী কাজগুলির বাস্তব বাস্তবায়নের ক্ষমতা।
1 ডলারের কম খরচে 60 বার ট্রায়াল এন্ড এরর সাইকেল চালানোর মতো মডেল, যেমন Muse Spark 1.3, ব্যবসায়িক মডেলকে সম্পূর্ণভাবে পুনর্গঠন করবে।
প্রসঙ্গ:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউ জিয়ুয়ান" থেকে এসেছে, লেখক: ASI প্রতিজ্ঞা
