مینی میکس نے ہانگ کانگ اسٹاک ایکسچینج پر لسٹ ہونے کے بعد اپنا پہلا نصف سالہ رپورٹ جاری کیا، جس میں آمدنی میں 283.1% کا اضافہ ہوا اور 2025 کے پورے سال کی آمدنی کا 1.5 گنا ہو گیا، جبکہ خام منافع میں 464.8% کا اضافہ ہوا۔ اگست میں ARR 8 ارب ڈالر سے آگے نکل گیا، B2B آمدنی کا تناسب 80% تھا، اور جولائی میں ٹوکن کی استعمال کی مقدار جنوری کے 20 گنا تھی۔ بانی یان جون جیے نے "منطقی لاگت کو کم سے کم، اور ذہانت کو زیادہ سے زیادہ" کے تقنویکی راستے کا تصور پیش کیا، جس نے اپنے خود ساختہ MSA آرکٹیکچر کے ذریعے لاکھوں الفاظ والے طویل متن کی ٹوکن کی حسابگری کی لاگت کو روایتی مکمل توجہ مکانزم کے تقریباً 1/20 تک کم کر دیا، جس سے محدود حسابی طاقت کے تحت ذہانت اور لاگت دونوں کو برقرار رکھا جا سکتا ہے، اور چینی بڑے ماڈلز کو عالمی مقابلے میں شامل ہونے کے لیے نئی راہ فراہم کرتا ہے۔مضمون کے مصنف، ذریعہ: زھی ڈونگ
26 اگست، چین کی AI بڑے ماڈل کی لیڈنگ کمپنی MiniMax (Xiyu Technology) نے اپنا پہلا نصف سالہ ا报告 جاری کیا جو ہانگ کانگ اسٹاک ایکسچینج پر فہرست ہونے کے بعد ہے۔
فینانشل رپورٹ کے مطابق، مینی میکس کی آمدنی میں 283.1 فیصد کا سالانہ اضافہ ہوا، اور اس کی نصف سالانہ آمدنی 2025 کی پورے سال کی آمدنی کا 1.5 گنا ہو چکی ہے؛ خالص منافع میں 464.8 فیصد کا اضافہ ہوا۔

فینل کانفرنس میں، مینی میکس کے بانی، بورڈ آف ڈائریکٹرز کے چیئرمین، سی ای او اور سی ٹی او یان جون جیے نے بتایا کہ اگست میں، مینی میکس کا ARR 8 ارب ڈالر سے زیادہ ہو گیا، B2B آمدنی کا تناسب 80 فیصد تک پہنچ گیا، اور جولائی میں ٹوکن کی استعمال کی مقدار جنوری کے 20 گنا تھی۔
ڈیٹا کے علاوہ، جس بات نے میری توجہ کھینچی وہ یان جونجیے نے کل رات کے پرفارمنس میٹنگ میں کہی گئی بات تھی۔ انہوں نے کہا: "صرف اس صورت میں ذہانت کے سطح کو زیادہ سے زیادہ کیا جا سکتا ہے جب ذہانت کی ادنیٰ اکائی لاگت کو کم کیا جائے۔"
یہ جان لیں کہ پچھلے دو سالوں میں بڑے ماڈلز کے لیے بنیادی طور پر دو راستے تھے: یا تو Scaling law کے مطابق پیرامیٹرز کو بڑھا کر ذہانت حاصل کی جاتی تھی، جس کا ادھار لاگت کا تھا؛ یا پھر کارکردگی کو کم کرکے عام لوگوں تک پہنچانے کی کوشش کی جاتی تھی، لیکن ذہانت کا مستوی ہمیشہ کچھ کم ہی رہتا تھا۔
صنعت کے لیے یہ معمولاً ایک ایسا مسئلہ ہے جس میں مچھلی اور بھالو کا شکار ایک ساتھ حاصل نہیں کیا جا سکتا۔
مینی میکس کیوں ایک ایسی راہ پر چلتا ہے جو صنعت کے خلاف محسوس ہوتی ہے؟ کیا یہ راہ حقیقت میں چل سکتی ہے؟
ذکاوت اور لاگت، کیوں ایک ساتھ حاصل نہیں کی جا سکتیں؟
اسکیلنگ قانون نے پچھلے کچھ سالوں میں AI کی کہانی کو ہدایت کیا: زیادہ پیرامیٹرز، زیادہ ذہانت۔
اسکیلنگ قانون کے مطابق، موجودہ ماڈل کے پیرامیٹرز 2-3 ٹریلین کے سطح تک پہنچ چکے ہیں، اور ماڈل کی ذہانت بھی اس کے ساتھ بڑھ رہی ہے، جس سے سب کو لگ رہا ہے کہ AGI قریب آ چکا ہے۔
خوشحالی کے پیچھے، یہ قاعدہ ایک بم بھی چھپا رہا ہے: جب ماڈل تریلین پیرامیٹرز کے سطح تک پہنچ جائے، تو استدلال کی لاگت نظر انداز نہیں کی جا سکتی۔
2026 کے GTC کانفرنس میں نوویدیا کے سی ای او ہوآنگ رینشون نے کہا: "ٹریننگ خرچ کو بنیادی لاگت کا عامل سمجھنے والا دور ختم ہو چکا ہے۔ اب ریزننگ ہی کام کا بوجھ ہے، اور یہ تیزی سے بڑھ رہا ہے۔"
استدلال کی لاگت میں اضافہ اور ایجنٹ کے ورک لوڈ کے بڑھنے کے ساتھ، AI ایک سوال اور ایک جواب سے متعدد مراحل کی خودمختار انجام دہی کی طرف بڑھ رہا ہے۔ ایک صرف صارف کی درخواست کے پیچھے دس یا اس سے زیادہ مدل کالز ہو سکتی ہیں، جس سے پورے صنعت کی کمپوٹیشنل بلز ایک اسی طرح کی شرح سے بڑھ رہی ہیں۔
نتیجہ کے طور پر، صنعت دو گروہوں میں تقسیم ہو گیا:
ایک طرف تیز رفتار اور کم لاگت والے مڈل ماڈل، جن کی ذہنی صلاحیت معمولی ہے۔
گوگل اس راستے کا ایک مثالی نمونہ ہے۔ جولائی سے اگست 2026 تک، گوگل نے ایک ساتھ Gemini 3.7 Flash، Gemini 3.6 Flash، Gemini 3.5 Flash-Lite اور Gemini 3.5 Flash Cyber تین ہلکے ماڈلز لانچ کیے۔

3.5 Flash-Lite، 3.5 سیریز کا سب سے تیز اور سب سے کم لاگت والے ماڈل ہے، جو اعلی ٹھیک گنجائش والے کاموں اور بڑے AI ایجینٹ سسٹمز میں چھوٹے کاموں کے لیے ڈیزائن کیا گیا ہے۔ Gemini 3.6 Flash کے آؤٹ پٹ ٹوکن کا استعمال پچھلی نسل سے 17% کم ہے۔
لیکن قیمت بھی واضح ہے۔ گوگل اب تک اپنا فлагشپ ماڈل Gemini 3.5 Pro جاری نہیں کر سکا، جسے مئی کے I/O کانفرنس میں جاری کرنے کا منصوبہ تھا، لیکن اب تک اس کا کوئی نمونہ نہیں دکھائی دیا۔
دوسری طرف، ذہانت کے ساتھ لیکن ڈپلویمنٹ مہنگا اور لاگت بڑھتی ہوئی بڑے ماڈل ہیں۔
مقامی بڑے ماڈل فراہم کنندگان اس راستے پر دوڑ رہے ہیں۔ جولائی 2026 میں، Moonshot نے Kimi K3 جاری کیا، جس کا پیرامیٹر سائز تقریباً 2.8 ٹریلین ہے، جو اب تک دنیا کا سب سے بڑا اوپن سورس ماڈل ہے۔
علی نے فوراً Qwen3.8 Max جاری کیا، جس کے پیرامیٹرز کی تعداد تقریباً 2.4 ٹریلین ہے؛ بائیڈو ون شن 5.0 بھی 2.4 ٹریلین پیرامیٹرز تک پہنچ گیا؛ DeepSeek V4-Pro کے پیرامیٹرز کی تعداد 1.6 ٹریلین ہے۔
پیرامیٹر کے سائز کی وجہ سے ذہنی صلاحیت میں اضافہ آنکھوں کے سامنے ہے۔ Kimi K3 نے کلائیڈ فیبل 5 اور GPT-5.6 Sol کو کئی Agent لسٹس میں پیچھے چھوڑ دیا۔ Qwen3.8 Max کو "سب سے بڑے پیرامیٹر سائز اور سب سے زیادہ پرفارمنس والے اوپن سورس ماڈل میں سے ایک" کہا گیا ہے۔
لیکن لاگت بھی بڑھ گئی۔
کیمی K3 کے API کی قیمت میں، غیر کیش شدہ ان پٹ میں فی ملین ٹوکن 6.5 یوان سے بڑھا کر 20 یوان کر دیا گیا ہے، اور آؤٹ پٹ میں 27 یوان سے بڑھا کر 100 یوان کر دیا گیا ہے، جو کہ 각각 208% اور 270% کی اضافہ ہے۔ افسران کی تجویز ہے کہ سپر نوڈ ڈپلویمنٹ کے لیے 64 یا زیادہ اسپیڈڈ کارڈز استعمال کیے جائیں۔
صرف دو دن کے بعد، مہ کے اندھیرے نے صارفین کے لیے نئے سبسکرپشنز روکنے کا اعلان کیا اور تمام کمپوٹنگ پاور موجودہ صارفین کی خدمات کو یقینی بنانے کے لیے استعمال کی گئی۔
جتنی زیادہ ایجنسی، اتنے ہی زیادہ ماڈل پیرامیٹرز، اتنے ہی زیادہ کال کی لاگت، اتنی ہی زیادہ ڈپلومنٹ کی رکاوٹ، اتنی ہی زیادہ کمپوٹنگ پاور کی کمی... یہ ایک مشکل حل ہونے والا گردوں کا گردوں بن گیا ہے۔
مینی میکس، کوئی انتخاب نہیں
لاگت اور ذہین دو میں سے ایک کے مسائل کے لیے MiniMax کا انتخاب یہ ہے: میں دونوں چاہتا ہوں۔
یان جونجیہ نے فیصلہ کن اجلاس میں مینی میکس کی پوری منطقی بنیاد واضح کر دی:
ہر کمپنی کے لیے کمپوٹیشنل پاور محدود ہوتی ہے۔ ہم “Intelligence with Everyone” کو حاصل کرنے کے لیے “Minimize the Inference Cost, Maximize the Intelligence” کو حاصل کرنا چاہتے ہیں۔ یہ ہماری مستقل ٹیکنالوجی کی راہ ہے اور ہمارا شروعاتی خواب بھی ہے۔
"انفرنس کی لاگت کو کم کریں، ذہانت کو زیادہ سے زیادہ کریں" کا مطلب ہے "انفرنس کی لاگت کو کم کریں اور ذہانت کو زیادہ سے زیادہ کریں"۔ MiniMax لاگت کم کرنے اور ذہانت بڑھانے کو ایک ہی سناوری فریم ورک میں رکھتا ہے۔
کیوں کہ مینی میکس کو "استدلال" کے بارے میں مختلف سمجھ ہے:
سب سے پہلا، استدلال اگلی نسل کے ذہنی اداروں کے پیداواری وسائل ہے۔
پہلے سمجھا جاتا تھا کہ استدلال "ماڈل کا استعمال" ہے، جبکہ تربیت "ماڈل بنانا" ہے۔ لیکن اب، مرکزی اجزاء جیسے سنتھیٹک ڈیٹا، تقویتی سیکھنے کا رول آؤٹ، ماڈل کا جائزہ لینا اور تصدیق، ایجنٹ اور ماحول کے درمیان تعامل وغیرہ، سب کچھ بنیادی طور پر استدلال لوڈ چلا رہے ہیں۔
پوسٹ ٹریننگ ایکٹیوٹی کا حجم کل ٹریننگ کمپوٹیشن میں بڑھ رہا ہے۔ انفرینس صرف ٹریننگ کے ختم ہونے کے بعد کا کام نہیں رہا، بلکہ یہ ٹریننگ کے پورے دوران خرچ ہو رہا ہے۔
تو، استدلال کی کارکردگی صرف API کی قیمت دہی کا تعین نہیں کرتی، بلکہ اگلی نسل کے ماڈل کو کتنی گہرائی تک تربیت دیا جا سکتا ہے، اس کا بھی تعین کرتی ہے۔
دوم، استدلال کی لاگت کا بہترین طریقہ ذکی ترقی کا ضروری شرط ہے۔
کمپوٹیشنل پاور کا فزیکل لِمٹ ہوتا ہے، جبکہ ماڈل کا سائز لگاتار بڑھ رہا ہے۔ اگر انفرینس کی لاگت کم نہیں ہوئی، تو آگے چل کر لاگت ذہنی ترقی کے گلے پر دباؤ ڈالنے لگے گی۔
محدود کمپوٹیشنل بجٹ میں، ہر روپے کو موثر انتہائی پیداوار میں تبدیل کرنے کی صلاحیت ہی ماڈل کی ترقی کو کتنی دور تک جانے دے گی۔
تیسری بات، سب سے کم اسٹائل کی قیمت پر اعلیٰ ترین ذہانت حاصل کرنا — یہ دوں ہی ایک ہی مقصد کے دو پہلو ہیں۔
صنعت نے پہلے "سمارٹ فرسٹ" اور "لاگت فرسٹ" کو دو الگ الگ راستوں کے طور پر دیکھا۔ لیکن اگر استدلال کی لاگت کم نہیں ہو سکتی، تو کتنی بھی اعلیٰ ذہانت ہو، وہ عملی نہیں ہو سکتی۔
سادہ الفاظ میں، مینی میکس کا خیال ہے کہ لاگت کو بہتر بنانا اور ذہانت کو بڑھانا ایک ہی چیز ہے۔ مدل ڈیزائن کے پہلے دن سے ہی استدلال کی کارکردگی کو مرکزی اشارہ بنایا جاتا ہے اور پورے ترقیاتی دور میں اسے برقرار رکھا جاتا ہے۔
یان جونجیے کے الفاظ میں: "مینی میکس کا مقصد ذہنی اور لاگت کے درمیان ایک توازن تلاش کرنا نہیں ہے۔ بلکہ اعلیٰ سطح کی ذہانت حاصل کرنا ہدف ہے، اور اس کے لیے استدلال کی لاگت اور کارکردگی کو مستقل طور پر بہتر بنانا ذریعہ ہے۔"
لاگت کو 1/20 تک کم کر دیا گیا، مینی میکس نے "لاگت کم کریں، ذہانت بڑھائیں" کو ٹیکنالوجی کا بند حل بنادیا
مینی میکس نے ہمیشہ اسی اصلی مقصد کو ہدف بنایا اور ایک ٹیکنالوجی بنیاد تعمیر کی۔
سب سے اہم بات اس کی خود ساختہ MSA (Sparse Attention) آرکیٹیکچر ہے۔ سادہ الفاظ میں، یہ لاکھوں الفاظ کے طویل متن کی یونٹ ٹوکن کی حساب کتاب کی لاگت کو روایتی مکمل توجہ مکانیزم کے تقریباً 1/20 تک کم کر دیتا ہے، یعنی M3 1M کنٹیکسٹ میں ہر ٹوکن کی حساب کتاب کی مقدار صرف پچھلے نسخے کی 1/20 ہے۔

اس برجستگی کی کلیدی بات یہ ہے: کل پیرامیٹرز کی تعداد ماڈل کی معلومات کی حد کا تعین کرتی ہے، لیکن فعال پیرامیٹرز کی تعداد ایک ٹوکن کے انفرادی استدلال کی لاگت کا تعین کرتی ہے۔ ان دونوں کو الگ کیا جا سکتا ہے: پیرامیٹر سائز میں اضافہ، استدلال کی لاگت کو ضروری طور پر اسی تناسب سے نہیں بڑھاتا۔
اس لیے M3 اسی قیمت پر ذہنی صلاحیت بڑھا سکتا ہے، جبکہ M3 Pro تقریباً 3T پیرامیٹر سائز کے ساتھ تقویتی سیکھنے اور لمبے مدتی کاموں کی تربیت کو آگے بڑھا سکتا ہے۔
انفرادی بڑے ماڈل کمپنیوں میں سے ایک، مینی میکس کا ETTR (موثر تربیت کا وقت کا تناسب) بنیادی ڈھانچے کے لحاظ سے 97% ہے، جو چین میں پہلی کمپنیوں میں سے ایک ہے جس نے سائز پر مبنی، طویل مدتی مستقل کمپوٹنگ طاقت کا نظام قائم کیا ہے۔
خود مختار کلسٹر، کلاؤڈ فراہم کنندہ اور TokenFactory کے تعاون کے ذریعے کمپوٹیشنل پاور سپلائی نیٹ ورک تعمیر کیا گیا ہے، جس کی موجودہ اور منصوبہ بند شدہ کمپوٹیشنل پاور 3T سطح کے ٹیکسٹ اور ویڈیو ماڈلز کی مستقل ترقی کو سپورٹ کر سکتی ہے۔
اختتام: جب کوئی طاقتی حسابی صلاحیت نہ ہو، تو گھریلو ماڈل کس چیز کی بنیاد پر پیچھے نہیں رہتے؟
جب بھی چین اور امریکہ کے بڑے ماڈلز کے درمیان فرق کی بات آتی ہے، تو ہارڈویئر ہمیشہ ایک اہم موضوع رہتا ہے۔
پہلے لوگوں کا یہ ماننا تھا کہ جس کے پاس زیادہ جدید چپ پروسیسنگ ٹیکنالوجی اور زیادہ کمپوٹیشنل پاور ہوگی، وہ بہتر ماڈل بنائے گا۔ اس منطق کے مطابق، چینی AI لگ بھگ چند ماہ سے لے کر نصف سال تک امریکی AI سے پیچھے رہے گا۔
کیا صرف اسی طرح ہی ہونا چاہیے؟
مینی میکس نے ایک نیا راستہ دیا: انفرینس کوسٹ کو کم کریں، ذہانت کو زیادہ سے زیادہ کریں۔
اسی طرح، ہر اکائی ذہانت کی لاگت کو کم کرنا ذہانت کی حد کو بھی بڑھاتا ہے۔ کیونکہ آج کے پوسٹ ٹریننگ، سنتھیٹک ڈیٹا، اور ری انفورسمنٹ لرننگ کا بنیادی طور پر انفرینس لوڈ چلایا جاتا ہے۔ جتنا انفرینس کارکردگی زیادہ ہوگی، اتنی ہی زیادہ تجربات ایک جتنے کے حساب سے کیے جاسکتے ہیں، اور ذہانت کی چھت بھی اتنی ہی بلند ہوگی۔
جو شخص کم لاگت پر زیادہ ذکاوت پیدا کر سکے، وہ محدود کمپیوٹیشنل طاقت میں زیادہ دور تک جا سکتا ہے، اور اس طرح زیادہ ذکاوت کو وسیع زندگی کے شعبوں میں داخل کر سکتا ہے۔
یہ شاید گلوبل مقابلے میں چینی بڑے ماڈلز کے لیے سب سے زیادہ ممکنہ راستہ ہے۔ اور MiniMax نے اس کی تصدیق شروع کر دی ہے۔
