"سب سے طاقتور ماڈل" کی مدت استعمال ختم ہو رہی ہے۔مضمون کے مصنف، ذریعہ: دینگ جیاو
ایک ماہ کے اندر، 9 فلگشپ ماڈلز ایک ساتھ جاری کیے گئے، جو بڑے ماڈل صنعت میں عام نہیں ہے۔
شروع مہینے میں تینگن ہائی 3 کا رسمی ورژن جاری اور اوپن سورس ہوا، اور مہینے کے آخر میں اینتھرپک نے کلوڈ اوپس 5 جاری کیا، اس دوران کیمی K3، Qwen3.8-Max پریویو ورژن، اور گروک 4.5 جیسے ماڈلز ترتیب سے متعارف کرائے گئے۔ جولائی پچھلے سال کے دوران کم ترین ایسے اعلانات کا مہینہ بن گیا۔

ہر کمپنی کا انتخاب کیا گیا وقت مختلف ہے۔ کچھ فرماں مقابلہ کرنے والی کمپنیوں کے اپڈیٹ کے بعد کے فاصلے کا فائدہ اٹھاتے ہیں، کچھ عالمی صنعتی تخلیقی کانفرنس کے قبل یا بعد ظاہر ہوتے ہیں، اور کچھ فرماں مارکیٹ کے مقابلے کا جواب دینے کے لیے قیمت میں تبدیلی کرتے ہیں۔
لیکن جولائی صرف ماڈلز کی تعداد کا زیادہ ہونا نہیں، بلکہ اس سیریز کی اشاعت میں دو تبدیلیوں کا اظہار بھی ہے۔
سب سے پہلے، ماڈلز کے درمیان صلاحیتوں کا فرق کم ہو رہا ہے۔ Artificial Analysis کے حالیہ مجموعی بُدھیمانہ اندیکس کے مطابق، ٹاپ ماڈلز کے درمیان فرق واضح طور پر کم ہو چکا ہے۔ جیسے جیسے ورژن تیزی سے اپڈیٹ ہوتے ہیں، "سب سے طاقتور ماڈل" کا مقام لمبے عرصے تک برقرار رکھنا مشکل ہو رہا ہے، اور تمام کمپنیاں اب ایک منفرد پہلو میں مکمل تفویض کی بجائے مختلف کاموں پر اپنا فائدہ تلاش کر رہی ہیں۔
دوم، اوپن سورس ماڈلز اب پہلی ٹیم میں داخل ہو گئے ہیں۔ جولائی میں جاری کیے گئے نئے ماڈلز میں، تینگن ہونگ یون Hy3، کیمی K3 وغیرہ نے وزن کھولنے کا انتخاب کیا (ماڈل پیرامیٹرز کو کھولنا، جس سے ڈویلپرز انہیں خود ڈاؤن لوڈ اور ڈپلوی کر سکتے ہیں)۔ ان میں، کیمی K3 کوڈ ایرینا فرانت اینڈ پروگرامنگ رینکنگ میں پہلے نمبر پر ہے، جو GPT-5.6 Sol اور Claude Fable 5 سے آگے ہے۔ پچھلے دو سالوں میں، اوپن سورس ماڈلز زیادہ تر بند سورس ماڈلز کے پیچھے کھینچے جانے والے سمجھے جاتے تھے، لیکن اس مقابلے میں ظاہر ہوا ہے کہ اوپن سورس ماڈلز اب کچھ ڈویلپمنٹ سیناریوز میں بند سورس ماڈلز کے ساتھ براہ راست مقابلہ کر رہے ہیں۔
تو، اس ماہ کی مکثف شدہ اشاعت نے کیا تبدیلیاں لائی ہیں اور اس کا کیا مطلب ہے؟
01. صرف اس بات پر زور نہیں دیا جائے گا کہ کون زیادہ ذکی ہے
گزشتہ کچھ سالوں میں، بڑے ماڈل صنعت کا مرکز عام صلاحیتوں پر تھا، جس کی معلومات زیادہ وسیع تھیں یا جس کے جوابات زیادہ درست تھے۔ لیکن اب، مقابلے کا پہلو بدل چکا ہے۔
اس دور میں، کوڈنگ کی صلاحیت سب سے واضح مقابلہ کا نقطہ بن گئی۔
اوپن اے آئی پروگرامنگ اور پیچیدہ استدلال کو مزید مضبوط بناتی رہی ہے اور کوڈیکس کے ایکوسسٹم کو وسعت دیتی جا رہی ہے، تاکہ ڈویلپرز کو اپنے ٹولز کے ذریعے باندھ سکے۔ اینتھرپک کوڈ کی سمجھ اور سیکیورٹی اڈٹ پر زور دیتی ہے، تاکہ ڈویلپرز بڑے پروجیکٹس میں پیچیدہ انجینئرنگ مسائل کو حل کر سکیں۔ گروک 4.5 تیزی اور کم لاگت پر زور دیتا ہے اور AI پروگرامنگ ٹول کرسر کے ساتھ جڑتا ہے، جو روزمرہ کے ڈویلپمنٹ کے مناظر کو کور کرتا ہے۔
بڑے ماڈل ریسرچر یائو یوہانگ نے "ڈنگ جیو ون" کو بتایا کہ تمام کمپنیاں پروگرامنگ کے صلاحیتوں میں زور دے رہی ہیں اور فرق تیزی سے کم ہو رہا ہے، مثال کے طور پر، کیمی K3 کی کوڈنگ کی صلاحیت میں واضح بہتری آئی ہے اور یہ اب سرکاری بند ماڈلز کے سطح تک پہنچ رہا ہے۔

تصویر کا حوالہ / pexels
ایجینٹ دیگر کمپنیوں کی طرف سے حاصل کیا جانے والا ایک اور رخ ہے۔ GPT-5.6 Sol کو Codex کے ساتھ ملا کر آٹومیٹڈ پروگرامنگ کا جائزہ لیا جا رہا ہے، Opus 5 لمبے مدتی کاموں کے انجام پر زور دیتا ہے، Kimi K3 مسلسل چلنے اور پیچیدہ کاموں کو مکمل کرنے کی صلاحیت کو دکھاتا ہے، جبکہ تینگن ہُن ہائی 3 وی چیٹ ایکوسسٹم کے ساتھ اسمارٹ ایجینٹ ایپلیکیشنز کا جائزہ لینے کی کوشش کر رہا ہے۔
لیکن ایجینٹ عملی طور پر اب بھی ناکافی ہیں۔ انفرادی ڈویلپر بیچینگ کا کہنا ہے کہ موجودہ ذہین ایجینٹ پروڈکٹس کی کمزوری صرف ٹولز کے استعمال کی صلاحیت میں نہیں، بلکہ ٹاسک سکیڈولنگ کی صلاحیت میں ہے۔ مثال کے طور پر، کوڈیکس کا اولٹرا موڈ کئی سب ایجینٹس کو شروع کر دیتا ہے، جو مختلف سب ایجینٹس ایک ہی فائل کو دوبارہ پڑھتے ہیں، مشابہ تجزیہ کرتے ہیں، اور آخر میں ٹوکن کا استعمال بڑھ جاتا ہے، لیکن واقعی موثر کام میں کوئی اضافہ نہیں ہوتا۔ اس کے خیال میں، ذہین ایجینٹس کی صلاحیت میں صرف سب ایجینٹس کی تعداد بڑھانے سے نہیں، بلکہ یہ فیصلہ کرنے میں اضافہ ہوتا ہے کہ کون سے ٹاسکز تجزیہ کے قابل ہیں اور کون سے مرحلے حذف کئے جا سکتے ہیں۔
یائو یوہانگ کا بھی یہی خیال ہے۔ وہ سمجھتے ہیں کہ ابھی تک سب سے زیادہ توجہ دینے کے قابل ڈائریکشن ایجنٹس ہیں، لیکن وہ ابھی بالکل بالغ نہیں ہوئے۔ اس کے مطابق، طب، فنانس جیسے عمودی شعبوں میں ایجنٹس کے لیے اب بھی بڑے مواقع موجود ہیں؛ اگلے مرحلے میں فرق کرنے کا کلیدی عنصر صرف ماڈل کی صلاحیت نہیں، بلکہ یہ بھی ہے کہ ایجنٹس مخصوص سیناریوز میں کتنے آسان اور استعمال کرنے لائق ہیں، اور صارفین کتنے خوش ہوں گے کہ وہ اس کا ادائیگی کریں۔
مقامی ماڈلز مختلف صلاحیتوں کو بہتر بنانے کے ذریعے ایک توڑ کا طریقہ تلاش کر رہے ہیں۔ کیمی K3 لمبے سیاق و سباق، فرانت اینڈ پروگرامنگ اور پروڈکٹ ڈیزائن کی صلاحیتوں کو مضبوط بنانے پر زور دے رہا ہے، جس نے کئی پروگرامنگ ٹیسٹس میں ٹاپ پوزیشن حاصل کی ہے اور اس کی صلاحیت بیرونی بند سربراہ ماڈلز کے قریب ہے۔
پیرامیٹر سائز اور استدلال کی کارکردگی کے درمیان مقابلہ، دوسری اہم لکیر بن گیا۔
جولائی میں جاری کیے گئے کئی ماڈلز ٹریلین اور اس سے بھی زیادہ پیرامیٹرز کے دائرے میں داخل ہو گئے، لیکن پیرامیٹر سائز کو اب آسانی سے صلاحیت کے مساوی نہیں سمجھا جا سکتا۔ MoE آرکیٹیکچر کے ترقی کے ساتھ، ماڈلز بڑے پیرامیٹر کی صلاحیت رکھ سکتے ہیں، جبکہ انفرادی استدلال کے لیے صرف ایک چھوٹا حصہ فعال ہوتا ہے، جس سے اصل کمپوٹیشن لاگت کم ہوتی ہے۔
صنعت اس طرح دو راستوں پر تقسیم ہو گئی: ایک تو سائز میں اضافہ کرنا، بڑے پیرامیٹرز کے ذریعے زیادہ طاقت حاصل کرنا؛ دوسرا کارکردگی پر زور دینا، چھوٹے ایکٹیویٹڈ پیرامیٹرز کے ذریعے فلگش ماڈل کے قریب نتائج حاصل کرنا۔
قیمت 7 کے ماڈل مقابلے میں سب سے براہ راست متغیر بن گئی۔
بیرونی فرماں زیادہ تر فرقہ وار قیمت دیں کی پالیسی اپناتی ہیں۔ OpenAI نے مارکیٹ کو مزید تقسیم کرنے کا فیصلہ کیا ہے، GPT-5.6 کو مختلف ورژنز میں تقسیم کر کے صارفین کو کام کی پیچیدگی کے مطابق متعلقہ ماڈل منتخب کرنے کی اجازت دی ہے؛ Anthropic نے اپنی بلند پرفارمنس کے لیے فلگشپ ماڈل کی راہ جاری رکھی ہے، جس میں Opus سیریز کے ذریعے اعلیٰ قیمت والے ڈویلپمنٹ اور کاروباری سیناریوز کو کور کیا جاتا ہے؛ Grok 4.5 نے سستی قیمت کی پالیسی اپنائی ہے، جس کی آؤٹ پٹ قیمت Opus سیریز کا صرف ایک چوتھائی ہے، اور Cursor کے ساتھ بندھن کے ذریعے ڈویلپرز کو متوجہ کرتا ہے۔
قومی فرموں نے زیادہ تر لاگت کے فوائد پر زور دیا ہے۔ گزشتہ چھ ماہ میں، کئی قومی ماڈل فرموں نے API کی قیمتیں مستقل طور پر کم کی ہیں، تاکہ کم لاگت کے ذریعے استعمال کی سرحدیں کم کریں اور ڈویلپرز اور کاروباری صارفین کی تعداد بڑھائیں۔
جولائی کے بڑے ماڈل مقابلے میں صرف ایک صلاحیت کی تقابلیت سے آگے بڑھ کر کوڈ، ایجینٹس، پیرامیٹر کی کارکردگی اور قیمت جیسے متعدد پہلوؤں تک پھیل گیا ہے۔
02. کون انتظار سے آگے نکلا، کون کی تعریف تقسیم ہو گئی؟
گزشتہ نسخوں کے مقابلے میں تبدیلیوں، رینکنگ کی کارکردگی اور ڈویلپرز کے ردعمل کے حوالے سے جولائی میں جاری ماڈلز کی سطح تین اقسام میں تقسیم کی جا سکتی ہے۔
سب سے زیادہ توقعات سے آگے نکلنے والی قسم کو دیکھیں: Kimi K3، Grok 4.5، ہون ہی 3۔
سب سے زیادہ توجہ کا مرکز Kimi K3 پر ہے۔ یہ ماڈل MoE آرکیٹیکچر استعمال کرتا ہے اور اس کا کل پیرامیٹر سائز تریلین سطح تک پہنچتا ہے، جس میں لمبے کانٹیکسٹ، فرانت اینڈ پروگرامنگ اور پروڈکٹ ڈیزائن کی صلاحیتوں کو خصوصی توجہ دی گئی ہے۔ جاری ہونے کے دن، Kimi K3 نے Code Arena فرانت اینڈ پروگرامنگ رینکنگ میں 1679 اسکور حاصل کرکے پہلی جگہ حاصل کی، جو پچھلے ماڈل Kimi K2.6 کی 18ویں جگہ کے مقابلے میں 17 مقامات کا بہتری تھا۔ ایک ہفتے بعد، Arena کے جامع رینکنگ میں، Kimi K3 نے پہلی بار عالمی ٹاپ 10 میں جگہ بنائی۔
لیکن کیمی K3 کی صرف واضح حدود ہیں۔ Artificial Analysis کے جانچ کے مطابق، اس کی بھوکھ کی شرح K2.6 کی 39% سے بڑھ کر 51% ہو گئی، اور اس کی پیداوار کی رفتار تقریباً 33 ٹوکن/سیکنڈ ہے، جو اس کے مساوی ماڈلز سے کافی کم ہے۔
ڈیولپرز کے عملی تجربات بھی اس "ایک طرف کی ترجیح" کی تصدیق کرتے ہیں۔ بیچینگ کا خیال ہے کہ Kimi K3 پچھلی نسل کے مقابلے میں واضح بہتری لائے ہے، جس کا فائدہ زیادہ تر فرانت اینڈ ڈویلپمنٹ، UI ڈیزائن اور پروڈکٹ اظہار میں مرکوز ہے۔ مثال کے طور پر، ویب سائٹ کے UI کو بہتر بنانے یا ایپ انٹرفیس ڈیزائن کرنے جیسے کاموں میں، Kimi K3 بہتر پروڈکٹ پیدا کر سکتا ہے، لیکن جب بھی پیچیدہ انجینئرنگ کے کاموں کا سامنا ہوتا ہے، تو اس کا عمل مستقل نہیں ہوتا۔

تصویر کا حوالہ / pexels
گروک 4.5 بھی اسی قدر توجہ کا مرکز ہے۔ 9 جولائی کو جاری ہونے کے بعد، یہ آرٹیفیشل اینالیسس اسمارٹ انڈیکس کی اولین لسٹ میں داخل ہو گیا اور کچھ ٹول کال ٹیسٹس میں اچھا پرفارم کیا، جس کی وجہ سے کئی ڈویلپرز نے اسے بہترین قیمت اور کارکردگی کا انتخاب سمجھا۔
بیچنگ کا تجربہ اسی طرح ہے، وہ سمجھتے ہیں کہ Grok 4.5 کا سب سے بڑا فائدہ اس کی رفتار ہے، ایک ہی ضرورت کو اس کے ساتھ صرف تین سے پانچ منٹ میں مکمل کیا جا سکتا ہے، جبکہ GPT-5.6 کے ساتھ کبھی کبھی بیس سے تیس منٹ لگ جاتے ہیں، اور قیمت کم ہونے کی وجہ سے جلدی ترقی کی ضرورت والوں کے لیے موزوں ہے۔ یائو یوہانگ کا خیال ہے کہ Grok 4.5 کی پروگرامنگ صلاحیت کو خصوصی طور پر بہتر بنایا گیا ہے، اور Cursor کے ساتھ استعمال کرنے پر مجموعی تجربہ بہت اچھا ہے۔ ایک پس منظر یہ ہے کہ SpaceX نے پہلے Cursor کی ماں کمپنی Anysphere کو خریدنے کا اعلان کیا تھا، جس کا معاملہ تیسرے تریمین میں مکمل ہونے کا تخمنا ہے؛ xAI اور Cursor کے درمیان ڈیٹا تعاون کو بھی Grok 4.5 کے پروگرامنگ تجربے کو بہتر بنانے میں مدد دینے والا سمجھا جاتا ہے۔
ہائی 3 کا مطلب ہے کہ کارکردگی کے راستے میں کامیابی حاصل ہوئی ہے۔ اس ماڈل کے کل پیرامیٹرز 295B ہیں، جبکہ فعال پیرامیٹرز صرف 21B ہیں، اور یہ اپنے پیرامیٹرز کے سائز کو فلگشپ ماڈل کے پانچویں حصے سے کم رکھ کر، کئی عوامی بنچ مارکس میں زیادہ بڑے مقابلہ کن ماڈلز کے قریب کارکردگی دکھاتا ہے۔ تاہم، SWE-Bench Pro میں، ہائی 3 کا اسکور 57.9 ہے جبکہ Claude Opus کا 69.2 ہے، جس سے ظاہر ہوتا ہے کہ پیچیدہ کوڈ فکس کی صلاحیت ابھی تک پیچھے ہے۔
یائو یوہانگ کا خیال ہے کہ ہی 3، تینگین کے پچھلے ماڈلز کے مقابلے میں ترقی کا مظاہرہ کرتا ہے، اور اس کا اوپن سورس اور چھوٹا سائز ڈیزائن متوسط سائز کے ماڈلز میں ایک اچھا انتخاب ہے۔
ایک اور کیٹیگری جو مستقل طور پر پہلے گروپ میں ہے لیکن حیرت انگیز چیزیں محدود ہیں: GPT-5.6 Sol اور Claude Opus 5۔
GPT-5.6 Sol اور Claude Opus 5 اب بھی پہلی گروپ میں موجود ہیں، لیکن کوئی بڑا تبدیلی نہیں آئی۔ GPT-5.6 Sol نے پیچیدہ استدلال اور ایجنٹ پروگرامنگ کی صلاحیت کو مضبوط کیا ہے، جس نے Terminal-Bench (جس میں ماڈل کی کمانڈ لائن ماحول میں حقیقی کاموں کو مکمل کرنے کی صلاحیت کا امتحان لیا جاتا ہے) 2.1 ٹیسٹ میں 88.8% کا اسکور حاصل کیا، جبکہ Ultra موڈ میں یہ نمبر 91.9% تک پہنچ گیا۔ Claude Opus 5 نے پیچیدہ کاموں میں اپنا فائدہ برقرار رکھا ہے اور پیچیدہ انجینئرنگ، کوڈ سمجھنے اور سیکورٹی تجزیہ جیسے مناظر میں ماڈل کی قابلیت پر زور دیا ہے۔ Opus 5 کا فائدہ یہ ہے کہ اس کی کارکردگی Fable 5 کے قریب ہے، جبکہ اس کی قیمت صرف اس کا آدھا ہے۔
دونوں ماڈل اب بھی پہلی ٹیم میں ہیں، لیکن انہوں نے کوئی بڑا کردار ادا نہیں کیا۔
بیچینگ نے کہا کہ GPT-5.6 اس کی زیادہ تر روزمرہ ڈویلپمنٹ کی ضروریات کو پورا کر سکتا ہے، لیکن جب خاص طور پر پیچیدہ مسائل کا سامنا ہوتا ہے تو وہ Opus 5 کو استعمال کرتا ہے۔ تاہم، زیادہ طاقت کا مطلب زیادہ لاگت ہے۔ اس کے لیے، Opus 5 کا مقام اہم مسائل حل کرتے وقت استعمال ہونے والے "ماہر" کے قریب ہے۔
آخر میں، جس کی فیڈبیک میں فرق ہے اور ابھی تصدیق کا انتظار ہے، وہ ہیں: Gemini 3.6 Flash اور Qwen3.8-Max پریویو ورژن۔
سب سے عام مثال Gemini 3.6 Flash ہے۔ یہ Artificial Analysis اسمارٹ انڈیکس پر 50 کا اسکور حاصل کرتا ہے، جو اس کے پچھلے ورژن 3.5 Flash کے برابر ہے۔ ڈویلپر کمیونٹی کی زیادہ تر رائے یہ ہے کہ اس نسل میں پچھلی نسل کے مقابلے میں کوئی واضح بہتری نہیں ہوئی اور اس کی کارکردگی اسی دور کے مقابلہ کرنے والوں سے کم ہے۔ تاہم، کچھ لوگ اس بات سے متفق ہیں کہ ایک ہلکا پھلکا ماڈل کے طور پر، Gemini 3.6 Flash کی آؤٹ پٹ کوالٹی بنیادی طور پر قابل قبول ہے۔
انڈیپینڈنٹ ڈویلپر کپڈیم کے خیال میں، جیمنی 3.6 فلیش کا روزمرہ کا استعمال بہترین ہے، ہاں کہ اس کی پروگرامنگ صلاحیت زیادہ نہیں، لیکن اس کی متعدد ماڈل سمجھ بھی بہت اچھی ہے۔ یہ کسی بھی فائل فارمیٹ کو ان پٹ کرنے کی سہولت فراہم کرتا ہے، اور روزمرہ کی چیٹنگ کا انداز اور تجربہ بہت سارے مقابلہ کرنے والے پروڈکٹس سے بہتر ہے۔
Qwen3.8-Max پیش نمایش ورژن کو جولائی میں لانچ کیا گیا، لیکن ماڈل کا اداء بے ثبات رہا اور مارکیٹ کے ردعمل میں فرق دیکھا گیا۔ شمالی شہر کو سب سے زیادہ احساس یہ ہوا کہ Qwen3.8-Max پیش نمایش ورژن کی سوچنے کی گہرائی زیادہ ہے، لیکن کبھی کبھار یہ لمبے وقت تک استدلال میں پھنس جاتی ہے، "جیسے خود کو گھیر لے"، لیکن آخرکار کوئی مؤثر حل پیش نہیں کرتی۔ کارپڈم کا خیال ہے کہ Qwen3.8-Max پیش نمایش ورژن توقعات سے کم تھا، جب انہوں نے اپنے فرانت اینڈ اسٹائل ٹیسٹ سیٹ پر ٹیسٹ کیا تو عملی صلاحیت اور دعوؤں میں واضح فرق نظر آیا۔ اس کے باوجود، چونکہ یہ اب بھی تبدیلیوں کے تحت ایک پیش نمایش مصنوعات ہے، اس کا نتیجہ صرف رسمی ورژن کے لانچ کے بعد ہی تصدیق ہوگا۔
جولائی میں کوئی ایسا ماڈل نہیں تھا جو تمام ابعاد میں اگے رہا، مختلف ماڈلز اب مخصوص سیناریوز کے لیے تقسیم ہونے لگے۔
شمالی شہر کے لیے، وہ کام کے مطابق ٹولز کا انتخاب کرتا ہے: GPT-5.6 روزمرہ کے ترقی کے لیے، Grok 4.5 ضروریات کو جلدی مکمل کرنے کے لیے، Kimi K3 کو مصنوعات اور فرانت اینڈ کے مناظر کے لیے استعمال کرتا ہے، جبکہ Claude Opus 5 پیچیدہ مسائل کو حل کرنے کے لیے ذمہ دار ہے۔ کپڈیم کا انتخاب الگ ہے، وہ منصوبہ بندی کے لیے Claude کے Fable 5 یا Opus 5 ماڈلز استعمال کرتا ہے، اور پھر GPT-5.6 Sol کے ذریعے انجام دیتا ہے۔
03. اشاعت تیزی سے بڑھ رہی ہے، اوپن سورس اور پروپریٹری کے درمیان جدوجہد تیز ہو رہی ہے
اس مکثف شدہ اشاعت کے پیچھے کچھ سوالات قابل تجزیہ ہیں: ماڈل کی ترقی کیوں تیز ہو رہی ہے، کیوں یہ سب جولائی میں مرکوز ہو رہی ہے، اور اوپن سورس کیوں موجودہ بازار کے ماڈلز کو متاثر کر رہا ہے۔
سب سے پہلے، ماڈل کی ترقی کا طریقہ تبدیل ہو رہا ہے۔ گزشتہ زمانے میں، بڑے ماڈلز کی صلاحیت میں اضافہ بنیادی طور پر بڑے پیمانے پر نئے ماڈلز کو دوبارہ تربیت دے کر کیا جاتا تھا، جس کا دور طویل اور لاگت زیادہ ہوتی تھی۔ لیکن تقویتی سیکھنے، اور بعد کی تربیت (بنیادی ماڈل کی تربیت کے بعد، مائکرو ٹیوننگ، تقویتی سیکھنے جیسے طریقوں کے ذریعے ماڈل کی کارکردگی کو مزید بہتر بنانا) جیسی ٹیکنالوجیز کے بالغ ہونے کے ساتھ، ماڈل اپ گریڈیشن زیادہ تر بعد کی تربیت پر منحصر ہو رہا ہے۔
یائو یوہانگ نے "ڈنگ جیو One" کو بتایا کہ پچھلے دو سالوں میں ماڈل جاری کرنے کی رفتار واضح طور پر تیز ہو گئی ہے، اور اس کا ایک اہم سبب یہ ہے کہ صنعت نے زیادہ بالغ پوسٹ ٹریننگ طریقے سیکھ لیے ہیں۔ اب بہت سے ماڈلز کی بہتری کے لیے نیا ماڈل دوبارہ ٹرین نہیں کیا جاتا، بلکہ موجودہ بنیادی ماڈل پر مزید بہتری کے لیے تقویتی سیکھنا، خود کو دوبارہ ترقی دینا اور دیگر طریقے استعمال کیے جاتے ہیں۔
اس کا مطلب یہ ہے کہ ماڈل کی مقابلہ کی دورانیہ مختصر ہو رہی ہے۔ گزشتہ میں، ایک لیڈنگ ماڈل کئی ماہ تک برتری برقرار رکھ سکتا تھا؛ اب، ورژن اپڈیٹ کی وجہ سے برتری کا ونڈو صرف کچھ ہفتے ہو سکتا ہے۔ اگر آپ اپنی ریلیز رفتار کو نہیں بڑھا پائے، تو آپ جلد ہی نئے ورژن سے اوور رائٹ ہو جائیں گے۔ فرنڈز کے لیے، ماڈل ریلیز صرف ٹیکنالوجی کا مظاہرہ نہیں ہے، بلکہ ریلیز کا وقت خود بھی مقابلے کا حصہ بن چکا ہے۔

تصویر کا حوالہ / pexels
دوسرے، جولائی کئی نوڈس کا ایک مجموعہ ہے۔ گھریلو فرماں کے لیے، عالمی صنعتی ذہانت کانفرنس (WAIC) جولائی میں منعقد ہوتی ہے، جس کے دوران فرماں اپنے ماڈلز جاری کرتی ہیں اور تکنیکی پیش رفت کا جائزہ لیتی ہیں۔ غیر ملکی فرماں کے لیے، کئی ٹاپ کمپنیاں بھی اس دوران ماڈلز اپ ڈیٹ کرنے کا انتخاب کرتی ہیں تاکہ ڈویلپر اکوسسٹم اور تجارتی مقابلے میں اپنا مثبت موقف حاصل کر سکیں۔
علاوہ ازیں، صنعت کے مقابلے کے قوانین تبدیل ہو رہے ہیں۔ صرف ماڈل کی صلاحیت کافی نہیں، مقابلہ اب اس بات پر بھی مرکوز ہے کہ ماڈل کا استعمال کیسے کیا جائے اور اسے آمدنی میں کیسے تبدیل کیا جائے۔
یہی وجہ ہے کہ جولائی میں اوپن سورس اور پروپریٹری کے درمیان بحث دوبارہ تیز ہو گئی۔ طویل عرصے سے، اوپن سورس ماڈلز اور پروپریٹری ماڈلز کے درمیان صلاحیتوں کا فرق رہا ہے۔ لیکن جب کچھ اوپن سورس ماڈلز پہلی ٹیم میں داخل ہو گئے، تو ایک زیادہ عملی سوال ابھرا: جب اعلیٰ کارکردگی والے ماڈلز مفت دستیاب ہو سکتے ہیں، تو ماڈل کمپنیوں کے API کالز اور سبسکرپشن آمدنی پر اثر پڑے گا؟
اوپن سورس کے حامیوں کا خیال ہے کہ اوپن ویٹس سے ٹیکنالوجی کی رکاوٹیں کم ہوتی ہیں اور زیادہ کمپنیاں اور ڈویلپرز AI انویشن میں شامل ہو سکتے ہیں۔ اوپن سورس کا مطلب ہے کہ ٹیکنالوجی فراہم کنندہ خود بخود کچھ فائدے ترک کرتا ہے تاکہ ایکوسسٹم کو فروغ دیا جا سکے؛ جبکہ بند سورس فریق اپنے صارفین کو اوپن سورس ماڈلز سے الگ ہونے کا خدشہ رکھتے ہیں۔ Anthropic جیسی کمپنیاں سمجھتی ہیں کہ جب ماڈل کی صلاحیت بڑھتی ہے، تو اوپن ویٹس سے متعلق خطرات بڑھ سکتے ہیں اور اس کے لیے زیادہ سخت حکومت کی ضرورت ہوتی ہے۔
اس بحث کے پیچھے، دراصل مختلف کمپنیوں کے مفاد کی خواہشات ہیں۔ انفراسٹرکچر کمپنیوں جیسے نوڈیا کے لیے، ماڈل کا اوپن سورس ہونا زیادہ ڈیپلومنٹ کی درخواستوں اور زیادہ کمپوٹیشنل مارکیٹ کا مطلب ہے۔ جبکہ OpenAI، Anthropic جیسی ماڈل کمپنیوں کے لیے، بند سورس ماڈل API کالز اور سبسکرپشن آمدنی کو برقرار رکھتے ہیں۔ تاہم، دوسری طرف بھی دیکھنا ضروری ہے: اوپن سورس ڈیپلومنٹ کی درخواستوں کو بڑھاتا ہے، لیکن پیرامیٹر کی کارکردگی میں اضافے کے ساتھ، ہر ٹاسک کے لیے کمپوٹیشنل استعمال بھی کم ہو سکتا ہے، اور کمپوٹیشنل مارکیٹ میں اضافہ ماڈل کے اوپن سورس ہونے کے ساتھ مساوی نہیں ہو سکتا۔ گھریلو فرماں کے لیے، وزن کا اوپن سورس ہونا صرف ٹیکنالوجی کا انتخاب نہیں، بلکہ ڈولپرز کے ایکوسسٹم، کلاؤڈ سروسز اور بعد کے تجارتی ترقی کے راستوں کو حاصل کرنے کا طریقہ بھی ہے۔
جولائی کے بعد، بڑے ماڈلز کی مقابلہ جاری رہے گا۔ ڈویلپر کمیونٹی کا عام طور پر خیال ہے کہ DeepSeek V4 کا رسمی ورژن، Fable 5.1، GPT-6 جیسے نئے ماڈلز اگست میں تدریجاً جاری کئے جائیں گے۔
ماڈل کی صلاحیتوں کا فرق کم ہو رہا ہے، اور صرف ایک زیادہ طاقتور ماڈل جاری کرکے لمبے عرصے تک فائدہ حاصل کرنا مشکل ہوتا جا رہا ہے۔ اگلے پر نظر رکھنے کے لیے کچھ خاص اشاریے ہیں: DeepSeek V4 کا رسمی ورژن اوپن سورس ماڈلز کی صلاحیت کو کہاں تک بلند کرتا ہے، API کی قیمتیں مزید کم ہوتی ہیں یا نہیں، ایجنٹس کے لیے مستقل ادائیگی کے مناظر ظاہر ہوتے ہیں یا نہیں، اور اوپن سورس ماڈلز زیادہ کمپنیوں میں پرائیویٹ ڈپلویمنٹ میں داخل ہوتے ہیں یا نہیں۔ ان سوالات کے جوابات، لسٹوں کے درجات سے زیادہ واضح کریں گے کہ اس لڑائی نے حقیقت میں کیا بدل دیا ہے۔
*تصویر کا اصل ذریعہ Pexels ہے۔
