ترتیب دیں اور ترجمہ کریں: شن چاؤ ٹیک فلو

مہمان: جارڈن اور میکس، سیمی اینالیسس تجزیہ کار
میزبان: جارڈن (سیمی اینالیسس اندر ڈائیلاگ)
پاڈکس سرچ: SemiAnalysis
اصل عنوان: [اضطراری ایپی سوڈ] مون شاٹ کا کیمی K3 آ گیا! چین کے پاس ایک فرنٹیئر ماڈل ہے
تاریخ پریمیئر: 18 جولائی 2026
اہم نکات
مون شاٹ (مہ کا اندھیرا پہلو) نے کیمی کے K3 کا اطلاق کیا ہے، جو کہ متعدد جامع بینچ مارکس پر گوگل اور میٹا کو پیچھے چھوڑ کر دنیا کا تیسرا بہترین ماڈل بن گیا ہے، جو صرف Anthropic کے Fable اور OpenAI کے Soul 5.6 سے پیچھے ہے۔ SemiAnalysis کے دو تجزیہ کار جارڈن اور میکس نے ایک فوری پروگرام میں اس اطلاق کے مفہوم کو تفصیل سے سمجھایا: 2.8T پیرامیٹرز والا ماڈل Sonnet کے برابر قیمت (3/15 فی ملین ٹوکنز) پر خدمات فراہم کرتا ہے، اگر یہ سب سے آگے کے بند ماڈلز کے سائز کے برابر ہے، تو Anthropic کا 10/50 کا منافع ممکنہ طور پر ذہن کو حیران کر دینے والا سطح کا ہو سکتا ہے۔
Jordan کی طرف سے مزید تیز جائزہ: سرحدی فرق کم ہو رہا ہے، جس کا وہ سبب امریکی حکومت کی Anthropic/OpenAI کو اپنے طاقتور ترین ماڈلز جاری کرنے پر پابندی لگانے کا بتاتا ہے، جس سے پیچھے رہنے والوں کو ایک مصنوعی وقت کا دروازہ ملا۔ اوپن سورس اصل میں پیچھے نہیں ہوا۔ اس کے علاوہ، مغربی اوپن سورس مکمل طور پر خالی ہے، امریکی کمپنیوں کا کوئی بھی اوپن سورس ماڈل چین کے پانچویں بہترین ماڈل کے برابر نہیں ہو سکا۔ ماڈل مقابلہ اب harness (ٹولز کا استعمال) اور جغرافیائی سیاسی مقابلے میں تبدیل ہو رہا ہے۔
اہم نظریات کا خلاصہ
کیمی K3 کی پوزیشن کے بارے میں
- اگر آپ تمام اہم بینچ مارکس کی مجموعی درجہ بندی دیکھیں، تو آج ایک بہت واضح ٹاپ تین ہے: فیبل، سول 5.6 اور کیمی K3۔ وہ ہمیشہ دوسرے سب سے بلند ہیں، جس میں ڈیپ سیک بھی شامل ہے، اور گوگل، میٹا اور xAI بھی۔
- گوگل کو بہت بڑی شرمندگی کا احساس ہونا چاہیے۔ صرف 2025 کے نومبر اور دسمبر میں، سب کو لگتا تھا کہ AI کے تین بڑے کھلاڑی گوگل، اینتھروپک اور اوپن اے آئی ہیں۔ آج کچھ "پرانے لوگوں" سے بات کرتے ہیں، وہ اب بھی ایسای سمجھتے ہیں، لیکن واضح طور پر ایسا نہیں ہے۔
- یہ دنیا کا دوسرا بہترین ماڈل ہو سکتا ہے، کیونکہ جب بھی میں Fable کا استعمال کرکے کچھ سنجیدہ کام کرتا ہوں، تو میری درخواست مسترد ہو جاتی ہے اور Opus پر واپس بھیج دی جاتی ہے۔ حالانکہ میں یقینی طور پر نہیں جانتا کہ یہ Opus سے بہتر ہے یا نہیں، لیکن کم از کم میری درخواست مسترد نہیں ہوتی۔
فرنٹ رن ماڈل کی منافع کی شرح کے بارے میں
- اگر کیمی نے 3/15 کے سطح پر K3 فراہم کیا اور اس میں نقصان نہیں ہوا، تو Fable جو تقریباً اتنی ہی سایز کا ہے لیکن 10/50 وصول کرتا ہے، تو AI لیبارٹریز کے غیر منافع بخش کاروبار ہونے کے خوف کو مکمل طور پر ختم کر دے گا۔ API قیمت پر ٹوکن فروخت کرنا، SaaS سے زیادہ منافع بخش ہو سکتا ہے۔
- K2.7 سے K3 تک قیمت تین گناں سے زیادہ بڑھ گئی، 0.95/4 سے بڑھ کر 3/15 ہو گئی۔ لیکن مجھے نہیں لگتا کہ ان کے پاس اب بھی کوئی زیادہ قیمت بڑھانے کا راستہ باقی ہے، کیونکہ بہت سے کام GLM یا MiniMax M3 سے پورے ہو جاتے ہیں۔
امریکی حکومت اور فرق کے بارے میں
- میں یہ مانتا ہوں کہ اس فرق کے کم ہونے کا سبب صرف امریکی حکومت کی طرف سے Anthropic پر پابندیاں ہیں، جس کی وجہ سے ہم ان کمپنیوں کے اصلی طاقتور مدلز تک نہیں پہنچ سکتے۔ وہ مصنوعی طور پر ہم تک پہنچ گئے ہیں۔
- ہم صرف اس صورت میں اس تک پہنچ سکتے ہیں جب اگلے سطح کے ذکاوت کی اجازت دی جائے۔ یہ پیچھے والے چوتھے، پانچویں، چھٹے اور ساتویں نمبر والے کھلاڑیوں کے لیے ایک موقع ہے۔
关于西方开源真空
- مکمل مارکیٹ اب بھی اتنی ناکارہ ہے کہ ہمیں امریکہ سے ایک بھی کمپنی نہیں مل رہی جو چین کی پانچویں بہترین کمپنی کے ساتھ کم از کم مطابقت رکھ سکے، جس سے میں حیران ہوں۔
- اگرچہ حکومت چینی اوپن سورس ماڈلز کو منع نہ کرے، تو عام امریکی بڑی کمپنیاں اپنے ملکی ڈیٹا کو چینی اوپن سورس ماڈلز کو فیڈ نہیں کرنا چاہیں گی۔ اگرچہ آپ اپنے وزن کو ایئر گیپ ڈیٹا سینٹر میں لوڈ کریں، اور سی سی پی آپ کے ڈیٹا کو نہیں دیکھ سکتا، مینجمنٹ بھی اس پر اتفاق نہیں کرے گی۔
ہارنیس کے بارے میں
- کیمی K3 کا ٹیسٹ کرکے میں نے پہلی بار اوپن کوڈ، ہرمس اور پائی کو سنجیدگی سے دیکھا۔ ہارنیس اب بھی مصنوعات کا حصہ ہے۔
- کچھ سادہ چیزیں مجھے اس ماڈل کو اس کے بجائے دوسرے پر منتخب کرنے کیلئے مجبور کرتی ہیں: کیا اسے ریموٹ SSH سرور پر انسٹال کیا جا سکتا ہے؟ شارٹکٹس استعمال کرنے میں آسان ہیں؟ ان ہارنیس کے تفصیلات حقیقت میں میرے ٹوکن کو کہاں بھیجنا ہے، یعنی بجٹ کو کہاں بھیجنا ہے، اس پر اثر انداز ہوتی ہیں۔
"ابھی بہت جلد ہے" کے بارے میں
- میں نے پچھلے ہفتے ICML میں شرکت کی، اور اس سے پہلے ہفتے AI Engineer کانفرنس میں۔ یہ ایک نامیاتی AI کانفرنس تھی، جہاں 80 فیصد سے زیادہ لوگوں نے SemiAnalysis کے بارے میں کبھی سننا نہیں تھا۔ آپ کہتے ہیں کہ آپ AI صنعت میں کام کرتے ہیں، لیکن آپ نے SemiAnalysis پڑھا بھی نہیں؟ ہم ابھی بہت جلد ہیں۔
کیمی K3 کیا دنیا کا تیسرا بہترین ماڈل ہے؟
جورڈن: تیز رفتار جائزہ، کیمی K3 اب دنیا کا تیسرا بہترین ماڈل ہے؟
میکس: جواب واضح "ہاں" ہے۔ سب کو بینچ مارک کی شکایت کرتے ہوئے دیکھنا پسند ہے، اور بینچ مارک میں بالفعل مسائل ہیں، لیکن اگر آپ تمام اہم بینچ مارکس کا مجموعی رینکنگ دیکھیں، تو ان کا رجحان ہمیشہ درست رہا ہے۔ آج ایک بہت واضح ٹاپ تین ہے: فیبل، سول 5.6 اور کیمی K3، جو دیگر سب کو، جن میں ڈیپ سیک جیسے اوپن سورس کھلاڑی بھی شامل ہیں، اور گوگل، میٹا اور xAI کو بھی واضح طور پر پیچھے چھوڑ رہے ہیں۔ یہ مہینے کے اندھیرے کے ٹیم کے لیے انتہائی عظیم کامیابی ہے۔
گوگل کو بہت بڑی شرمندگی کا احساس ہونا چاہیے۔ صرف 2025 کے نومبر اور دسمبر میں، سب کو لگتا تھا کہ AI کے تین بڑے کھلاڑی گوگل، اینتھرپک اور اوپن اے آئی ہیں۔ آج کچھ "پرانے لوگوں" سے بات کرتے ہوئے، وہ اب بھی ایسا سمجھتے ہیں، لیکن واضح طور پر ایسا نہیں ہے۔
کلی طور پر، میں ابھی بھی اسے Fable اور Soul 5.6 کے مقابلے میں کم بہتر سمجھتا ہوں۔ مزیدار بات یہ ہے کہ وہ اپنے ماڈل کے بلاگ پوسٹ میں بھی صاف طور پر یہی کہتے ہیں۔ شاید یہ پرانے طرز کی چینی متواضعہ رویہ ہے، یا پھر امریکی حکومت کے جانچ کو بھٹکانے کے لیے نہ ہونا چاہتے ہیں، خاص طور پر جب Fable 5.6 کی ریلیز میں بھی کچھ تاخیر ہوئی تھی۔ لیکن کوئی فرق نہیں پڑتا، یہ بہت متاثر کن ہے۔
جورڈن: وہ اپنے بلاگ کے "محدودیتیں" حصے میں لکھتے ہیں: "ہرچند K3 کلی طور پر ایک بہت زبردست ماڈل ہے، لیکن صارف تجربے میں Fable 5 اور GPT 5.6 کے ساتھ واضح فرق موجود ہے۔" میرا ذاتی تجربہ یہ ہے کہ یہ واقعی اچھا ہے، لیکن بہت سست ہے، جو بہت پریشان کن ہے۔ اس نے مجھے open source harness آزمانے کا پہلا جذبہ دیا۔ سچ بولوں تو، مجھے harness کے بارے میں زیادہ سیکھنے کو ملا، نہ کہ ماڈل کے بارے میں، کیونکہ یہ تمام ماڈل میری موجودہ بنیادی کاموں کو پورا کرنے کے لیے کافی اچھے ہیں، اور میرے لیے ایسا کوئی پیچیدہ کام تلاش کرنا مشکل ہے جسے یہ نہ کر سکے۔
یہ میرے لیے شاید دنیا کا دوسرا بہترین ماڈل ہو سکتا ہے، کیونکہ جب بھی میں Fable کا استعمال کرتا ہوں تو میری درخواست مسترد ہو جاتی ہے اور Opus پر واپس بھیج دی جاتی ہے۔ ہرگز یقین نہیں کہ یہ Opus سے بہتر ہے، لیکن مسترد ہونے کا خود ہی مسئلہ کم تکلیف دہ ہے۔ تاہم، جب آپ API کی کے ذریعے استعمال کرتے ہیں تو آپ کو مسترد نہیں کیا جاتا، صرف ویب کنسول یا گہری تحقیق کے دوران حد پار ہو جاتی ہے۔ وضاحت ہے کہ اس ماڈل کی مانگ کو پورا کرنے کے لیے ان کے پاس کافی GPU نہیں ہے۔ پہلے اس مسئلے کو اوپن سورس اسٹریٹجی سے حل کیا جاتا تھا، جس میں وزن شائع کر دیے جاتے تھے تاکہ دوسرے ان کا استعمال کر سکیں۔ لیکن اس بار تک وزن شائع نہیں کیے گئے، اور وہ کہتے ہیں کہ وہ 10 دن بعد جاری کریں گے۔
وزن کو کیوں 10 دن تک متعارف کرایا جا رہا ہے
جورڈن: کیا آپ کو لگتا ہے کہ یہ تاخیر کی حکمت عملی کیا ہے؟
میکس: واضح کر دیں، یہ سب میری صرف تخمینی باتیں ہیں۔ ایک بڑا سبب یہ ہو سکتا ہے کہ وہ vLLM اور SGLang جیسے انفرینس انجن ٹیموں کو کافی وقت دینا چاہتے ہیں تاکہ یہ مدل کو اعلیٰ پرفارمنس کے ساتھ سروس کر سکیں۔ اگر آج ہی وزن جاری کر دیے جائیں تو سب کوئی سروس کر رہا ہوگا لیکن صرف 20 ٹوکن/سیکنڈ کے ساتھ، جو ان کے برانڈ کی حاصل کرنے کے لیے بہت خراب ہوگا۔ ان کے پاس اب ایک بہترین موقع ہے کہ وہ بڑی مقدار میں پی آر اور استعمال حاصل کریں، لیکن اگر اسے جاری کرتے ہی پرفارمنس کی وجہ سے گھٹ جائے تو یہ رفتار کو کمزور کر دے گا۔
ایک اور امکان یہ ہے کہ وہ Together AI، Fireworks، Nebius، Groq جیسی انفرینس سروس فراہم کنندگان کے ساتھ گٹھbandھی کر رہے ہیں تاکہ وہ GB300 جیسے نئے چپس کا استعمال کرتے ہوئے اضافی کیپیسٹی فراہم کر سکیں۔ یہ دونوں وجوہات 10 دن کی تاخیر کی بنیادی وجوہات ہیں۔
فرنٹ لائن ماڈل کا زبردست منافع
جورڈن: مدل کی ساخت پر بات کرتے ہیں۔ اس میں 2.8T پیرامیٹرز ہیں، جو B200 میں نہیں آ سکتے، آپ کو B300، GB300 یا AMD MI355X درکار ہوگا تاکہ ایک منفرد 8-کار HGX سرور پر اس مدل کو سروس دیا جا سکے۔ بالکل آپ پیپلائن پیرلیلزم کو نوڈس کے درمیان استعمال کر سکتے ہیں، لیکن اس سے پرفارمنس پر شدید اثر پڑے گا۔ اس لیے صرف جدید ترین چپ رکھنے والے ہی اس مدل کو سروس دے سکتے ہیں۔
آپ نے جب گوگل کے بارے میں بات کی تھی، اس کا یہ مدل 2.8 ٹرین پیرامیٹرز پر ایک سرحدی مقابلہ کرنے لگا، جو ہمیں بند ماڈلز کے سائز کے بارے میں کچھ اشارے دیتا ہے۔ اگر وہ اس کے مقابلے میں 10 ٹرین پیرامیٹرز والے ماڈل استعمال کر رہے ہیں، تو وہ اور بھی بدنام ہو جائیں گے۔ ہمیں یہ فرض کرنا چاہیے کہ یہ Soul اور Fable کے ایک ہی سطح پر ہے۔
میکس: ہاں، آپ درست کہ رہے ہیں۔ میں ابھی بھی Anthropic کے تحقیقی ٹیم کی صلاحیت اور تیزی پر یقین رکھتا ہوں۔ اگر ٹویٹر پر کوئی کہتا ہے کہ موجودہ بند ماڈل میں 10T پیرامیٹرز ہیں، تو اگر یہ سچ ہے، تو بھائی، آپ کو سامان باندھ لینا چاہئے، نوڈا کے شیئرز کل 50 فیصد گر جائیں گے، اور سب کچھ ختم ہو جائے گا۔
میں کافی مطمئن ہوں کہ کیمی K3 موجودہ لیڈنگ بند ماڈل سے کافی چھوٹا نہیں ہوگا، بلکہ شاید تھوڑا بڑا بھی ہو سکتا ہے۔ اگر یہ سچ ہے، تو یہ SemiAnalysis میں ہمیشہ زور دیے جانے والے ایک نقطہ کی مزید تصدیق ہے: ان بند لیبارٹریز کا منافع بالکل mindboggling سطح کا ہے۔ اگر کیمی احتمالاً 3/15 کی قیمت پر K3 کو فراہم کرتے ہوئے نقصان نہیں اٹھا رہا، جیسا کہ Sonnet کی قیمت ہے؛ جبکہ Fable کا سائز تقریباً اتنے ہی ہے لیکن اس کی قیمت 10/50 ہے، تو AI لیبارٹریز کے منافع نہ کمانے کے خوف کو مکمل طور پر ختم کر دینا چاہئے۔ آج کے لحاظ سے، API قیمت پر ٹوکن فروخت کرنا SaaS سے بھی زیادہ منافع بخش ہو سکتا ہے۔
جورڈن: کوئی ملازمت کا اخراج نہیں، صرف GPU۔ پچھلی قیمتوں کے مقابلے میں کیا ہے؟ آپ نے 3/15 کہا، لیکن پچھلی نسخہ مون شوٹ کی مستقیم قیمت 0.95/4 تھی، اس لیے K2.7 سے K3 تک قیمت میں تین گنا سے زیادہ اضافہ ہوا۔ ان کے پاس اب تک کتنی قیمت بڑھانے کی جگہ باقی ہے؟
میکس: میں نہیں سمجھتا کہ ان کے لیے اب تک کچھ زیادہ جانے کا کوئی جگہ باقی ہے۔ حتیٰ کہ 3/15 کے اس قیمت پر بھی بہت سے لوگ اسے زیادہ مہنگا سمجھیں گے۔ ان کے کاموں کے لیے GLM یا MiniMax M3 کافی ہیں۔ یہاں ایک دلچسپ تقسیم ہے: جیسے ہم SemiAnalysis جو Dylan کے ٹوکن کو جلانے سے پریشان نہیں ہوتے، وہ Fable کا استعمال کرتے رہیں گے تقریباً ہر چیز کے لیے؛ جبکہ بہت زیادہ لاگت حساس، جیسے Tesla، Uber جو ایک ہفتے میں صرف $200 کے ٹوکن استعمال کرتے ہیں، وہ GLM کی قیمت سطح پر جائیں گے۔ تو واقعی Kimi K3 پر منتقل ہونے والے صارفین کون ہوں گے؟ شاید صرف وہ لوگ جو فلسفیانہ طور پر اوپن سورس سے محبت کرتے ہیں اور نئے ماڈلز کو سپورٹ کرنا چاہتے ہیں۔ کیا بڑی کمپنیاں اس ماڈل کو اپنائیں گی؟ میرا جواب منفی ہونے پر حیران نہیں ہوں گا۔
نیا آرکیٹیکچر اور اگلے مرحلہ
جورڈن: یہ ایک مکمل طور پر نیا آرکیٹیکچر ہے۔ 2.8T پیرامیٹرز، جس میں Kimi کا delta attention، potential residuals، اور stable latent شامل ہیں، جو تقریباً پچھلے ماڈل کا دوگنا حجم ہے۔ پہلے K2.5 پر، ہم نے دیکھا کہ Cursor نے اسے composer کے طور پر استعمال کیا، جو continued pre-training اور MRL کے بنیاد پر تھا، اس کے بعد 2.5، 2.6، 2.6.7 جیسے checkpoint جاری ہوئے۔ یہ ایک نیا base model ہے، لیکن اسے استعمال کرتے وقت پہلے کے ماڈل میں عام طور پر دیکھے جانے والے خشن کناروں کا کوئی مسئلہ نہیں ہے۔ اگلا قدم کیا ہے؟ 3.1 کب آئے گا؟ قیمت میں تبدیلی آئے گی؟ کیا K3 پر مبنی composer آئے گا؟
میکس: K3 کے بنیاد پر کمپوزر ایپلیکیشن نہیں ہوگا، کرسر کے لوگوں نے اپنا مدل صفر سے ٹرین کرنے کا فیصلہ کر لیا ہے۔ K3.1، K3.2 جیسے ورژن کے بارے میں، اگلے ایک یا دو ماہ میں دو یا تین اپڈیٹس آئیں گے، جو صرف پوسٹ ٹریننگ جاری رکھیں گے۔ قیمتیں میں میں سمجھتا ہوں کہ وہی رہیں گیں، کیونکہ وہ اگلے دو تین ماہ میں نئے ہارڈویئر پر نہیں چل پائیں گے، اور اس لیے تھروپٹ میں کوئی اضافہ نہیں ہوگا جس سے قیمت کم ہو سکے۔ شاید کوئی بہت ہی ماہر کرنل انجینئر لاگت کو DeepSeek V4 کے سطح تک کم کر دے، لیکن 3T پیرامیٹر ماڈل کے لیے اسے حاصل کرنا میرے لیے مشکل لگتا ہے۔ موجودہ GLM اور MiniMax کی قیمتیں شاید 1T سے 1.5T ماڈل کے لیے سروس دینے کا حدِ انتہا ہوں۔
کیا اوپن سورس، کلوزڈ سورس کو پیچھے چھوڑ دے گا؟
میکس: زیادہ دلچسپ سوال یہ ہے کہ اوپن سورس اور کلوڈ سورس کے درمیان فرق کیا مزید کم ہوگا، اور کیا اوپن سورس حقیقت میں اعلیٰ سطح کے برابر تک پہنچ سکتا ہے۔ اگر یہ واقع ہوا، تو یہ پورے صنعت پر بہت بڑا اثر ڈالے گا۔ آپ کی رائے کیا ہے؟
جورڈن: میرا خیال ہے کہ فرق اب کم ہو گیا ہے، اور اس کا سبب بالکل امریکی حکومت کی طرف سے Anthropic پر پابندیاں ہیں، جس کی وجہ سے ہم ان کمپنیوں کے حقیقی طور پر سب سے طاقتور ماڈلز تک نہیں پہنچ سکتے۔ انہیں مصنوعی طور پر پیچھے چھوڑ دیا گیا ہے۔
ہم مائتھوس اور فیبل کا موازنہ کر سکتے ہیں۔ مائتھوس کا استعمال میرے لیے ممکن نہیں، فیبل کے لیے مجھے کبھی کبھار صرف اپنی درخواست پر ہی استعمال کرنے کی اجازت ملتی ہے۔ 5.6 Soul، ہمارا اندر کا جائزہ یہ ہے کہ یہ OpenAI کا سب سے بڑا ماڈل نہیں ہے، 4.5 جتنا بڑا نہیں۔ ان کے پاس ایک اور بڑا ماڈل ہے۔ نتیجہ یہ ہے کہ ہم صرف تب ہی اس تک پہنچ سکتے ہیں جب سرکاری ادارے سامنے والے ذہنی صلاحیتوں کو منظور کر دیں۔
یہ دوسرے، تیسرے، چوتھے، پانچویں، چھٹے اور ساتویں نمبر کے کھلاڑیوں کے لیے ایک موقع ہے کہ وہ کسی حد تک سب کچھ کھول دیں اور صارفین کے حصے پر قبضہ کریں، لیکن وہ اصل فرنٹیئر تک کبھی نہیں پہنچ سکتے۔ مجھے لگتا ہے کہ فرنٹیئر اس سمر کے آخر میں ایک بڑا قدم آگے بڑھ سکتا ہے، یا پھر سیاسی رجحان تھوڑا بدل سکتا ہے۔ یا شاید ہم کوڈنگ کے باہر کے ماڈلز تلاش کرنے لگیں جن کے ذریعے وہ ان شعبوں کا حقیقی طور پر جائزہ لے سکیں۔
ساتھ ہی، Thinking Machines کے Inkling کے اطلاق کا ذکر کرنا چاہوں گا، میں نے اصل آواز کے ان پٹ کو بہت دلچسپ پایا، یہ مستقبل کا سگنل ہے۔
میکس: انکلنگ کے بارے میں، مغرب میں ایک بہت اچھا اوپن سورس ماڈل کی بہت بہت زیادہ کمی ہے۔ مارکیٹ اب بھی اتنی ناکارہ ہے کہ ہمیں امریکہ میں ایک بھی کمپنی نہیں مل رہی جو چین کے پانچویں بہترین ماڈل کے برابر ہو سکے، جس سے میں حیران ہوں۔ ایک طرف، امریکی حکومت کا چین کے اوپن سورس ماڈلز پر مکمل پابندی لگانا صرف ایک وقت کا سوال ہے۔ دوسری طرف، اگر پابندی نہ بھی لگائی جائے، تو عام امریکی بڑی کمپنیاں اپنے ملکی ڈیٹا کو چین کے اوپن سورس ماڈلز کو دینے کو تیار نہیں ہیں۔ اگر آپ اپنے وزن کو ایک ٹوٹی ہوئی ڈیٹا سینٹر میں لوڈ کر لیں، تو چین کا حکومتی نظام آپ کا ڈیٹا نہیں دیکھ سکتا، لیکن انتظامیہ بھی اس پر اعتماد نہیں کرے گا۔ بہت سی کمپنیاں ٹوکن بجٹ پر توجہ دیتی ہیں اور صرف مغربی ماڈلز یا غیر چینی ماڈلز چلانے کو ترجیح دیتی ہیں۔ انکلنگ ہمارے پاس موجود بہترین مغربی اوپن سورس ماڈل ہے، لیکن اس سے اوپن سورس کے سرحد تک اب بھی بہت دور ہے، جس سے میں حیران ہوں۔
جورڈن: پہلے نیوٹرون تھا، اب انکلنگ ہے۔ میرے خیال میں انکلنگ کے لیے دو مواقع ہیں: ایک، وہ زیادہ تر چینی اوپن سورس سے بہتر ہونا ضروری ہے تاکہ اس میں شامل ہو سکیں۔ دوسرے، وہ ابھی تک کے لیبز کے سیکنڈری اور تھرڈری مڈلز سے بہتر ہونے چاہئیں، سونٹیٹ سے بہتر ہونے چاہئیں، کیونکہ آپ Bedrock یا Foundry کے ذریعے ابھی تک کے قریب ذہانت حاصل کر سکتے ہیں اور بند ماڈلز سے پیسہ بچا سکتے ہیں۔ مغربی اوپن سورس کا "لوگوں کو پیسہ بچانے میں مدد" کا نقطہ نظر میرے لیے ہمیشہ سمجھنے میں مشکل رہا ہے۔ ماڈلز کو Fireworks، Together، Base10 جیسے ایکوسسٹمز میں آگے بڑھانا ضرور اچھا ہے، لیکن بازار کا بڑا حصہ حکومتی سطح پر ہے۔
چینی ڈیزائنڈ ایکسلریٹر کے لیے تخلیق کیا گیا
جورڈن: ایک اور بات جو قابل ذکر ہے، K3 بلاگ میں SFT مرحلے میں کوانتیزیشن کا ذکر کیا گیا ہے، جس میں اصل طور پر MXFP4 اور MXFP8 کا استعمال وزن اور ایکٹیویشن کے لیے کیا گیا ہے، جس کا افسرانہ دعویٰ ہے "بڑھا ہوا ہارڈ ویئر کمپیٹیبیلٹی"۔ آپ کو کیا لگتا ہے کہ Moonshot دوسرے کسی ہارڈ ویئر کے بارے میں بھی فکر کرتا ہے؟
میکس: میرے پاس 11 چینی ایکسلریٹرز کی فہرست ہے، آپ کو مزید جاننے کے لیے SemiAnalysis ایکسلریٹر ماڈل کی سبسکرپشن لینی چاہیے۔ ہواوی ٹین شین، بیڈو کُن لُن، یوان میں، موئر تھریڈز، تمام چپس تحقیقی مقالوں اور کوڈ میں ظاہر ہوتی ہیں۔ گھریلو ایکسلریٹرز پر فرنٹیر ماڈلز چلانا چین کی قومی ترجیح بن چکا ہے۔ اگر ہم 2025 کے آخر تک کہتے رہیں کہ گوگل فرنٹیر لیب ہے، تو اب ہمیں مون شاٹ کو بھی فرنٹیر لیب کہنا چاہیے۔
جورڈن: ایک بات کہوں جو موضوع سے باہر ہے، میرے والد چین میں کام پر ہیں، وہ کہتے ہیں کہ ہوٹل سب بھرے ہوئے ہیں کیونکہ شی جن پنگ اس علاقے میں AI کو چین کی پہلی ترجیح قرار دینے والی تقریر کرنے جا رہے ہیں۔ آپ جو بھی کہتے ہیں، وہ بہت سچا ہے۔
ہارنیس ہی پروڈکٹ ہے
جورڈن: میں ان ماڈلز کے استعمال کے دوران سب سے بڑی بات یہ ہے کہ، پہلی بات، مطلق سب سے آگے کے ماڈل اور max thinking mode کے استعمال اور میڈیم ایفورٹ کے استعمال کے درمیان فرق کو سمجھنا اب بہت مشکل ہو رہا ہے۔ روزمرہ کے کاموں میں میں ایسا کوئی کام نہیں ڈھونڈ پا رہا جسے یہ ماڈلز نہ کر سکیں۔ میرا ڈیفالٹ طریقہ یہ ہے کہ میں سب سے زیادہ اور سب سے مشکل موڈ کو آن کر چلاتا ہوں، کیونکہ میرا Dylan کے بجٹ سے کوئی لینا دینا نہیں ہے۔
لیکن ایک پہلو یہ ہے کہ ہارنیس خود بخود پروڈکٹ کا حصہ ہے۔ کیمی K3 کو ٹیسٹ کرنا میرے لیے پہلی بار Open Code، Hermes اور Pi کو سنجیدگی سے جانچنے کا باعث بن گیا۔ ہارنیس مکمل طور پر پروڈکٹ کا حصہ ہے۔ کچھ سادہ تفصیلات میرے لیے اس ماڈل کو دوسرے کے بجائے منتخب کرنے کا باعث بن سکتی ہیں: کیا اسے ریموٹ SSH سرور پر انسٹال کیا جا سکتا ہے؟ شارٹکٹس استعمال کرنے میں آسان ہیں؟ کیا آپ پچھلے حکمات میں تبدیلی کر سکتے ہیں؟ ہارنیس میں یہ چھوٹی تفصیلات اصل میں میرے ٹوکن کو کہاں بھیجنا ہے، یعنی بجٹ کو کہاں بھیجنا ہے، اس پر اثر انداز ہوتی ہیں۔
میکس: بہت سے لوگ ٹوکن بجٹ کے بارے میں بات کرتے ہیں، لیکن آپ کے کام کے عمل کے بیان سے لگتا ہے کہ جب تک میں GLM کے ذریعے کام مکمل کر سکتا ہوں، میں اسے Fable پر max intelligence کے استعمال کے لیے راؤٹ کرنا پسند کرتا ہوں، کیونکہ ROI اس قیمت کے قابل ہے۔ بینچ مارکس بتاتے ہیں کہ بہت سے کام GLM پر منتقل کیے جا سکتے ہیں، لیکن آپ اب بھی Anthropic یا OpenAI کے ماڈلز پر رہنا پسند کرتے ہیں۔
جورڈن: تقریباً ہاں۔ لیکن میں بہت سارے Slack بوٹس استعمال کرتا ہوں، اور میں نہیں جانتا کہ پیچھے کون سا ماڈل چل رہا ہے۔ مثال کے طور پر، Perplexity کا Slack اینٹیگریشن، اگر یہ K3، GLM، یا Sonnet کی طرف راؤٹ ہونا شروع کر دے، تو میرے لیے فرق نہیں پڑتا۔ پہلے استعمال کو دیکھ کر میں نے پایا کہ OpenAI ماڈلز کتنے حصے پر مشتمل ہیں، کیونکہ یہ اس کا اپنا فیصلہ تھا۔ اس حصے کی توجہ کا معیار اس فیصلے کو لینے والے ہیں۔
ماکس: یہ بالکل outcome-based pricing کا ایک موقع ہے۔ اگر کوئی لیب outcome-based pricing کرتا ہے، تو شاید اسے 95% سے زیادہ برآمدی منافع حاصل ہو سکتا ہے، کیونکہ جن کاموں کے لیے آپ stable pricing دینا چاہتے ہیں، وہ آج صرف چھوٹی سی رقم میں مکمل ہو سکتے ہیں۔
جورڈن: دوسری بات، میں نہیں سمجھتا کہ ان لیبز کے پاس کوئی نئی افکار ختم ہو گئی ہیں۔ وہ انتہائی حیرت انگیز ماڈلز کو ٹرین کرتے رہ سکتے ہیں جو کوڈنگ کے پہلو پر RSI کو ہرا دیں، لیکن ہم تک نہیں پہنچائیں، اپنی "مستقل نچلی طبقہ" کو برقرار رکھیں۔ وہ ڈسٹلیشن جاری رکھ سکتے ہیں، ہمیں تھوڑا سا ذائقہ دے سکتے ہیں، جبکہ وہ دیگر استعمالات جیسے ویڈیو جنریشن، آڈیو تک آڈیو، گہرا تحقیق، جو کوڈنگ سے زیادہ مختلف ہیں، کا جائزہ لے رہے ہیں۔ روبوٹکس اور ورلڈ ماڈلز ایک آسان راستہ ہے؛ اگر Anthropic اپنا مقصد علمی کام سے جسمانی محنت پر منتقل کر دے؟ میں نہیں مانتا کہ وہ دنیا کے سب سے عظیم ترین ٹیکنالوجی کا استعمال کرتے ہوئے ایک قابل استحصال اچھا ROI کا کاروبار نہیں بناسکتے۔
ہم ابھی بہت جلد ہیں
میکس: یہ بات چھوڑ دیں، میں روزانہ ان ماڈلز کا بہت زیادہ استعمال کرتا ہوں، میرے سافٹ ویئر انجینئر دوست ان کا استعمال میرے مقابلے میں دس گنا کم کرتے ہیں اور دس گنا کم خرچ کرتے ہیں۔ ایک فیبل استعمال کرنے والا اور سونیٹ استعمال کرنے والا دونوں اتنے ہی استعمال کرتے ہیں، لیکن فیبل استعمال کرنے والا دس گنا زیادہ خرچ کرتا ہے، 90 فیصد سود، جو کاروبار کا بڑا حصہ چلاتا ہے۔ جب یہ لوگ بڑے ماڈلز کا استعمال شروع کریں گے اور زیادہ استعمال کریں گے، تو مانگ مزید بڑھے گی، ماڈلز کو بہتر بنانے کی ضرورت بھی نہیں پڑے گی۔ پھر میں اپنے غیر ٹیکنالوجی والے پڑوسیوں سے بات کروں گا، جن میں میں 0.1 فیصد یا شاید 0.01 فیصد ہوں، اور شاید 1000 گنا کا اضافہ ممکن ہے۔ واپس Masa-san (سون مسائو) کے "سونا ہنس کے اندراج کرک" پر۔
جورڈن: اس کا کہنا کہ "ابھی بہت جلد ہے" بالکل درست ہے، اسی لیے مجھے لگتا ہے کہ Kimi K3 Anthropic اور OpenAI کے صاف نیٹ نئے ARR کو تیز نہیں کرے گا۔ اگر آج Fable اور 5.6 استعمال کرنے والوں میں سے کچھ لوگ غیر ممکن طور پر Kimi K3 پر منتقل ہو جائیں، تو یہ لوگ ان لوگوں کے مقابلے میں مکمل طور پر غائب ہو جائیں گے جو ابھی تک اس ٹیکنالوجی کا جدید طور پر تجربہ نہیں کر چکے۔ ان لوگوں کو روزانہ نئے HROI استعمال کے مواقع ملتے رہتے ہیں، اور وہ ان نئے سیناریوز کو کھولنے کے لیے اب بھی 5.6 Soul یا Fable 5 کو ہی ڈیفالٹ طور پر استعمال کرتے رہیں گے۔ آپ ARR کی ترقی کی رفتار میں کمی نہیں دیکھیں گے۔
میکس: سوچیں کہ ابھی تک کتنے لوگوں نے اس پادکاسٹ کو سبسکرائب نہیں کیا اور SemiAnalysis کو فولو نہیں کیا۔ میں نے پچھلے ہفتے ICML میں شرکت کی، اور اس سے پہلے ہفتے AI Engineer کانفرنس میں، جو ایک نامیاتی AI کانفرنس ہے، جہاں 80 فیصد سے زائد لوگوں نے SemiAnalysis کے بارے میں کبھی سننا بھی نہیں۔ آپ کہتے ہیں کہ آپ AI صنعت میں کام کرتے ہیں، لیکن آپ نے SemiAnalysis پڑھا بھی نہیں؟ ہم ابھی بہت جلد ہیں۔
جورڈن: یہ تمہارے لیے ایک ایگو چیک ہے، میکس، پر سکون ہو جاؤ۔
