لکھنے والہ: چھوٹا بیکا
6 اگست، AMD نے ٹورونٹو کی چپ کمپنی Taalas کی خریداری کا اعلان کیا، جس کی قیمت فاش نہیں کی گئی۔ یہ 2023 میں قائم ہونے والی، جس نے تکریباً 219 ملین امریکی ڈالر کا فنڈنگ حاصل کیا، ایک ایسا کام کر رہی تھی جو تھوڑا پاگل پن لگتا ہے: AI ماڈل کے وزن کو براہ راست چپ کے معدنی طبقوں میں جلا دیا گیا، جس سے صرف ایک ماڈل چلنے والی مخصوص چپ تیار ہوئی۔
GPU کام کرنے کا طریقہ یہ ہے کہ وہ ماڈل کے پیرامیٹرز کو ہائی بینڈ وِدث میموری (HBM) میں محفوظ کرتی ہے، اور استدلال کے دوران ڈیٹا کو کمپوٹیشنل یونٹس کے اندر اور باہر بار بار منتقل کرتی ہے۔ یہ "منتقل کرنا" کا عمل توانائی اور وقت دونوں کا بڑا استعمال کرتا ہے، جسے صنعت میں "میموری ویل" کہا جاتا ہے۔ Taalas کا طریقہ یہ ہے کہ وہ اس "منتقل کرنے" کو مکمل طور پر ختم کر دیتی ہے اور وزن کو چپ کے ٹرانزسٹرز میں سٹیک کر دیتی ہے، جس سے میموری اور کمپوٹیشن ایک ساتھ ہو جاتے ہیں۔
اس چپ کا ایک ہی ماڈل چلانے کا ادھار ہے، لیکن اس کا فائدہ تیزی اور انرجی کارگردگی میں ایک درجہ کی بڑی ترقی ہے۔
17000 ٹوکن فی سیکنڈ کا کیا مطلب ہے؟
طلاس کا ٹیکنالوجی ویریفیکیشن چپ HC1 تائیوان سیمیکنڈکٹر مینوفیکچرنگ کمپنی (TSMC) کے 6nm پروسیس پر مبنی ہے، جس کا چپ سائز 815 مربع ملی میٹر اور 530 ارب ٹرانزسٹرز ہیں، اور اس میں میٹا کا Llama 3.1 8B ماڈل شامل ہے۔
HC1 کا اسکور ڈیٹا: ایک صارف کے لیے تقریباً 17,000 ٹوکن/سیکنڈ۔ تقابلی طور پر، Nvidia H200 ایک ہی ماڈل پر تقریباً 230 ٹوکن/سیکنڈ اور H100 تقریباً 150 ٹوکن/سیکنڈ پر کام کرتا ہے۔ 73 گنا تیز رفتاری، جبکہ طاقت کا استعمال صرف دوسرے کا دہواں حصہ ہے۔
زیادہ واضح مالیاتی حساب: تالاس کا دعویٰ ہے کہ انفرینس کی لاگت تقریباً ہر ملین ٹوکن کے لیے 0.75 سینٹ (Llama 8B) ہے، جبکہ GPU حل 20 سے 49 سینٹ کے درمیان ہے۔ ہر HC1 کارڈ کی بجلی کی استعمالی صلاحیت 250W ہے، اور ایک معیاری ہوا سے ٹھنڈا کیا جانے والا ریک جس میں 10 کارڈ ہوں، صرف 12-15 KW کی ضرورت رکھتا ہے، اور اسے لکوڈ کولنگ کی ضرورت نہیں، جبکہ GPU ریکس عام طور پر 120-600 KW استعمال کرتے ہیں۔
فوربس کے تجزیہ کار کارل فرینڈ نے فروری میں جائزہ لیتے ہوئے کہا: "Cerebras وافل سائزڈ انجن سے 10 گنا تیز، اور GPU سے دو درجے زیادہ تیز۔"
لیکن کچھ اہم شرائط ہیں۔ HC1 Taalas کے خود ساختہ 3-بٹ ڈیٹا فارمیٹ اور 6-بٹ پیرامیٹرز کا استعمال کرتا ہے، جس کا کوانتائزیشن بہت زیادہ ہے، اور پیچیدہ استدلال کے کاموں پر کوالٹی کا نقصان یقینی طور پر موجود ہے۔ 17000 ٹوکن/سیکنڈ کا ڈیٹا 1K ان پٹ/1K آؤٹ پٹ کے فراہم کنندہ بنچ مارک سے آیا ہے، جو پیداواری ماحول میں حقیقی کارکردگی کی نمائندگی نہیں کرتا۔ اور Llama 3.1 8B کو 2024 کے وسط میں جاری کیا گیا تھا، اور 8B پیرامیٹرز والے کوانتائزڈ ورژن کو حتیٰ کہ رازبری پائی 5 پر چلایا جا سکتا ہے۔ HC1 ساخت کی صلاحیت کو ظاہر کرتا ہے، نہ کہ بالغ مصنوعات کی مقابلہ جانچ۔
ماڈل کی تبدیلی کیسے کریں؟
چپ میں ماڈل کو بھرنے کا سب سے براہ راست سوال یہ ہے: اگر ماڈل اپ ڈیٹ ہو جائے تو کیا چپ بیکار ہو جائے؟
طلاس کا جواب ہے: نہیں، یہ منسوخ نہیں ہوگا۔ روایتی ASIC ڈیزائن سائکل دو سال سے زیادہ کا ہوتا ہے۔ طلاس نے ایک خودکار ڈیزائن پروسیجر تیار کیا ہے، جس میں صرف چپ کے اوپری حصے کے کچھ میٹل ماسک میں تبدیلی کرکے نئے ماڈل کو نئی چپ میں کمپائل کیا جا سکتا ہے، جس کا سائکل تقریباً 8 ہفتے کا ہوتا ہے۔ کمپنی نے اپنے لاگت ماڈل میں 4 سال کے زندگی کے دوران 3 بار چپ اپڈیٹ کے اخراجات شامل کر رکھے ہیں۔
یہ جواب کچھ پریشانی کو دور کر سکتا ہے، لیکن مکمل طور پر ختم نہیں کر سکتا۔
GPU کی لچک یہ ہے کہ ایک ہی کارڈ آج Llama چلائی جا سکتی ہے، کل Claude چلائی جا سکتی ہے، اور اگلے دن ایک ابھی تک جاری نہ ہونے والا نیا ماڈل چلایا جا سکتا ہے۔ Taalas کا چپ اس کا کام نہیں کر سکتا۔ اگر کوئی صارف ایک ساتھ متعدد ماڈلز کی ضرورت رکھتا ہے (جو پیداواری ماحول میں بہت عام ہے)، تو ہر ماڈل کے لیے الگ الگ چپس کی ضرورت ہوگی، جس سے اسٹاک مینجمنٹ اور آپریشنل پیچیدگی بڑھ جائے گی۔
HC2 کو ترقی دی جا رہی ہے، جس کا مقصد تقریباً 20 ارب پیرامیٹرز کے سائز کا ماڈل ہے، جس میں 4-bit فلوٹنگ پوائنٹ کا استعمال کیا جا رہا ہے تاکہ درستگی بڑھائی جا سکے۔ طالس نے اصل میں 2026 کے آخر تک فرنتیر لیول ماڈلز کی حمایت مکمل کرنے کا منصوبہ بنایا تھا۔
AMD کی خریداری کے ذریعے اس راستے پر Instinct GPU لائن اور Helios ریک سسٹم کا تعاون ہوا، جس سے صارفین GPU کا استعمال لچکدار اور متغیر ورک لوڈز کے لیے کر سکتے ہیں اور Taalas چپس کا استعمال مستقل اور اعلیٰ فریکوئنسی والے منفرد ماڈل انفرنس کے لیے کر سکتے ہیں۔
انٹیلیجنس چپس کی مسلح مقابلہ
AMD نے Taalas کو خرید لیا، جو صنعت کے حوالے سے پچھلے 8 ماہ کی استدلال چپوں کی خریداری کی لہر کا آخری اقدام ہے۔
دسمبر 2025 میں، نوڈیا نے 20 ارب امریکی ڈالر میں گروک کا اختراع کیا، جس میں SRAM پر مبنی کم تاخیر والی استدلال ساخت شامل ہے۔
مئی 2026 میں، سیریبراس نے تقریباً 560 ارب ڈالر کی مارکیٹ ویلیو کے ساتھ آئی پی او کیا، جو 2020 کے اسنوفلیک کے بعد سب سے بڑا ٹیکنالوجی آئی پی او بن گیا۔
جون میں، Etched نے دو سال سے زیادہ کی چھپی ہوئی مدت کے بعد اپنا پہلا Transformer کے لیے مخصوص چپ جسے TSMC کے N4P پروسیس پر ڈیزائن کیا گیا ہے، کا اعلان کیا اور اس کے پاس 10 ارب ڈالر سے زیادہ کے صارفین کے معاہدے ہیں۔ Intel کو SambaNova کے ساتھ خریداری کے ارادے کا معاہدہ کرنے کی اطلاع ہے، جبکہ Qualcomm Tenstorrent سے رابطہ کر رہا ہے۔
یہ ٹریڈز ایک ہی فیصلے کی طرف اشارہ کرتے ہیں: استدلال AI کی کمپوٹنگ خرچ کا مرکزی میدان بن رہا ہے۔
صنعتی پیش بینی ہے کہ 2026 تک ریزنگ AI کمپیوٹنگ خرچ کا دو تہائی حصہ بن جائے گا، اور 2030 تک مخصوص ریزنگ ASICs ریزنگ مارکیٹ کا 45 فیصد حصہ حاصل کر سکتے ہیں۔ Nvidia کے GPU اب بھی ٹریننگ سیکٹر پر قابض ہیں، لیکن ریزنگ سیکٹر میں اس کی جامع ساخت کو مختلف طرف سے مخصوص چپس کی چیلنج کا سامنا ہے۔
ٹالاس اس سپیکٹرم کے سب سے زیادہ انتہائی طرف پر ہے: یہ "کلاس ای مڈل" کی عام صلاحیت بھی چھوڑ دیتا ہے اور براہ راست "ایک مڈل" کے لیے مخصوص چپ بناتا ہے۔
گروک SRAM کا استعمال کرکے میموری وال کو دور کرتا ہے، سیریبراس وافل سائز کے ذریعے تشدد سے突破 کرتا ہے، ایٹچڈ صرف ٹرانسفارمر آرکیٹیکچر کے لیے آپٹیمائز کیا گیا ہے، جبکہ تالاس کا اندازہ زیادہ جرات والا ہے: وہ یہ مان رہا ہے کہ AI ماڈلز آہستہ آہستہ مستقل ہو جائیں گے، جیسے کمیونیکیشن پروٹوکولز آخرکار کچھ مخصوص معیارات پر اتفاق کر لیتے ہیں۔ جب ماڈلز مہینے بھر میں تبدیل نہ ہوں، تو صرف کچھ سب سے زیادہ مقبول ماڈلز کے لیے الگ الگ چپس بنانا مالی طور پر منافع بخش ہو جائے گا۔
مڈل جم جائے گا
AMD کے سینئر وائس پریزیڈنٹ وامسی بوپنا نے اعلان میں کہا کہ خریداری کا مقصد صارفین کو "ہر AI ورک لوڈ کے لیے بہترین کمپوٹنگ حل فراہم کرنا" ہے۔ اس کا مقابلہ کی استراتیجی کے لحاظ سے مطلب یہ ہے: GPU لچک کے لیے، Taalas چپز انتہائی کارکردگی کے لیے، اور صارفین اپنی ضرورت کے مطابق انہیں ملا سکتے ہیں۔
اس کمبینیشن کا منطق صرف ایک مرکزی فرضیہ پر منحصر ہے: کیا AI ماڈلز کے اپڈیٹ سائکل سست ہو جائیں گے؟
اگر بڑے ماڈلز کے آرکیٹیکچر میں ہر کچھ ماہ بعد تبدیلیاں جاری رہیں، تو وزن کو سلیکون میں ڈالنا ایسے ہے جیسے بھاگتے ریت پر کنکریٹ ڈالنا، جس میں چپ اپنا لاگت واپس حاصل کرنے سے پہلے ہی ماڈل فراموش ہو چکا ہوگا۔ لیکن اگر ماڈل کی صلاحیتیں ایک حد تک پہنچ جائیں اور ٹاپ ماڈلز کا دو سال تک مستقل طور پر سروس فراہم کرنا عام ہو جائے، تو تالاس کی طرح کی مخصوص چپیں مواصلات کے شعبے میں بیس بینڈ چپس کی طرح، جنگلی تجربات سے گزرتے ہوئے ایک معمول کا انتخاب بن جائیں گی۔
گزشتہ 12 ماہ کو دیکھتے ہوئے، ماڈل اپڈیٹس کی رفتار میں ظاہر ہوتا ہے کہ سوکھا تبدیلی آ رہی ہے۔ لاما سیریز کے 3.1 سے 3.2 اور پھر 4 تک کے درمیان وقفہ لمبا ہو رہا ہے، جبکہ جی پی ٹی کے 4 سے 4o اور پھر 5 تک کے آرکیٹیکچر میں تبدیلیوں کا اثر کم ہو رہا ہے۔ زیادہ نئے ماڈلز موجودہ آرکیٹیکچر پر ڈسٹلیشن، کوانتائزیشن اور فائن ٹیوننگ پر مبنی ہیں، اور بنیادی ماڈلز کی ترقی آہستہ ہو رہی ہے۔
اگر یہ رجحان جاری رہا، تو تالاس نے صحیح اندازہ لگایا۔
