ایم ڈی نے ٹالاس کو خرید لیا تاکہ ای آئی ماڈل کے وزن چپس میں ڈالا جا سکے

iconBitPush
بانٹیں
AI summary iconخلاصہ
AMD نے ٹورونٹو واقع چپ اسٹارٹ اپ Taalas کو خرید لیا ہے، جو AI ماڈل کے وزن کو سیلیکون میں براہ راست ڈالتا ہے۔ Taalas کا HC1 چپ، جو TSMC 6nm پر تعمیر کیا گیا ہے، Meta کے Llama 3.1 8B ماڈل کو فی سیکنڈ 17,000 ٹوکنز کی رفتار سے چلاتا ہے، جو Nvidia H200 اور H100 سے رفتار اور توانائی کی کارکردگی میں بہتر ہے۔ یہ چپ 3-بٹ فارمیٹ استعمال کرتا ہے اور میٹل ماسک تبدیلیوں کے ذریعے 8 ہفتے میں اپڈیٹ ہوتا ہے۔ AMD منصوبہ بندی کر رہا ہے کہ وہ Taalas کے انفرنس چپس کو اپنی GPU لائن کے ساتھ AI ورک لودز کے لیے اندراج کرے۔ یہ AI + کرپٹو خبریں تبدیل ہوتے ہوئے انفلیشن ڈیٹا اور موثر کمپیوٹنگ کی بڑھتی ہوئی مانگ کے درمیان آ رہی ہیں۔

لکھنے والے: چھوٹا بِسکٹ

AMD نے Taalas کو خرید لیا: انفرینس چپس اب ماڈل وزن کو سلیکون میں کٹنے لگی ہیں


6 اگست، AMD نے ٹورانٹو کی چپ کمپنی Taalas کی خریداری کا اعلان کیا، جس کی قیمت فاش نہیں کی گئی۔ 2023 میں قائم ہونے والی اور تکراراً فنڈنگ 219 ملین امریکی ڈالر حاصل کرنے والی اس اسٹارٹ اپ نے ایک ایسا کام کیا جو تھوڑا پاگل پن لگتا ہے: AI ماڈل کے وزن کو براہ راست چپ کے معدنی طبقوں میں جلا دیا گیا، جس سے صرف ایک ماڈل چلنے والی مخصوص چپ تیار ہوئی۔

GPU کا طریقہ کار یہ ہے کہ وہ ماڈل کے پیرامیٹرز کو ہائی بینڈ وِذ میموری (HBM) میں محفوظ کرتی ہے، اور انفرینس کے دوران ڈیٹا کو کمپوٹیشنل یونٹس کے اندر اور باہر بار بار منتقل کرتی ہے۔ یہ "منتقل کرنا" کا عمل توانائی اور وقت کا بڑا حصہ استعمال کرتا ہے، جسے صنعت "میموری ویل" کہتی ہے۔ Taalas کا طریقہ یہ ہے کہ وہ منتقل کرنے کا عمل مکمل طور پر ختم کر دیتی ہے، اور وزن کو چپ کے ٹرانزسٹرز میں سٹیک کر دیتی ہے، جس سے میموری اور کمپوٹیشن ایک ساتھ ہو جاتے ہیں۔

اس چپ کا ایک ہی ماڈل چلانے کا اثر ہے، لیکن اس کا فائدہ تیزی اور انرجی کارگردگی میں درجہ بندی کی ترقی ہے۔

17000 ٹوکن فی سیکنڈ کا کیا مطلب ہے؟

Taalas کا ٹیکنالوجی ویریفیکیشن چپ HC1، TSMC کے 6nm پروسیس پر مبنی ہے، جس کا چپ ایریا 815 مربع ملی میٹر اور 53 ارب ٹرانزسٹرز ہیں، اور اس میں Meta کا Llama 3.1 8B ماڈل شامل ہے۔

HC1 کا اسکور ڈیٹا: ایک صارف کے لیے تقریباً 17,000 ٹوکن/سیکنڈ۔ مقابلے کے لیے، Nvidia H200 ایک ہی ماڈل پر تقریباً 230 ٹوکن/سیکنڈ اور H100 تقریباً 150 ٹوکن/سیکنڈ پر کام کرتا ہے۔ 73 گنا تیز رفتاری، جبکہ طاقت کا استعمال صرف دوسرے کا دسواں حصہ ہے۔

زیادہ واضح مالیاتی حساب: تالاس کا دعویٰ ہے کہ اس کا استدلال لاگت تقریباً ہر ملین ٹوکن کے لیے 0.75 سینٹ (Llama 8B) ہے، جبکہ GPU حل 20 سے 49 سینٹ کے درمیان ہے۔ ہر HC1 کارڈ کی طاقت کی استعمالی صلاحیت 250W ہے، اور ایک معیاری ہوا سے ٹھنڈا کیا جانے والا ریک جس میں 10 کارڈ ہوں، صرف 12-15 KW کی ضرورت رکھتا ہے، اور اسے ترل کی ضرورت نہیں ہوتی، جبکہ GPU ریک عام طور پر 120-600 KW کی ضرورت رکھتے ہیں۔

فوربس کے تجزیہ کار کارل فرینڈ نے فروری میں جائزہ لیتے ہوئے کہا: “سب سے تیز استدلال پلیٹ فارم (سیریبراس وافل سائز انجن) سے 10 گنا تیز، اور جی پی یو سے دو درجے زیادہ تیز۔”

لیکن کچھ اہم محدودیتیں ہیں۔ HC1 Taalas کے خود تیار کردہ 3-bit ڈیٹا فارمیٹ کو 6-bit پیرامیٹرز کے ساتھ استعمال کرتا ہے، جس میں بہت زیادہ کمی کیا گیا ہے اور پیچیدہ استدلال کے کاموں پر کوالٹی کا نقصان یقینی طور پر موجود ہے۔ 17000 ٹوکن/سیکنڈ کا ڈیٹا 1K ان پٹ/1K آؤٹ پٹ کے فرنٹ فارم بینچ مارک سے آیا ہے، جو پیداواری ماحول میں حقیقی کارکردگی کو ظاہر نہیں کرتا۔ اور Llama 3.1 8B کو 2024 کے وسط میں جاری کیا گیا تھا، اور 8B پیرامیٹرز والے کمیشن ورژن کو تو رازبری پائی 5 پر بھی چلایا جا سکتا ہے۔ HC1 ساخت کی صلاحیت کو ظاہر کرتا ہے، نہ کہ بالغ مصنوعات کی مقابلہ کن صلاحیت۔

ماڈل کی تبدیلی کیسے کریں؟

ماڈل کو چپ میں بھرنے کا سب سے برا سوال یہ ہے: اگر ماڈل اپڈیٹ ہو جائے تو کیا چپ بے کار ہو جائے گی؟

تالاس کا جواب یہ ہے: نہیں، یہ منسوخ نہیں ہوگا۔ روایتی ASIC ڈیزائن سائکل دو سال سے زیادہ کا ہوتا ہے۔ تالاس نے ایک خودکار ڈیزائن پروسیجر تیار کیا ہے جس میں صرف چپ کے اوپری حصے کے کچھ میٹل ماسکس تبدیل کرکے نئے ماڈل کو نئی چپ میں کمپائل کیا جا سکتا ہے، جس کا سائکل تقریباً 8 ہفتے کا ہوتا ہے۔ کمپنی نے اپنے لاگت ماڈل میں 4 سال کے زندگی کے دوران 3 بار چپ اپڈیٹ کی لاگت شامل کر لی ہے۔

یہ جواب کچھ تشویش کو دور کر سکتا ہے، لیکن مکمل طور پر ختم نہیں کر سکتا۔

GPU کی لچک یہ ہے کہ ایک ہی کارڈ آج Llama چلائے جا سکتی ہے، کل Claude چلائے جا سکتی ہے، اور اگلے دن ایک ابھی تک جاری نہ ہونے والا نیا ماڈل چلایا جا سکتا ہے۔ Taalas کا چپ اس طرح کام نہیں کرتا۔ اگر کوئی صارف ایک ساتھ متعدد ماڈلز کی ضرورت رکھتا ہے (جو پیداواری ماحول میں بہت عام ہے)، تو ہر ماڈل کے لیے الگ الگ چپ کی ضرورت ہوگی، جس سے اسٹاک مینجمنٹ اور آپریشنل پیچیدگی بڑھ جائے گی۔

HC2 کو ترقی دی جا رہی ہے، جس کا مقصد تقریباً 20 ارب پیرامیٹرز کے سائز کا ماڈل ہے، جس میں 4-bit فلوٹنگ پوائنٹ کا استعمال کیا جا رہا ہے تاکہ درستگی بڑھائی جا سکے۔ طالس نے اصل میں 2026 کے آخر تک فرانتیر لیول ماڈلز کی حمایت حاصل کرنے کا منصوبہ بنایا تھا۔

AMD کی خریداری کے ذریعے اس راستے پر Instinct GPU لائن اور Helios ریک سسٹم کا تعاون ہوا، جس سے صارفین GPU کا استعمال لچکدار اور متغیر ورک لوڈز کے لیے کر سکتے ہیں اور Taalas چپس کا استعمال مستقل اور اعلیٰ فریکوئنسی والے منفرد ماڈل انفرنس کے لیے کر سکتے ہیں۔

انٹیلیجنس چپ کی مسلح ہو رہی مقابلہ

AMD نے Taalas کو خرید لیا، جو صنعت کے حوالے سے پچھلے 8 ماہ کی تشریح چپس کی خریداری کی لہر کا آخری اقدام ہے۔

دسمبر 2025 میں، نوڈیا نے 200 ارب امریکی ڈالر میں گروک کا اختراع کیا، جس میں SRAM پر مبنی کم تاخیر والی استدلال ساخت شامل ہے۔

مئی 2026 میں، سیرابراس نے تقریباً 560 ارب امریکی ڈالر کی مارکیٹ کی قیمت کے ساتھ آئی پی او کیا، جو 2020 کے اسنوفلیک کے بعد سب سے بڑا ٹیکنالوجی آئی پی او بن گیا۔

جون میں، ایٹچڈ نے دو سال سے زیادہ کی چھپی ہوئی زندگی کا خاتمہ کرتے ہوئے اعلان کیا کہ اس نے ٹی وی ایس کے N4P پروسیس پر پہلا Transformer مخصوص چپ پیدا کر لیا ہے، جس کے ساتھ اس کے پاس ایک ارب ڈالر سے زائد کے صارفین کے معاہدے ہیں۔ Intel کو SambaNova کے ساتھ خریداری کے ارادے کا معاہدہ ہونے کی اطلاع ہے، جبکہ Qualcomm Tenstorrent سے رابطہ کر رہا ہے۔

یہ ٹریڈز ایک ہی فیصلے کی طرف اشارہ کرتے ہیں: استدلال AI کی کمپوٹنگ خرچ کا مرکزی میدان بن رہا ہے۔

صنعتی پیش گوئی کے مطابق، 2026 تک ریزننگ AI کمپیوٹنگ خرچ کا دو تہائی حصہ بن جائے گا، اور 2030 تک مخصوص ریزننگ ASICs ریزننگ مارکیٹ کا 45 فیصد حصہ حاصل کر سکتے ہیں۔ Nvidia کے GPU اب بھی ٹریننگ کے شعبے میں سرکاری ہیں، لیکن ریزننگ کے شعبے میں، اس کی جامع ساخت کو مختلف طرف سے مخصوص چپس کی چیلنج کا سامنا ہے۔

ٹالاس اس سپیکٹرم کے سب سے زیادہ انتہائی کنارے پر ہے: یہ "کلاس ای مدلز" کی جامعیت تک چھوڑ دیتا ہے اور براہ راست "ایک مدل" کے لیے مخصوص چپ بناتا ہے۔

گروک SRAM کا استعمال کرکے میموری وال کو دور کرتا ہے، سیریبراس وافل سطح کے ذریعے تشدد سے گزرتا ہے، ایٹچڈ صرف ٹرانسفارمر آرکیٹیکچر کے لیے تعمیر کیا گیا ہے، جبکہ تالاس کا اندازہ زیادہ جرات والا ہے: وہ یہ خیال رکھتا ہے کہ AI ماڈلز آہستہ آہستہ مستقل ہو جائیں گے، جیسے کمیونیکیشن پروٹوکولز آخرکار کچھ مخصوص معیارات پر اتفاق رائے کر لیتے ہیں۔ جب ماڈلز مہینے بھر میں تبدیل نہ ہوں، تو صرف کچھ سب سے زیادہ مقبول ماڈلز کے لیے الگ الگ چپس بنانا مالی طور پر منافع بخش ہو جائے گا۔

مڈل کا "جم جانا" کا اندازہ لگائیں

اعلان میں AMD کے سینئر وائس پریزیڈنٹ وامسی بوپنا نے کہا کہ خریداری کا مقصد صارفین کو "ہر AI ورک لود کے لیے بہترین کمپوٹیشن سولوشن فراہم کرنا" ہے۔ اس کا مقابلہ کی حکمت عملی کے لحاظ سے مطلب یہ ہے کہ GPU لچک کے لیے ذمہ دار ہے، جبکہ Taalas چپ انتہائی کارآمدی کے لیے، اور صارفین اپنی ضرورت کے مطابق انہیں ملا سکتے ہیں۔

اس کمبینیشن کا منطق صرف ایک بنیادی فرض پر منحصر ہے: کیا AI ماڈلز کے اپڈیٹ سائکل سست ہو جائیں گے؟

اگر بڑے ماڈلز کے آرکیٹیکچر میں ہر کچھ ماہ بعد مسلسل اپڈیٹ ہوتی رہیں، تو وزن کو سلیکون میں جلا دینا ایسے ہے جیسے ریت پر کنکریٹ ڈالنا، جس میں چپ کا اپنا خرچہ واپس نہیں ہوتا کہ ماڈل پہلے ہی زمانے سے پیچھے رہ جاتا ہے۔ لیکن اگر ماڈل کی صلاحیتیں ایک حد تک پہنچ جائیں اور ٹاپ ماڈلز کا دو سال تک مستقل طور پر سروس فراہم کرنا عام بات بن جائے، تو تالاس جیسے مخصوص چپس کامیابی کے لیے مواصلات کے شعبے کے بیس بینڈ چپس کی طرح، ایک پاگل تجربہ نہیں بلکہ ایک معمول کا انتخاب بن جائیں گے۔

گزشتہ 12 ماہ کو واپس دیکھیں تو ماڈل اپڈیٹس کی رفتار میں ظاہر ہونے لگی ہے کہ تبدیلی آ رہی ہے۔ لاما سیریز کے 3.1 سے 3.2 اور پھر 4 تک کے اسٹیج میں فاصلہ بڑھ رہا ہے، جبکہ جی پی ٹی کے 4 سے 4o اور پھر 5 تک کے آرکیٹیکچر میں تبدیلیوں کا اثر کم ہو رہا ہے۔ زیادہ نئے ماڈلز موجودہ آرکیٹیکچر پر ڈسٹلیشن، کوانتائزیشن اور فائن ٹیوننگ کے ذریعے تیار کیے جا رہے ہیں، اور بنیادی ماڈلز کی ترقی آہستہ ہو رہی ہے۔

اگر یہ رجحان جاری رہا، تو تالاس نے صحیح اندازہ لگایا۔


ٹویٹر:https://twitter.com/BitpushNewsCN

بٹ پش ٹی جی مکالمہ گروپ:https://t.me/BitPushCommunity

بیپوش ٹی جی سبسکرائب کریں: https://t.me/bitpush

نوٹ: بیٹو کے تمام مقالات صرف مصنف کے نقطہ نظر کو ظاہر کرتے ہیں اور سرمایہ کاری کی تجویز نہیں ہیں
اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔