AMD تستحوذ على Taalas لدمج أوزان نموذج الذكاء الاصطناعي في الرقائق

iconBitPush
مشاركة
AI summary iconملخص
استحوذت AMD على شركة التصميم الكندية المتخصصة في الرقائق Taalas، التي تدمج أوزان نماذج الذكاء الاصطناعي مباشرة في السيليكون. يعمل رقاقة Taalas HC1، المصنوعة باستخدام تقنية TSMC 6nm، على نموذج Meta Llama 3.1 8B بسرعة 17,000 رمز في الثانية، متفوقةً على رقائق Nvidia H200 وH100 من حيث السرعة وكفاءة الطاقة. تستخدم الرقاقة تنسيق 3 بت، وتحديثها يتم خلال 8 أسابيع عبر تغييرات في قوالب المعدن. تخطط AMD لدمج رقائق الاستنتاج من Taalas مع خط منتجاتها من وحدات معالجة الرسومات (GPUs) لمهام الذكاء الاصطناعي. يأتي هذا الخبر عن الذكاء الاصطناعي والعملات المشفرة في ظل تغيرات في بيانات التضخم وزيادة الطلب على الحوسبة الفعالة.

الكاتب: شياو بينغ

AMD تستحوذ على Taalas: شرائح الاستنتاج تبدأ بحفر أوزان النموذج مباشرة على السيليكون


في 6 أغسطس، أعلنت AMD عن استحواذها على شركة التشابك الكندية Taalas، دون الكشف عن سعر الصفقة. قامت هذه الشركة الناشئة، التي تأسست في عام 2023 وجمعت حتى الآن تمويل بقيمة 219 مليون دولار أمريكي، بفعل يبدو مجنونًا بعض الشيء: حرق أوزان نماذج الذكاء الاصطناعي مباشرة في طبقات المعدن للرقاقة، لإنشاء رقاقة مخصصة تعمل بنموذج واحد فقط.

تعمل وحدات معالجة الرسومات (GPU) على تخزين معلمات النموذج في ذاكرة عالية النطاق الترددي (HBM)، ثم نقل البيانات باستمرار إلى وحدات الحساب وخارجها أثناء الاستدلال. يُعد هذا "النقل" عملية تستهلك كمية كبيرة من الطاقة والوقت، ويُعرف في الصناعة بـ"جدار الذاكرة". أما نهج Taalas، فيتمثل في إلغاء النقل تمامًا، حيث يتم تثبيت الأوزان مباشرة في الترانزستورات داخل الرقاقة، مما يدمج التخزين والحساب في وحدة واحدة.

الثمن هو أن هذه الشريحة يمكنها تشغيل نموذج واحد فقط، بينما المكسب هو تحسن هائل في السرعة وكفاءة الطاقة.

ماذا يعني 17000 رمز في الثانية؟

تشيب HC1 التقني من Taalas مبني على عملية 6 نانومتر من TSMC، بمساحة رقاقة 815 ملم² و53 مليار ترانزستور، ويحتوي على نموذج مدمج من Llama 3.1 8B من Meta.

بيانات أداء HC1: حوالي 17000 رمز/ثانية للمستخدم الواحد. كمقارنة، Nvidia H200 تحقق حوالي 230 رمز/ثانية على نفس النموذج، وH100 حوالي 150 رمز/ثانية. فرق في السرعة يبلغ 73 ضعفًا، مع استهلاك طاقة يساوي عشرة أجزاء من المائة فقط.

حساب اقتصادي أكثر وضوحًا: تبلغ تكلفة الاستدلال التي أبلغ عنها Taalas حوالي 0.75 سنت لكل مليون توكن (Llama 8B)، بينما تتراوح تكلفة حلول GPU بين 20 و49 سنتًا. كل بطاقة HC1 تستهلك 250 واط، ويتطلب رف معياري مبرد بالهواء يحتوي على 10 بطاقات فقط 12-15 كيلوواط، دون الحاجة إلى التبريد السائل، بينما تتراوح استهلاك طاقة أرفف GPU بين 120 و600 كيلوواط.

قيّم خبير تحليلات فوربس كارل فروند في فبراير قائلاً: "أسرع بعشر مرات من أسرع منصة استدلال (محرك Cerebras الوحدوي)، وأسرع بمقدار مرحلتين مقارنةً بالـ GPU."

لكن هناك عدة شروط قيد مهمة. يستخدم HC1 تنسيق بيانات 3-bit مُطوَّر داخليًا من Taalas مع معاملات 6-bit، مما يؤدي إلى كميات تكميم شديدة، وفقدان الجودة في مهام الاستدلال المعقدة هو أمر مؤكد. تأتي بيانات 17000 رمز/ثانية من اختبار معياري من المُصنِّع بـ 1K مدخلات/1K مخرجات، ولا تمثل الأداء الفعلي في بيئة الإنتاج. علاوة على ذلك، فإن Llama 3.1 8B هو نموذج صدر في منتصف عام 2024، ويمكن حتى للإصدارات المُكمَّمة بحجم 8B أن تعمل على Raspberry Pi 5. يُظهر HC1 إمكانات البنية، وليس قدرة منتج ناضج على المنافسة.

ماذا أفعل عند تغيير النموذج؟

إدخال النموذج إلى الرقاقة، فإن السؤال الأكثر بديهية هو: ماذا يحدث إذا تم تحديث النموذج؟ هل تصبح الرقاقة عديمة الفائدة؟

رد Taalas: لن يتم التخلص منه. دورة تصميم ASIC التقليدية تستغرق أكثر من سنتين. طورت Taalas عملية تصميم آلية تتطلب فقط تعديل عدد قليل من أقنعة المعادن في الطبقة العليا للشريحة، مما يسمح بترجمة النموذج الجديد إلى شريحة جديدة في فترة تقارب 8 أسابيع. وقد احتوت نموذج التكلفة الخاص بالشركة على تكاليف تحديث الشريحة ثلاث مرات خلال دورة حياة مدتها 4 سنوات.

هذا الرد يمكنه تخفيف جزء من القلق، لكنه لا يستطيع القضاء عليه بالكامل.

مرونة وحدات معالجة الرسوميات تكمن في قدرتها على تشغيل نموذج Llama اليوم، ونموذج Claude غدًا، ونموذج جديد لم يُطلق بعد بعد غد، على نفس البطاقة. لا تستطيع شرائح Taalas تحقيق ذلك. إذا احتاج العميل إلى خدمات نماذج متعددة في وقت واحد (وهو أمر شائع جدًا في بيئات الإنتاج)، فسيكون من الضروري تخصيص شريحة مختلفة لكل نموذج، مما يزيد من تعقيد إدارة المخزون والتشغيل.

يتم تطوير HC2 حاليًا، بهدف نموذج بحجم حوالي 20 مليار معلمة، باستخدام 4-bit فاصلة عائمة لتحسين الدقة. كان من المخطط الأصلي لـ Taalas تحقيق دعم النماذج الرائدة بحلول نهاية عام 2026.

استحواذ AMD أتاح تكاملًا بين خط منتجات Instinct GPU ونظام رفوف Helios، مما يسمح للعملاء باستخدام GPU لمعالجة أحمال العمل المتغيرة والمتنوعة، واستخدام شرائح Taalas لمعالجة الاستدلال النموذجي الثابت عالي التردد.

سباق التسلح للرقائق الاستنتاجية

استحوذت AMD على Taalas، وهي آخر صفقة في موجة استحواذات رقائق الاستدلال خلال الثمانية أشهر الماضية من منظور الصناعة.

في ديسمبر 2025، استحوذت Nvidia على Groq بقيمة 20 مليار دولار أمريكي، مُستحوذةً على بنية الاستدلال منخفضة التأخير القائمة على SRAM.

في مايو 2026، أجرت Cerebras طرحًا عامًا أوليًا بقيمة سوقية تبلغ حوالي 56 مليار دولار، ليصبح أكبر طرح عام أولي تقني منذ Snowflake في عام 2020.

في يونيو، أنهت Etched فترة اختفاء استمرت أكثر من عامين وأعلنت عن إنجاز أول رقاقة مخصصة لـ Transformer باستخدام تقنية N4P من TSMC، مع امتلاكها لعقود عملاء تتجاوز قيمتها 10 مليارات دولار. وفقًا للتقارير، وقعت Intel مذكرة نية لشراء SambaNova، بينما تتواصل Qualcomm مع Tenstorrent.

تشير هذه المعاملات إلى نفس الاستنتاج: أن الاستدلال يصبح ساحة المعركة الرئيسية لإنفاق قوة الحوسبة في الذكاء الاصطناعي.

تشير التوقعات الصناعية إلى أن التفسير سيشكل ثلثي إنفاق الحوسبة الذكية الاصطناعية بحلول عام 2026، وقد يسيطر على 45% من سوق التفسير بحلول عام 2030 بواسطة شرائح ASIC مخصصة للتفسير. لا تزال وحدات معالجة الرسومات من Nvidia تهيمن على جانب التدريب، لكن هيكليتها العامة تواجه تحديات من شرائح مخصصة من جميع الاتجاهات في جانب التفسير.

تالاس تقع في أقصى طرف هذا الطيف: فهي تتخلى حتى عن عمومية "نموذج من الفئة الأولى" وتُصمم شريحة مخصصة لـ"نموذج واحد".

تستخدم Groq SRAM بدلًا من HBM لتجاوز جدار الذاكرة، وتستخدم Cerebras مساحة على مستوى الرقاقة للتفوق بالقوة، وEtched مصممة فقط لتحسين بنية Transformer، بينما يخاطر Taalas بمخاطرة أكثر جرأة: فهو يراهن على أن نماذج الذكاء الاصطناعي ستستقر تدريجيًا، تمامًا كما اتّحدت بروتوكولات الاتصال في النهاية على معايير قليلة. عندما تتوقف النماذج عن التغيير شهريًا، يصبح من الناحية الاقتصادية مربحًا تصنيع رقاقة مخصصة لكل نموذج رئيسي بضع.

ستتجمد النموذجية

قال نائب الرئيس الأول لـ AMD، فامسي بوبانا، في الإعلان إن هدف الاستحواذ هو تقديم "حل حسابي مثالي لكل نوع من أحمال الذكاء الاصطناعي". هذه الجملة تترجم إلى استراتيجية تنافسية: تُستخدم وحدات معالجة الرسوميات للمرن، ووحدات Taalas للكفاءة القصوى، ويقوم العملاء بدمجها حسب الحاجة.

يعتمد صلاحية هذا المنطق المركب على افتراض أساسي: هل سيتباطأ دورة تحديث نماذج الذكاء الاصطناعي؟

إذا استمرت النماذج الكبيرة في تلقي تحديثات على مستوى البنية كل بضعة أشهر، فإن طريقة حرق الأوزان على رقائق السيليكون تشبه صب الخرسانة على الرمال المتحركة—قبل أن تُسترد تكاليف الرقاقة، يكون النموذج قد أصبح قديمًا. لكن إذا تقارب أداء النماذج وصار من الطبيعي أن تقدم النماذج الرائدة خدمات مستقرة لسنة أو سنتين، فستصبح الرقائق المتخصصة على نمط Taalas مثل رقائق الـ baseband في صناعة الاتصالات، وستتحول من تجارب مجنونة إلى خيار واضح ومنطقي.

بالنظر إلى الأشهر الـ12 الماضية، لوحظ تغيير دقيق في وتيرة تحديث النماذج. فقد زادت الفترات بين تحديثات سلسلة Llama من 3.1 إلى 3.2 ثم إلى 4، بينما تقلصت حجم التغييرات المعمارية بين GPT-4 وGPT-4o وGPT-5. ويتم إصدار مزيد من النماذج الجديدة من خلال التقطيع والكمية والضبط الدقيق على البنية القائمة، مما يشير إلى تباطؤ في تطور النماذج الأساسية.

إذا استمر هذا الاتجاه، فقد راهن تالاس على الصواب.


تويتر:https://twitter.com/BitpushNewsCN

مجموعة بيتبوش على تيليغرام: https://t.me/BitPushCommunity

اشترك في بيتبوش على تيليغرام: https://t.me/bitpush

ملاحظة: جميع مقالات Beibit تعبر عن آراء المؤلفين فقط ولا تشكل نصيحة استثمارية
إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.