AMD টালাস অধিগ্রহণ করে ইনফারেন্সের জন্য সিলিকনে এআই মডেল ওয়েটস এমবেড করবে

iconTechFlow
শেয়ার
AI summary iconসারাংশ
AMD টোরন্টো-ভিত্তিক চিপ স্টার্টআপ টালাসের অধিগ্রহণের ঘোষণা দিয়েছে, যা এআই + ক্রিপ্টো সংবাদকে স্পটলাইটে নিয়ে আসে। টালাস তার চিপের ধাতব স্তরে প্রত্যক্ষভাবে এআই মডেলের ওজন এমবেড করে, যার ফলে মেমোরি এবং কম্পিউট ইউনিটের মধ্যে ডেটা স্থানান্তর বন্ধ হয়ে যায়। TSMC 6nm-এ ডিজাইনকৃত HC1 চিপটি Llama 3.1 8B-এর সাথে ১৭,০০০ টোকেন/সেকেন্ড পারফরম্যান্স দেখিয়েছে, যা Nvidia H200-এর চেয়ে ৭৩ গুণ বেশি, কিন্তু শুধুমাত্র এক-দশমাংশ শক্তি ব্যবহার করে। চিপটি মডেল-নির্দিষ্ট এবং আগ্রাসীভাবে কোয়ান্টাইজড, যা সঠিকতা প্রভাবিত করতে পারে। টালাস ৮ সপ্তাহের মধ্যে চিপগুলির আপডেটের পরিকল্পনা করছে, HC2-এর লক্ষ্য ২০০B প্যারামিটারের মডেল। AMD, Taalas-এর চিপগুলিকে তার Instinct GPU লাইনের সাথে একীভূত করবে, যাতে AI-এর জন্য দক্ষতা বৃদ্ধি পায়, এটি একটি গুরুত্বপূর্ণ on-chain সংবাদের বিকাশ।

লেখক: শাওবিং

আগস্ট ৬ তারিখে, AMD টরন্টোভিত্তিক চিপ কোম্পানি টালাস কে ক্রয় করার ঘোষণা দেয়, যার লেনদেনের মূল্য প্রকাশ করা হয়নি। ২০২৩ সালে প্রতিষ্ঠিত এবং এপর্যন্ত ২.১৯ বিলিয়ন ডলার ফান্ডিং সংগ্রহ করা এই স্টার্টআপটি একটি অসাধারণ কাজ করেছে: এটি AI মডেলেরওয়েটসকে সরাসরি চিপের ধাতব স্তরে পোড়ায়, যার ফলে শুধুমাত্র একটি মডেল চালানোর জন্য ডিজাইন করা একটি স্পেশালাইজড চিপ তৈরি হয়।

GPU এর কাজ হল মডেলের ওজনগুলিকে উচ্চ ব্যান্ডউইথ মেমোরি (HBM) এ সংরক্ষণ করা এবং ইনফারেন্সের সময় ডেটাকে কম্পিউটেশনাল ইউনিটের মধ্যে বারবার স্থানান্তর করা। এই "স্থানান্তর" প্রক্রিয়াটি ব্যাপক শক্তি এবং সময় খরচ করে, যা শিল্পে "মেমোরি ওয়াল" হিসাবে পরিচিত। Taalas-এর পদ্ধতি হল স্থানান্তরকে সম্পূর্ণভাবে বাতিল করা, যেখানেওওজনগুলিকে চিপের ট্রানজিস্টরগুলিতে স্থির করা হয়, যাতে সংরক্ষণ এবং গণনা একীভূত হয়।

এই চিপটি শুধুমাত্র একটি মডেল চালাতে পারে, কিন্তু এর সুবিধা হল গতি এবং শক্তি দক্ষতার ক্রমিক উন্নতি।

প্রতি সেকেন্ডে 17000 টোকেন মানে কী?

টালাসের টেকনোলজি ভেরিফিকেশন চিপ HC1 টাইওয়ান সেমিকন্ডাক্টর ম্যানুফ্যাকচারিং কর্পোরেশনের 6nm প্রসেসে তৈরি, 815 বর্গ মিলিমিটার চিপ এরিয়া এবং 53 বিলিয়ন ট্রানজিস্টর সহ। এটির অন্তর্নির্মিত মডেলটি মেটা-এর Llama 3.1 8B।

HC1-এর পারফরম্যান্স ডেটা: একক ব্যবহারকারীর জন্য প্রায় 17,000 টোকেন/সেকেন্ড। তুলনামূলকভাবে, Nvidia H200 একই মডেলে প্রায় 230 টোকেন/সেকেন্ড এবং H100 প্রায় 150 টোকেন/সেকেন্ড। 73 গুণ বেশি গতি, কিন্তু শক্তি খরচ মাত্র শেষ দুটির দশমাংশ।

আরও সহজে বোঝা যায় অর্থনৈতিক খরচ: তালাস প্রতি মিলিয়ন টোকেনের জন্য যুক্তিসঙ্গত খরচ প্রায় ০.৭৫ সেন্ট (Llama 8B) বলে দাবি করেছে, যেখানে GPU সমাধান ২০ থেকে ৪৯ সেন্টের মধ্যে। প্রতিটি HC1 কার্ডের বিদ্যুৎ খরচ ২৫০W, একটি স্ট্যান্ডার্ড এয়ার-কুলড র্যাকে ১০টি কার্ড রাখলে মাত্র ১২-১৫ KW প্রয়োজন, তরল শীতলীকরণের প্রয়োজন হয় না, অন্যদিকে GPU র্যাকের বিদ্যুৎ খরচ ১২০-৬০০ KW।

ফরব্সের বিশ্লেষক কার্ল ফ্রেন্ডের ২ মাসের মূল্যায়নে বলা হয়েছে: “সবচেয়ে দ্রুত ইনফারেন্স প্ল্যাটফর্ম (সিরিব্রাস ওয়াফার-লেভেল ইঞ্জিন) এর চেয়ে ১০ গুণ দ্রুত, GPU এর চেয়ে দুই মাত্রায় দ্রুত।”

কিন্তু কিছু গুরুত্বপূর্ণ সীমাবদ্ধতা রয়েছে। HC1 এর জন্য Taalas তাদের নিজস্ব 3-বিট ডেটা ফরম্যাট এবং 6-বিট প্যারামিটার ব্যবহার করে, যা অত্যন্ত প্রচণ্ড কোয়ান্টাইজেশন; জটিল রিজনিং টাস্কের উপর গুণগত ক্ষতি নিশ্চিতভাবে বিদ্যমান। 17000 টোকেন/সেকেন্ডের ডেটা 1K ইনপুট/1K আউটপুটের জন্য প্রস্তুতকারকের বেঞ্চমার্ক পরীক্ষা থেকে আসে, যা উৎপাদন পরিবেশের বাস্তব পারফরম্যান্সকে প্রতিফলিত করে না। এছাড়াও, Llama 3.1 8B 2024 এর মধ্যভাগে প্রকাশিত মডেল, এবং 8B প্যারামিটারের কোয়ান্টাইজড ভার্সনটি এমনকি রাস্বারি পি 5-এও চলে। HC1 একটি পরিপক্ক পণ্যের প্রতিযোগিতামূলক ক্ষমতা নয়, বরং এটি আর্কিটেকচারের সম্ভাবনা দেখায়।

মডেল আপগ্রেড করলে কী করবেন?

চিপে মডেল বার্ন করার সময় সবচেয়ে প্রাকৃতিক প্রশ্নটি হল: যদি মডেল আপডেট হয়ে যায়, তাহলে চিপটি ব্যর্থ হয়ে যাবে?

টালাসের উত্তর হল: এটি বাতিল হবে না। প্রচলিত ASIC ডিজাইন চক্র দুই বছরের বেশি সময় নেয়। টালাস একটি স্বয়ংক্রিয় ডিজাইন প্রক্রিয়া বিকাশ করেছে, যার মাধ্যমে শুধুমাত্র চিপের শীর্ষের কিছু ধাতব মাস্ক পরিবর্তন করে নতুন মডেলকে নতুন চিপে কম্পাইল করা যায়, যা প্রায় 8 সপ্তাহের মধ্যে সম্পন্ন হয়। কোম্পানিটি তার খরচ মডেলে 4 বছরের জীবনকালে 3টি চিপ আপডেটের খরচ অন্তর্ভুক্ত করেছে।

এই উত্তরটি কিছুটা উদ্বেগ কমাতে পারে, কিন্তু সম্পূর্ণরূপে দূর করতে পারে না।

জিপিইউর সুবিধা হল একই কার্ড আজ ল্লামা চালানো, কাল ক্লাউড চালানো এবং পরের দিন এখনও প্রকাশিত হয়নি এমন একটি নতুন মডেল চালানো। তালাসের চিপ এটি করতে পারে না। যদি একজন গ্রাহক একসাথে একাধিক মডেলের সেবা প্রয়োজন করে (যা উৎপাদন পরিবেশে অত্যন্ত সাধারণ), তবে প্রতিটি মডেলের জন্য ভিন্ন ভিন্ন চিপের প্রয়োজন হবে, যা স্টক পরিচালনা এবং অপারেশনাল জটিলতা বৃদ্ধি করবে।

HC2 এখন বিকাশাধীন, যার লক্ষ্য প্রায় 20 বিলিয়ন প্যারামিটারের মডেল, যা 4-বিট ফ্লোটিং পয়েন্ট ব্যবহার করে সূক্ষ্মতা বাড়ায়। তালাস মূলত 2026 সালের শেষের দিকে অগ্রণী মডেলের সমর্থন চালু করার পরিকল্পনা করেছিল।

AMD-এর অধিগ্রহণের ফলে এই পথে Instinct GPU পণ্য লাইন এবং Helios র্যাক সিস্টেমের সমন্বয় ঘটেছে, যার ফলে গ্রাহকরা GPU ব্যবহার করে ফ্লেক্সিবল এবং পরিবর্তনশীল ওয়ার্কলোড প্রক্রিয়াকরণ করতে পারবেন এবং Taalas চিপ ব্যবহার করে স্থির এবং উচ্চ ফ্রিকোয়েন্সির একক মডেল ইনফারেন্স প্রক্রিয়াকরণ করতে পারবেন।

রিজনিং চিপের অস্ত্র প্রতিযোগিতা

AMD টালাস অধিগ্রহণ করেছে, যা গত ৮ মাসের রিজনিং চিপ অধিগ্রহণের প্রবণতার সর্বশেষ ঘটনা।

2025 সালের ডিসেম্বরে, নভিডিয়া এসআরএএম-ভিত্তিক লো-ল্যাটেন্সি ইনফারেন্স আর্কিটেকচার অধিগ্রহণের জন্য গ্রোককে 200 বিলিয়ন ডলারে কিনে নেয়।

2026 সালের মে মাসে, সিরিব্রাস প্রায় 560 বিলিয়ন ডলার মূল্যায়নে আইপিও করে, যা 2020 সালের স্নোফ্লেকের পর সবচেয়ে বড় টেক আইপিও হয়ে উঠেছে।

জুনে, ইটচড দুই বছরেরও বেশি সময় লুকিয়ে থাকার পর ঘোষণা করে যে তাদের প্রথম ট্রান্সফরমার-বিশেষায়িত চিপটি টাইওয়ান সেমিকন্ডাক্টর ম্যানুফ্যাকচারিং কোম্পানির N4P প্রসেসে সফলভাবে প্রস্তুত হয়েছে এবং 10 বিলিয়ন ডলারেরও বেশি মূল্যের গ্রাহক চুক্তি হাতে রেখেছে। ইন্টেলের সঙ্গে SambaNova-এর একটি অধিগ্রহণের ইচ্ছাপত্র স্বাক্ষরিত হয়েছে বলে জানা গিয়েছে, এবং Qualcomm Tenstorrent-এর সঙ্গে যোগাযোগ করছে।

এই ট্রেডগুলি একই সিদ্ধান্তের দিকে ইঙ্গিত করে: যুক্তিনির্ভর প্রক্রিয়াকরণ এখন AI কম্পিউটিং খরচের মুখ্য ক্ষেত্র হয়ে উঠছে।

শিল্পের পূর্বানুমান অনুযায়ী, 2026 সালে রিজনিং এর জন্য AI কম্পিউটিং খরচের দুই-তৃতীয়াংশ হবে, এবং 2030 সালের মধ্যে স্পেশালাইজড রিজনিং ASIC রিজনিং মার্কেটের 45% দখল করতে পারে। Nvidia-এর GPU এখনও ট্রেনিং সেগমেন্টকে নিয়ন্ত্রণ করছে, কিন্তু রিজনিং সেগমেন্টে, এর জেনারিক আর্কিটেকচার বিভিন্ন দিক থেকে আসা স্পেশালাইজড চিপগুলির চ্যালেঞ্জের মুখোমুখি হচ্ছে।

টালাস এই স্পেকট্রামের সবচেয়ে চরম প্রান্তে অবস্থান করে: এটি "প্রথম শ্রেণির মডেল" এর সার্বজনীনতা পর্যন্ত ত্যাগ করে, সরাসরি "একটি মডেল" এর জন্য স্পেশালাইজড চিপ তৈরি করে।

গ্রোক মেমোরি ওয়াল এড়াতে SRAM ব্যবহার করে, সিরিব্রাস ওয়েফার-লেভেল এরিয়া দিয়ে বলপূর্বক ভাঙ্গে, ইটচড শুধুমাত্র ট্রান্সফরমার আর্কিটেকচারের জন্য অপ্টিমাইজ করে, আর তালাসের ঝুঁকি আরও জোরালো: এটি ধরে নেয় যে AI মডেলগুলি ধীরে ধীরে স্থিতিশীল হয়ে যাবে, যেমনটি কমিউনিকেশন প্রোটোকলগুলি শেষপর্যন্ত কয়েকটি মানকে সংক্ষিপ্ত হয়। যখন মডেলগুলি প্রতি মাসে পরিবর্তিত হবে না, তখন কয়েকটি সবচেয়ে জনপ্রিয় মডেলের জন্য প্রতিটির জন্য একটি স্পেশালাইজড চিপ তৈরি করা অর্থনৈতিকভাবে লাভজনক।

মডেলটি জমে যাবে বলে বাজি ধরুন

ঘোষণায় AMD-এর সিনিয়র ভাইস প্রেসিডেন্ট ভামসি বোপ্পানা বলেন, অধিগ্রহণের উদ্দেশ্য হল গ্রাহকদের জন্য "প্রতিটি AI ওয়ার্কলোডের জন্য সর্বোত্তম কম্পিউটিং সমাধান" প্রদান করা। এটি প্রতিযোগিতামূলক কৌশল হিসাবে ব্যাখ্যা করা যায়: GPU নমনীয়তার জন্য, Taalas চিপগুলি চরম দক্ষতার জন্য, এবং গ্রাহকরা তাদের প্রয়োজন অনুযায়ী এগুলি সংমিশ্রণ করবেন।

এই কম্বিনেশন লজিক কার্যকর হবে কিনা তা একটি মূল ধারণার উপর নির্ভর করে: এআই মডেলের আপডেট সাইকেল কি ধীর হয়ে যাবে?

যদি বড় মডেলগুলি প্রতি কয়েক মাস পর আর্কিটেকচার লেভেলে আপডেট হতে থাকে, তাহলে ওয়েটিংগুলিকে সিলিকনে বাঁধানো হলে এটি মরুভূমিতে কংক্রিট ঢালার মতো—চিপটি ফিরে পাওয়ার আগেই মডেলটি পুরনো হয়ে যায়। কিন্তু যদি মডেলের ক্ষমতা স্থির হয়ে যায়, এবং শীর্ষস্থানীয় মডেলগুলি দুই বছর পর্যন্ত স্থিতিশীলভাবে সেবা প্রদান করা সাধারণ হয়ে যায়, তাহলে টালাস-স্টাইলের স্পেশালাইজড চিপগুলি যেমনটি কমিউনিকেশন শিল্পের বেসব্যান্ড চিপ, তেমনি অত্যধিক পরীক্ষা-নিরীক্ষা থেকে স্বাভাবিকভাবেই বেছে নেওয়ার পছন্দে পরিণত হবে।

গত 12 মাসের পুনর্বিবেচনা করলে, মডেল আপডেটের গতি সূক্ষ্মভাবে পরিবর্তিত হয়েছে। Llama সিরিজে 3.1 থেকে 3.2 এবং তারপর 4-এর মধ্যে ব্যবধান বাড়ছে, অন্যদিকে GPT-4 থেকে GPT-4o এবং GPT-5-এর আর্কিটেকচার পরিবর্তনের পরিসর কমছে। বেশিরভাগ নতুন মডেল বিদ্যমান আর্কিটেকচারের উপর ডিস্টিলেশন, কোয়ান্টাইজেশন এবং ফাইন-টিউনিংয়ের মাধ্যমে তৈরি হচ্ছে, যা বেস মডেলের আপডেটের গতি ধীর হয়েছে।

যদি এই প্রবণতা চলতে থাকে, তাহলে তালাস সঠিক অনুমান করেছে।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।