লেখক: শিয়াওবিং
AMD কর্তৃক Taalas অধিকার: ইনফারেন্স চিপগুলি এখন মডেল ওয়েটসকে সিলিকনে খোদাই করছে
আগস্ট ৬ তারিখে, AMD টরন্টোভিত্তিক চিপ কোম্পানি টালাস কে ক্রয় করার ঘোষণা দেয়, যার লেনদেনের মূল্য প্রকাশ করা হয়নি। ২০২৩ সালে প্রতিষ্ঠিত এবং এপর্যন্ত ফান্ডিং করেছে ২.১৯ বিলিয়ন ডলার এই স্টার্টআপটি একটি অসাধারণ কাজ করেছে: AI মডেলেরওয়েটসগুলিকে সরাসরি চিপের ধাতব স্তরে পোড়ানো, যার ফলে শুধুমাত্র একটি মডেল চালানোর জন্য ডিজাইন করা একটি স্পেশালাইজড চিপ তৈরি হয়েছে।
GPU এর কাজ হল মডেলের প্যারামিটারগুলিকে হাই-ব্যান্ডউইথ মেমোরি (HBM) এ সংরক্ষণ করা এবং ইনফারেন্সের সময় ডেটাকে কম্পিউটেশনাল ইউনিটের মধ্যে বারবার স্থানান্তর করা। এই "স্থানান্তর" প্রক্রিয়াটি ব্যাপক শক্তি এবং সময় খরচ করে, যা শিল্পে "মেমোরি ওয়াল" হিসাবে পরিচিত। Taalas এর পদ্ধতি হল স্থানান্তরকে সম্পূর্ণভাবে বাতিল করা, যেখানেওওয়েটগুলিকে চিপের ট্রানজিস্টরগুলিতে স্থির করা হয়, যাতে সংরক্ষণ এবং গণনা একীভূত হয়।
এই চিপটি শুধুমাত্র একটি মডেল চালাতে পারে, কিন্তু এর লাভ হল গতি এবং শক্তি দক্ষতার ক্রমিক উন্নতি।
প্রতি সেকেন্ডে 17000 টোকেন মানে কী?
Taalas-এর টেকনোলজি ভেরিফিকেশন চিপ HC1 টাইওয়ান সেমিকন্ডাক্টর ম্যানুফ্যাকচারিং কর্পোরেশনের 6nm প্রসেসে তৈরি, 815 বর্গমিটার চিপ এরিয়া এবং 530 বিলিয়ন ট্রানজিস্টর সহ, এটির অন্তর্নির্মিত মডেলটি হল Meta-এর Llama 3.1 8B।
HC1-এর পারফরম্যান্স ডেটা: একক ব্যবহারকারীর জন্য প্রায় 17,000 টোকেন/সেকেন্ড। তুলনামূলকভাবে, Nvidia H200 একই মডেলে প্রায় 230 টোকেন/সেকেন্ড এবং H100 প্রায় 150 টোকেন/সেকেন্ড। 73 গুণ দ্রুত গতি, কিন্তু শক্তি খরচ মাত্র শেষ দুটির দশমাংশ।
আরও সহজে বোঝা যায় অর্থনৈতিক খরচ: টালাস প্রতি মিলিয়ন টোকেনের জন্য যুক্তিসঙ্গত খরচ প্রায় ০.৭৫ সেন্ট (Llama 8B) হিসাব করেছে, যখন GPU সমাধান ২০ থেকে ৪৯ সেন্টের মধ্যে। প্রতিটি HC1 কার্ডের বিদ্যুৎ খরচ ২৫০W, একটি স্ট্যান্ডার্ড এয়ার-কুলড র্যাকে ১০টি কার্ড রাখলে শুধুমাত্র ১২-১৫ KW প্রয়োজন, তরল শীতলনের প্রয়োজন হয় না, অন্যদিকে GPU র্যাকের বিদ্যুৎ খরচ ১২০-৬০০ KW।
ফরব্স বিশ্লেষক কার্ল ফ্রেন্ডের ২ মাসের মূল্যায়নে বলা হয়েছে: “সবচেয়ে দ্রুত ইনফারেন্স প্ল্যাটফর্ম (সিরিব্রাস ওয়াফার-লেভেল ইঞ্জিন) এর চেয়ে ১০ গুণ দ্রুত, GPU এর চেয়ে দুই মাত্রায় দ্রুত।”
কিন্তু কিছু গুরুত্বপূর্ণ সীমাবদ্ধতা রয়েছে। HC1 এর জন্য Taalas নিজস্ব 3-বিট ডেটা ফরম্যাট এবং 6-বিট প্যারামিটার ব্যবহার করা হয়েছে, যা অত্যন্ত প্রচণ্ড কোয়ান্টাইজেশন, এবং জটিল রিজনিং টাস্কে গুণগত ক্ষতি নিশ্চিতভাবে বিদ্যমান। 17000 টোকেন/সেকেন্ডের ডেটা 1K ইনপুট/1K আউটপুটের জন্য প্রস্তুতকারকের বেঞ্চমার্ক পরীক্ষা থেকে আসে, যা উৎপাদন পরিবেশের প্রকৃত পারফরম্যান্সকে প্রতিফলিত করে না। এছাড়াও, Llama 3.1 8B হল 2024 এর মধ্যভাগে প্রকাশিত মডেল, এবং 8B প্যারামিটারের কোয়ান্টাইজড ভার্সনটি এমনকি রাস্বারি পি 5-এও চলে। HC1 একটি পরিপক্ক পণ্যের প্রতিযোগিতামূলক ক্ষমতা নয়, বরং আর্কিটেকচারের সম্ভাবনা প্রদর্শন করে।
মডেল আপগ্রেড করলে কী হবে?
মডেলটিকে চিপে বার্ন করার পর, সবচেয়ে প্রাকৃতিক প্রশ্নটি হল: মডেল আপডেট হলে কী হবে? চিপটি ব্যর্থ হয়ে যাবে?
টালাসের উত্তর হল: এটি বাতিল হবে না। প্রাচীন ASIC ডিজাইন চক্র দুই বছরের বেশি সময় নেয়। টালাস একটি স্বয়ংক্রিয় ডিজাইন প্রক্রিয়া বিকাশ করেছে, যার মাধ্যমে শুধুমাত্র চিপের শীর্ষের কয়েকটি ধাতব মাস্ক পরিবর্তন করে নতুন মডেলকে নতুন চিপে কম্পাইল করা যায়, যা প্রায় 8 সপ্তাহের মধ্যে সম্পন্ন হয়। কোম্পানিটি তার খরচ মডেলে 4 বছরের জীবনকালে 3টি চিপ আপডেটের খরচ অন্তর্ভুক্ত করেছে।
এই উত্তরটি কিছুটা উদ্বেগ দূর করতে পারে, কিন্তু সম্পূর্ণরূপে দূর করতে পারে না।
জিপিইউর সুবিধা হল একই কার্ড আজ ল্লামা চালানো, কাল ক্লড চালানো, এবং পরের দিন এখনও প্রকাশিত হয়নি এমন একটি নতুন মডেল চালানো। তালাসের চিপ এটি করতে পারে না। যদি একজন গ্রাহক একসাথে একাধিক মডেলের সেবা প্রয়োজন করে (যা উৎপাদন পরিবেশে অত্যন্ত সাধারণ), তবে প্রতিটি মডেলের জন্য ভিন্ন ভিন্ন চিপের প্রয়োজন হবে, যা স্টক পরিচালনা এবং অপারেশনাল জটিলতা বৃদ্ধি করবে।
HC2 এখন বিকাশাধীন, যার লক্ষ্য প্রায় 20 বিলিয়ন প্যারামিটারের মডেল এবং 4-বিট ফ্লোটিং পয়েন্ট ব্যবহার করে সূক্ষ্মতা বাড়ানো। তালাস 2026 সালের শেষের দিকে অগ্রণী মডেলের সমর্থন অর্জনের পরিকল্পনা করছিল।
AMD-এর অধিগ্রহণের ফলে এই পথে Instinct GPU পণ্য লাইন এবং Helios র্যাক সিস্টেমের সমন্বয় ঘটেছে, যাতে গ্রাহকরা GPU ব্যবহার করে ফ্লেক্সিবল এবং পরিবর্তনশীল ওয়ার্কলোড প্রক্রিয়াকরণ করতে পারেন এবং Taalas চিপ ব্যবহার করে স্থির এবং উচ্চ ফ্রিকোয়েন্সির একক মডেল ইনফারেন্স প্রক্রিয়াকরণ করতে পারেন।
রিজনিং চিপের অস্ত্রাগার প্রতিযোগিতা
AMD টালাস কে ক্রয় করেছে, যা বিশ্লেষণের দৃষ্টিকোণ থেকে গত ৮ মাসের রিজনিং চিপ ক্রয়ের সিরিজের সর্বশেষ ঘটনা।
2025 সালের ডিসেম্বরে, নভিডিয়া এসআরএএম-ভিত্তিক লো-ল্যাটেন্সি ইনফারেন্স আর্কিটেকচার অধিগ্রহণ করে গ্রোককে 200 বিলিয়ন ডলারে কিনে নেয়।
2026 সালের মে মাসে, সিরিব্রাস প্রায় 560 বিলিয়ন ডলার মূল্যায়নে আইপিও করে, যা 2020 সালের স্নোফ্লেকের পর সবচেয়ে বড় টেক আইপিও হয়ে উঠেছে।
জুনে, ইটচড দুই বছরেরও বেশি সময় লুকিয়ে থাকার পর প্রথম ট্রান্সফরমার-বিশেষায়িত চিপটি টাইওয়ান সেমিকন্ডাক্টর ম্যানুফ্যাকচারিং কোম্পানির N4P প্রসেসে সফলভাবে প্রস্তুত হওয়ার ঘোষণা দেয় এবং 10 বিলিয়ন ডলারেরও বেশি ক্লায়েন্ট চুক্তি হাতে রাখে। ইন্টেলের সঙ্গে সামবা নোভা একটি অধিগ্রহণের ইচ্ছাপত্রে স্বাক্ষর করেছে বলে জানা গিয়েছে, আর কোয়ালকম টেনস্টোরেন্টের সঙ্গে যোগাযোগ করছে।
এই ট্রেডগুলি একই সিদ্ধান্তের দিকে ইঙ্গিত করে: যুক্তিসহকারে চিন্তা করা হচ্ছে এআই কম্পিউটিং খরচের প্রধান ক্ষেত্র।
শিল্পের পূর্বানুমান অনুযায়ী, ২০২৬ সালে রিজনিং এর জন্য এআই কম্পিউটিং খরচের তিন-পঞ্চমাংশ হবে, এবং ২০৩০ সালের মধ্যে স্পেশালাইজড রিজনিং ASIC-এর রিজনিং মার্কেটে ৪৫% অংশ হতে পারে। Nvidia-এর GPU এখনও ট্রেনিং সেগমেন্টকে নিয়ন্ত্রণ করছে, কিন্তু রিজনিং সেগমেন্টে, এর জেনারিক আর্কিটেকচার বিভিন্ন দিক থেকে আসা স্পেশালাইজড চিপগুলির চ্যালেঞ্জের মুখোমুখি হচ্ছে।
টালাস এই স্পেকট্রামের সবচেয়ে চরম প্রান্তে অবস্থান করে: এটি "প্রথম শ্রেণির মডেল" এর সার্বজনীনতা পর্যন্ত ত্যাগ করে, সরাসরি "একটি মডেল"-এর জন্য স্পেশালাইজড চিপ তৈরি করে।
গ্রোক মেমোরি ওয়াল এড়াতে SRAM ব্যবহার করে, সিরিব্রাস ওয়াফার-লেভেল এরিয়া দিয়ে বলপূর্বক বাধা ভাঙে, ইটচড শুধুমাত্র ট্রান্সফরমার আর্কিটেকচারের জন্য অপ্টিমাইজ করে, আর টালাসের ঝুঁকি আরও আগ্রাসী: এটি ধরে নেয় যে AI মডেলগুলি ধীরে ধীরে স্থিতিশীল হয়ে যাবে, যেমনটি কমিউনিকেশন প্রোটোকলগুলি শেষপর্যন্ত কয়েকটি মানকে একত্রিত হয়। যখন মডেলগুলি প্রতি মাসে পরিবর্তিত হবে না, তখন কয়েকটি সবচেয়ে জনপ্রিয় মডেলের জন্য প্রতিটির জন্য একটি স্পেশালাইজড চিপ তৈরি করা অর্থনৈতিকভাবে লাভজনক হবে।
বেট মডেল জমে যাবে
অ্যামডের সিনিয়র ভাইস প্রেসিডেন্ট ভামসি বোপ্পানা ঘোষণায় বলেন, অধিগ্রহণের উদ্দেশ্য হল গ্রাহকদের জন্য "প্রতিটি এআই ওয়ার্কলোডের জন্য সর্বোত্তম কম্পিউটিং সমাধান" প্রদান। এটি প্রতিদ্বন্দ্বিতামূলক কৌশল হিসেবে ব্যাখ্যা করা যায়: GPU নমনীয়তার জন্য, Taalas চিপগুলি চরম দক্ষতার জন্য, এবং গ্রাহকরা তাদের প্রয়োজন অনুযায়ী এগুলি সংমিশ্রণ করবেন।
এই কম্বিনেশন লজিক কার্যকর হবে কিনা তা একটি মূল ধারণার উপর নির্ভর করে: এআই মডেলের আপডেট সাইকেল কি ধীর হয়ে যাবে?
যদি বড় মডেলগুলি প্রতি কয়েক মাসে একবার আর্কিটেকচার-লেভেলের আপডেট পায়, তাহলে ওয়েটিংগুলিকে সিলিকনে বাঁধানো হলে এটি মরুভূমিতে কংক্রিট ঢালার মতো—চিপটি ফেরত পাওয়ার আগেই মডেলটি পুরনো হয়ে যায়। কিন্তু যদি মডেলের ক্ষমতা একটি সীমায় পৌঁছায় এবং শীর্ষস্থানীয় মডেলগুলি দুই বছর পর্যন্ত স্থিতিশীলভাবে সেবা প্রদান করা সাধারণ হয়ে যায়, তাহলে টালাস-স্টাইলের স্পেশালাইজড চিপগুলি যেমনটি কমিউনিকেশন শিল্পের বেসব্যান্ড চিপগুলির মতো, অত্যধিক পরীক্ষা-নিরীক্ষা থেকে স্বাভাবিকভাবেই বেছে নেওয়ার পছন্দে পরিণত হবে।
গত 12 মাসের পুনর্বিশ্লেষণ করলে দেখা যায় যে মডেল আপডেটের গতি সূক্ষ্মভাবে পরিবর্তিত হচ্ছে। Llama সিরিজে 3.1 থেকে 3.2 এবং তারপর 4-এ যাওয়ার ব্যবধান বাড়ছে, অন্যদিকে GPT-4 থেকে 4o এবং 5-এ যাওয়ার আর্কিটেকচার পরিবর্তনের পরিসর কমছে। বেশিরভাগ নতুন মডেল বর্তমান আর্কিটেকচারের উপর ডিস্টিলেশন, কোয়ান্টাইজেশন এবং ফাইন-টিউনিংয়ের মাধ্যমে তৈরি হচ্ছে, যা বেস মডেলের পুনরায় উন্নয়নকে ধীরগতিতে নিয়ে আসছে।
যদি এই প্রবণতা চলতে থাকে, তাহলে তালাস সঠিক অনুমান করেছে।
টুইটার:https://twitter.com/BitpushNewsCN
বিটপুশ টেলিগ্রাম কমিউনিটি: https://t.me/BitPushCommunity
বিপুশ টিজি সাবস্ক্রাইব: https://t.me/bitpush
