নভেডিয়া এখন এআই ইনফারেন্স প্রিফিল স্পিড জিপিইউ প্রকল্প “রুবিন সিপিএক্স” পুনরায় শুরু করেছে, যার উৎপাদন ২০২৭ এর প্রথম ত্রৈমাসিকে শুরু হওয়ার পরিকল্পনা। এই পণ্যটি দীর্ঘ কনটেক্সট প্রিফিল স্কেনারিওর জন্য ডিজাইন করা হয়েছে, যাতে ১৬৮GB HBM4 মেমোরি এবং স্ট্যান্ডার্ড রুবিন জিপিইউ-এর কাছাকাছি কম্পিউটেশনাল পাওয়ার রয়েছে, একক কার্ডের পাওয়ার খরচ ২৩০০ওয়াট। পণ্যটি একক MGX ETL র্যাক ডিজাইনের সাথে আসে, যা ৬৪ থেকে ২৫৬টি জিপিইউ-এর জন্য ফ্লেক্সিবল ডিপ্লয়মেন্ট কনফিগারেশনকে সমর্থন করে। ইন্টারকানেকশন আর্কিটেকচারটি হাইয়ারার্কিক্যালভাবে ডিজাইন করা হয়েছে, যেখানে একক ট্রেতে NVLink ব্যবহার করা হয়, এবং ট্রেগুলির মধ্যে Ethernet ব্যবহার করা হয়, যা পারফরম্যান্স এবংখরচের মধ্যে ভারসাম্য বজায় রাখে। রুবিন CPX-কে স্ট্যান্ডার্ড Rubine GPU-এর সাথে 1:1 অনুপাতে ব্যবহার করা হবে, CPX-এর দায়িত্ব হবে প্রিফিলিং এবং KV Cache-এর তৈরি, while Rubin GPU-এর দায়িত্ব হবে decoding, long-context inference scenarios-এর جন্য optimize।লেখক এবং উৎস: ওয়াল স্ট্রিট ভিজন
নভেডিয়া একটি চিপ প্রকল্প নিঃশব্দে পুনরায় শুরু করেছে, যা একসময় মার্কেট দ্বারা ত্যাগ করা হয়েছে বলে মনে করা হচ্ছিল, এবং এর লক্ষ্য হলো AI ইনফারেন্সের জন্য উচ্চ খরচের প্রিফিল (Prefill) ধাপ।
নভেডিয়া এআই ইনফারেন্স প্রিফিল স্পিড জিপিইউ প্রকল্প "রুবিন সিপিএক্স" পুনরায় শুরু করেছে এবং পণ্য ডিজাইনে বড় পরিবর্তন করেছে। বর্তমান পরিকল্পনা অনুযায়ী, নতুন সংস্করণের রুবিন সিপিএক্স ২০২৭ এর প্রথম ত্রৈমাসিকে উৎপাদন শুরু হওয়ার কথা।
এই প্রকল্পের পুনরায় শুরু একটি স্পষ্ট সংকেত দেয়: নভেডিয়া এআই ইনফারেন্স পর্যায়ের প্রিফিলিং পারফরম্যান্স এবং ব্যয়ের বাধা সমাধানে আরও বেশি বিনিয়োগ করছে। বড় মডেলের কনটেক্সট দৈর্ঘ্য অবিরাম বৃদ্ধি পাচ্ছে, এবং প্রিফিলিং পর্যায়ে অসংখ্য ইনপুট তথ্য প্রক্রিয়াকরণ এবং KV Cache তৈরি করতে হয়, যার দক্ষতা এআই ইনফারেন্সের মোট ব্যয় এবং বাস্তবায়নের অর্থনৈতিকতাকে সরাসরি প্রভাবিত করে।
গো মিংচি বলেছেন, বর্তমানে AI রিজনিং লোডের বেশিরভাগ 50% ইনপুট কনটেক্সট প্রসেসিং এবং KV ক্যাশে গঠন থেকে আসে।
চিপ স্পেসিফিকেশন ব্যাপকভাবে সংশোধন করা হয়েছে, ক্ষমতা স্ট্যান্ডার্ড Rubin-এর কাছাকাছি
ক্ষমতা এবং বিদ্যুৎ খরচের দিক থেকে, নতুন সংস্করণের CPX-এর পারফরম্যান্স স্ট্যান্ডার্ড Rubin GPU-এর কাছাকাছি পৌঁছেছে, একক কার্ডের সর্বোচ্চ বিদ্যুৎ খরচও 2300 ওয়াটে পৌঁছেছে। মেমোরির ক্ষেত্রে, নতুন সংস্করণের CPX 168GB HBM4 ভিডিও মেমোরি ব্যবহার করে, যা আগের 128GB GDDR7 সমাধানের তুলনায় স্পষ্টভাবে উন্নত, তবে স্ট্যান্ডার্ড Rubin GPU-এর 288GB HBM4-এর তুলনায় এখনও কম।
গো মিং-চির মতে, 8-কার্ড CPX কম্পিউটিং ট্রেতে HBM4 ক্ষমতা মোট প্রায় 1.34TB, যা বেশিরভাগ দীর্ঘ কনটেক্সট প্রিফিলিং ওয়ার্কলোড এবং সংশ্লিষ্ট KV ক্যাশে প্রয়োজনীয়তা কভার করে। এর অর্থ হল, Rubin CPX শুধুমাত্র উচ্চতর জেনারিক কম্পিউটিং পাওয়ারের জন্য নয়, বরং দীর্ঘ কনটেক্সট সিনারিওর জন্য গ্রাফিক্স মেমোরি ক্ষমতা এবং প্রিফিলিং দক্ষতাকে পুনরায় ডিজাইন করা হয়েছে।
শেয়ারড র্যাক থেকে ইন্ডিপেন্ডেন্ট ডিপ্লয়মেন্টে স্যুইচ করুন, যার কনফিগারেশন আরও ফ্লেক্সিবল
র্যাক আর্কিটেকচারও এই সংশোধনের গুরুত্বপূর্ণ অংশ।
পূর্ববর্তী পরিকল্পনায়, সিপিএক্স রুবিন জিপিইউ-এর সাথে র্যাক শেয়ার করার পরিকল্পনা করেছিল; নতুন সংস্করণে এটি একক MGX ETL র্যাকে পরিবর্তিত হয়েছে, যা গ্রাহকদের বাস্তব প্রয়োজনের ভিত্তিতে সিপিএক্স ক্যালকুলেশন ক্ষমতা আলাদাভাবে বাড়ানোর অনুমতি দেয়।
বিস্তারিতভাবে দেখা যায়, গ্রাহকরা 64, 128, 192 বা 256টি CPX GPU এর ডিপ্লয়মেন্ট স্কেল বেছে নিতে পারেন। প্রতি 64টি CPX GPU একটি র্যাক মডিউল গঠন করে, যার মধ্যে 8টি কম্পিউটিং ট্রে রয়েছে, প্রতিটি ট্রেতে 8টি CPX GPU সজ্জিত থাকে, এবং একটি সুইচ ট্রেও সংযুক্ত থাকে।
মডিউলার ডিজাইনের অর্থ হল গ্রাহকদের নির্দিষ্ট বড় রুবিন র্যাকের সাথে ক্রয় করার প্রয়োজন নেই; তারা পূর্ব-পূরণকৃত লোডের প্রয়োজনীয়তার ভিত্তিতে সহজেই CPX ক্ষমতা বাড়াতে পারেন।
স্তরবদ্ধ ইন্টারকানেক্টিভ ডিজাইন, প্রি-ফিল ডিপ্লয়মেন্ট খরচ কমানো
ইন্টারকানেক্টেড আর্কিটেকচারে, রুবিন সিপিএক্স পারফরম্যান্স এবং খরচের মধ্যে একটি ট্রেডঅফ করে স্তরীয় ডিজাইন ব্যবহার করে।
একটি একক ক্যালকুলেশন ট্রেতে, 8টি CPX GPU এনভিলিঙ্ক দ্বারা স্কেল-আপ এক্সটেনশন করা হয়। প্রতিটি CPX GPU-এর এনভিলিঙ্ক ব্যান্ডউইথ 1 থেকে 1.5 টিবি/সেকেন্ড, যা স্ট্যান্ডার্ড Rubin GPU-এর 3.6 টিবি/সেকেন্ড-এর চেয়ে কম।
প্লেট এবং র্যাক মডিউলের মধ্যে এবং র্যাক মডিউলের ভিতরে স্কেল-আউট লেভেলে, CPX Spectrum-6 ইথারনেট ফুল-কপার L1 লিংক ব্যবহার করে; র্যাক মডিউলগুলির মধ্যে সংযোগের জন্য, প্রতিটি মডিউলের Spectrum-6 সুইচের মাধ্যমে OSFP অপটিক্যাল লিংকের মাধ্যমে ইন্টারকানেকশন সম্পন্ন হয়।
পুরোপুরি হাই-ব্যান্ডউইথ GPU ইন্টারকানেকশনের উপর নির্ভরশীল সমাধানের তুলনায়, এই স্তরবদ্ধ আর্কিটেকচারটি প্রিফিল স্কেনারিওর জন্য খরচ অপ্টিমাইজেশনকে বেশি গুরুত্ব দেয়।
Rubin GPU-এর সাথে সমন্বয় করে দীর্ঘ প্রসঙ্গ যুক্তিকে লক্ষ্য করুন
রুবিন সিপিএক্স একটি স্বাধীনভাবে চলা জেনারিক জিপিইউ নয়, বরং এটি ভেরা রুবিন এনভিএল৭২-এর সাথে প্রি-ফিলিং অ্যাক্সেলারেটর হিসাবে ব্যবহৃত হয়।
গুয়াং মিংচির মতে, নভেডিয়া CPX এবং Rubin GPU-কে 1:1 অনুপাতে বিন্যাস করতে সুপারিশ করে: CPX প্রি-ফিলিং পর্যায়ের গণনা পরিচালনা করে এবং KV Cache তৈরি করে, তারপর এথারনেট RDMA-এর মাধ্যমে KV Cache-কে Rubin GPU-এ প্রেরণ করা হয়, যা পরবর্তী ডিকোডিং সম্পন্ন করে।
পণ্যের অবস্থানের দিক থেকে, রুবিন সিপিএক্স-এর মূল উদ্দেশ্য হল স্ট্যান্ডার্ড রুবিন জিপিইউকে প্রতিস্থাপন করা নয়, বরং এটি এআই ইনফারেন্স প্রক্রিয়াটিকে আরও বিভক্ত করে বিভিন্ন জিপিইউকে প্রি-ফিলিং এবং ডিকোডিং কাজগুলির জন্য দায়িত্ব দেয়।
গুও মিংচি এটিকে "দীর্ঘ কনটেক্সট প্রিফিলিংয়ের সর্বোত্তম মূল্য-প্রতি-পারফরম্যান্স সমাধান" হিসাবে চিহ্নিত করেছেন। এআই মডেলের কনটেক্সট উইন্ডো বাড়তে থাকার সাথে সাথে প্রিফিলিং পর্যায়ের গণনা চাহিদা এবং KV ক্যাশের আকার নিরন্তর বৃদ্ধি পাচ্ছে, এবং এনভিডিয়া এই প্রকল্পটি পুনরায় শুরু করেছে, যা সম্ভবত বিশেষায়িত হার্ডওয়্যার এবং হাইব্রিড ডিপ্লয়মেন্টের মাধ্যমে দীর্ঘ কনটেক্সট ইনফারেন্সের খরচ আরও কমানোর চেষ্টা।
