ওপেনএআইয়ের জালাপেনিও চিপ এনভিডিয়ার ব্ল্যাকওয়েলকে দক্ষতায় ছাড়িয়ে গেছে

iconTechFlow
শেয়ার
AI summary iconসারাংশ
অন-চেইন বিশ্লেষণের মতে, ওপেনএআইয়ের জালাপেঞ্জো চিপটি এনভিডিয়ার ব্ল্যাকওয়েলের চেয়ে ভালো শক্তি দক্ষতা প্রদর্শন করে। ১৬ মাসে তৈরি এই চিপটি কী বেঞ্চমার্কগুলিতে এনভিডিয়া, এএমডি এবং গুগলের চিপগুলির চেয়ে ভালো পারফরম্যান্স দেখিয়েছে। জালাপেঞ্জোকে সাধারণ AI ইনফারেন্সের জন্য ডিজাইন করা হয়েছে, যা স্পেকুলেটিভ ডিকোডিং ছাড়াই প্রতিওয়াটে উচ্চ টোকেন থ্রুপুট প্রদান করে। যদিও এতে CUDA সমর্থন নেই, তবুও এর পারফরম্যান্স AI চিপ বাজারকে পরিবর্তন করতে পারে। অন-চেইন ডেটা অনুযায়ী,বিকল্প AI হার্ডওয়্যার সমাধানগুলির প্রতি আগ্রহ বাড়ছে।

লেখক: SemiAnalysis

স্টিম টেকফ্লো

শিনচাওয়ের পরিচয়: ওপেনএআই-এর প্রথম স্ব-উন্নয়নকৃত ইনফারেন্স চিপ জালাপেঞ্জোর পরীক্ষামূলক ডেটা প্রকাশিত হয়েছে, যা নিভেডিয়ার বর্তমান ফ্ল্যাগশিপ ব্ল্যাকওয়েলকে ক্ষমতা দক্ষতায় ছাড়িয়ে গিয়েছে এবং পরবর্তী প্রজন্মের রুবিনের দিকে এগিয়ে যাচ্ছে। ডেটা সেন্টারের বিদ্যুৎ বাধার সমস্যায় আটকা পড়া এআই কোম্পানিগুলির জন্য, এই চিপটি কম্পিউটিং বাজারের কাঠামোকে পুনর্গঠন করতে পারে। তবে, প্রথম প্রজন্মের চিপটি কি প্রকৃতপক্ষে নিভেডিয়ার CUDA ইকোসিস্টেমকে কমপক্ষেই কমিয়ে ফেলতে সক্ষম হবে, তা এখনও একটি প্রশ্নবিদ্ধ।

আপনার নিজস্ব ডিজাইন করা ASIC ব্যবহার করে রুবিন এবং জালাপেনিওর সাথে মোট মালিকানা খরচ, প্রতি মেগাওয়াট থ্রুপুট এবং পিকান্ট বিস্তারিত তুলনা করুন

গত দুই বছর ধরে, ওপেনএআই "জালাপেনিও" নামক একটি ইনফারেন্স চিপ নিয়ে নীরবে গবেষণা চালিয়েছে, এবং এখনই এটি হট চিপসে প্রকাশিত হয়েছে। চিপটির প্রোটোটাইপ সফলভাবে প্রস্তুত হওয়ার কথা কিছুদিন ধরে প্রচারিত হচ্ছিল। কিন্তু এখন আমরা বিস্তারিত তথ্য পেয়েছি। ওপেনএআই আমাদের চিপটি দেখার, ল্যাবে প্রমাণ করার এবং আমাদের InferenceX কিট ব্যবহার করে বেঞ্চমার্কিংয়ের জন্য আমন্ত্রণ জানিয়েছে।

২০২৪ সালের জুনে, ওপেনএআই ব্রডকমের সাথে একটি চিপ প্রকল্প ঘোষণা করে, যা LLM ইনফারেন্সের জন্য শূন্য থেকে তৈরি করা হয়েছে। ডিজাইন কাজটি ২০২৪ সালের মধ্যভাগে শুরু হয়, এবং প্রথম দলের নিয়োগ থেকে উৎপাদন পর্যন্ত মাত্র ১৬ মাস সময় লাগে, যা একটি অত্যন্ত দ্রুত ASIC উন্নয়ন চক্র।

সাধারণত প্রথম প্রজন্মের চিপগুলি প্রতিযোগিতামূলক হয় না, কিন্তু OpenAI বিপরীত পথে এগিয়েছে এবং আমরা যে সমস্ত নভেডিয়া, এএমডি এবং গুগল চিপ পরীক্ষা করেছি, তাদের সবগুলির উপরে এটি অনেকগুলি শীর্ষস্থানীয় ওপেন-সোর্স মডেলে জয়ী হয়েছে, যা শিল্পের নেতৃত্বে রয়েছে। OpenAI-এর সাফল্যের পিছনে রয়েছে চরম সফটওয়্যার-হার্ডওয়্যার সমন্বয়। আশ্চর্যজনকভাবে, OpenAI মডেল ইনফারেন্সের কোনও নির্দিষ্ট দিকের উপর অতিমাত্রায় ফোকাস করেনি, বরং সমস্ত পরিস্থিতিতেই উচ্চ পারফরম্যান্স প্রদানকারী একটি সাধারণ চিপ তৈরির উপর মনোনিবেশ করেছে।

এই প্রবন্ধটি Jalapeño-এর InferenceX-এ আর্কিটেকচার, সফটওয়্যার বিস্তারিত এবং পারফরম্যান্স ফলাফলের গভীরে যাবে।

একটি সার্বজনীন যুক্তি চিপ

সবাই বলে যে ওপেনএআইয়ের চিপটি ওপেনএআই মডেলগুলির জন্য কাস্টমাইজড, কিন্তু এটি ভুল, ওপেনএআই একটি জেনারিক চিপ তৈরি করেছে যা এআই ইনফারেন্সের জন্য উপযুক্ত।

টাইমলাইন অত্যন্ত পাগলামি। এটি দেখায় যে “AI দিয়ে চিপ ডিজাইন ত্বরান্বিত করা” এর দাবি সত্য। যদিও টাইমলাইন খুব দ্রুত, তবুও OpenAI ব্যাপক অর্থ ব্যয় করেছে, ব্যবহারিক ডিজাইন সিদ্ধান্ত নিয়েছে এবং দলটি অত্যন্ত শক্তিশালী, তাই এটি আশ্চর্যজনক নয়।

শুধু স্পেসিফিকেশন দেখলেই এটি তাত্ক্ষণিকভাবে একটি শক্তিশালী প্রতিদ্বন্দ্বী:

এবং HBM4 ব্যবহার করে এটিকে নভেডিয়া এবং এএমডি-এর ফ্ল্যাগশিপ GPU-এর সাথে তুলনা করার যোগ্য করে তোলে:

এই চিপটি নিয়ে অনেক মিডিয়া অপেনএআইয়ের কয়েকটি অনিচ্ছাকৃত মন্তব্যের উপর ভিত্তি করে এটির কথা বলেছে, যে এটি অন্যান্য চিপের কাছে অসম্ভব হওয়া উপায়ে তাদের মডেলগুলির জন্য অপ্টিমাইজেশন করবে। এটি ভুল। জালাপেঞ্জো একটি সাধারণ ইনফারেন্স চিপ, যা বিভিন্ন মডেল এবং বিভিন্ন ওয়ার্কলোড, অন্তর্ভুক্ত করে আমাদের InferenceX বেঞ্চমার্কও চালাতে পারে—আমরা এই বেঞ্চমার্কটি অপেনএআইয়ের ইঞ্জিনিয়ারদের সাথে ল্যাবে চালিয়েছিলাম। একটি হাস্যকরভাবে, অপেনএআই আমাদের দেখিয়েছিল যে কীভাবে এটি ‘ডিস্ট্রয়ার’ খেলা চালাচ্ছে, যা শুধুমাত্র Codex প্রম্পট ব্যবহার করে তাদের চিপের উপরে পোর্ট করা হয়েছিল।

আমাদের সবচেয়ে গুরুত্বপূর্ণ পারফরম্যান্স/ওয়াট ফলাফল হল প্রতি মেগাওয়াট মোট শক্তি খরচের উপর ভিত্তি করে টোকেন থ্রুপুট। জালাপেঞ্জো অন্য সব চিপের চেয়ে অনেক বেশি ভালো পারফরম্যান্স দেখিয়েছে। এই সব ফলাফলে MTP (মাল্টি-টোকেন প্রেডিকশন) ব্যবহার করা হয়নি, অন্যদিকে, গ্রাফের অন্যান্য চিপগুলি তাদের প্রতিটি SKU-এর জন্য MTP চালু করে সর্বোত্তম কনফিগারেশনে চলছে।

জালাপেঞ্জো প্রায় সমস্ত স্কেনারিওতে ব্ল্যাকওয়েলের চেয়ে পারফরম্যান্স/ওয়াট বেশি দেখায়, এবং কোনো নির্দিষ্ট পয়েন্টের জন্য অপ্টিমাইজ করা হয়নি। এটি শুধুমাত্র লো-ল্যাটেন্সি স্কেনারিওতেই ভালো পারফরম্যান্স দেখায় না, বরং হাই-থ্রুপুট স্কেনারিওতেও অসাধারণ। একটি আরও বিচারযোগ্য তুলনা হলো একটি টোকেন প্রেডিকশনের ফলাফল দেখা—জালাপেঞ্জো প্রতিটি প্রতিদ্বন্দ্বীকে কয়েকটা স্টেপ দূরে ফেলে দেয়। লো-কনকারেন্সি স্কেনারিওতে, জালাপেঞ্জো DeepSeek R1 মডেলে 1 কনকারেন্সির জন্য প্রতি ব্যবহারকারী প্রতি সেকেন্ডে 700-এরও বেশি টোকেন প্রদান করে।

অবিশ্বাস্য হলো, এই সবকিছু একটি টোকেন পূর্বানুমান (STP) দিয়ে সম্পন্ন হয়েছে, কোনো অনুমানমূলক ডিকোডিং বা প্রিফিলিং-ডিকোডিং বিচ্ছিন্নতা ছাড়াই। DeepSeek R1-এর পাশাপাশি, আমরা অন্যান্য কিছু মডেলও দেখেছি, যেমন Kimi-K2.5 এবং GPT-OSS, যারা প্রতি ব্যবহারকারী প্রতি সেকেন্ডে প্রায় 1,400 টোকেন পরিচালনা করে। সমস্ত মডেলের জন্য, আমরা নিশ্চিত করেছি যে Jalapeño-এর GSM8k মূল্যায়নের ফলাফল নভেডিয়া চিপের সমান।

এখানে কিছু নোট রয়েছে। প্রথমত, সমস্ত ডেটা OpenAI দ্বারা প্রদান করা হয়েছে। আমরা প্রায়োগিকভাবে InferenceX-এর চলমান অবস্থা যাচাই করেছি, তবে সম্পূর্ণ InferenceX বেঞ্চমার্ক স্যুট চালাইনি এবং AgentX-এর ফলাফলও দেখিনি। AgentX হল আমাদের চিপের পারফরম্যান্স তুলনা করার জন্য প্রাথমিক স্যুট, কারণ এর ডেটাসেটের অত্যন্ত দীর্ঘ কনটেক্সট এবং মাল্টি-রাউন্ড বৈশিষ্ট্যগুলি বাস্তব উৎপাদন কাজের চাপে ক্যাশে আচরণকে প্রতিফলিত করে। 8k1k-এ ভালো পারফরম্যান্স দেখানো ফ্রেমওয়ার্কগুলি AgentX-এ আরও খারাপভাবে পারফরম করতে পারে, কারণ বাস্তব উৎপাদন লোডগুলি রাউটার, প্রিফিক্স ক্যাশে মেকানিজম, ক্যাশে ম্যানেজমেন্ট, অফলোডিং ইনফ্রাস্ট্রাকচারসহ বিভিন্ন উপাদানগুলিকে টেস্ট করে। এক-রাউন্ড 8k1k টেস্টগুলি এইসবকে কভার করেনা। আরও তথ্যের জন্য, আমাদের AgentX নিবন্ধটি পড়ুন।

AgentX - InferenceXv3: কি এজেন্ট ইনফারেন্সে CUDA প্রতিরক্ষা এখনও টিকে আছে?

দ্বিতীয়ত, আমরা মনে করি ব্ল্যাকওয়েলের সাথে তুলনা কিছুটা অসম্পূর্ণ এবং বেশি অন্যায়। জালাপেঞ্জোর প্রকৃত প্রতিদ্বন্দ্বী হল HBM4 ব্যবহার করে এমন রুবিন ইত্যাদি চিপ। ভেরা রুবিন সিস্টেমটি এখনই গ্রাহকদের কাছে পাঠানো শুরু করেছে, যখন OpenAI-এর জালাপেঞ্জো এখনও শুধুমাত্র ইঞ্জিনিয়ারিং নমুনা, এবং বড় পরিমাণে উৎপাদনের জন্য এখনও কিছুক্ষণ লাগবে।

তাই, পারফরম্যান্স আসলে ব্ল্যাকওয়েলের পরিবর্তে রুবিনের সাথে তুলনা করা উচিত। কিছুটা অর্থে, আমরা জালাপেঞ্জোর মতো কাস্টম চিপগুলির ব্ল্যাকওয়েলকে ছাড়িয়ে যাওয়ার প্রত্যাশা করেছিলাম। আমরা গত মাসে নভিডিয়া এবং কোরওয়েভের পারফরম্যান্স দাবি বিশ্লেষণ করার সময় লিখেছিলাম যে, Vera Rubin NVL72-এর পারফরম্যান্স/ওয়াট 72 GB200 NVL72-এর 5.4 গুণ। পরে, আমরা Jalapeño-কে Vera Rubin-এর জুলাইয়ের পারফরম্যান্স ডেটার সাথে তুলনা করব।

ভেরা রুবিন NVL72 বনাম GB200 NVL72? রিজনিং TCO এবং আর্কিটেকচার বিশ্লেষণ

তৃতীয়ত, পরীক্ষার মডেলগুলি ওপেন-সোর্সের সবচেয়ে এগিয়ে থাকা সীমানার বাইরে। নভিডিয়া এবং এএমডি ইতিমধ্যে AgentX-এর মাধ্যমে ডিপসিক V4 Pro এবং কিমি K3 এর মতো বড় মডেলগুলির ফলাফল প্রকাশ করেছে। মডেল যত বড় এবং প্রকাশিত হওয়ার সময় তত সাম্প্রতিক, নতুন চিপে এটি চালানো তত জটিল। তবুও, ওপেনএআই-এর Jalapeño-এ চালানো মডেলগুলি ছোটও নয়।

Performance Analysis

OpenAI-এর ডিজাইন লক্ষ্য হল পারফরম্যান্স/ওয়াট। কারণটি খুব সহজ: OpenAI বর্তমানে ডেটা সেন্টারের বিদ্যুৎ সরবরাহের কারণে সীমাবদ্ধ, বরং বাজেট বা মেশিন হলের জায়গার কারণে নয়, তাই প্রতি মেগাওয়াটের টোকেন সংখ্যা অত্যন্ত গুরুত্বপূর্ণ। Computex 2026-এ, হুয়াং রেনক্সন বলেন যে পারফরম্যান্স/ওয়াট, বিশ্বস্ততা এবং দীর্ঘজীবিতা হল ভবিষ্যতের GPU-এর মূল বৈশিষ্ট্য। তিনি বলেন: “আপনার যদি 1 গিগাওয়াট বিদ্যুৎ থাকে, তবে প্রতি ওয়াটের থ্রুপুটই আয়।” তিনি আরও উল্লেখ করেন যে, শুধুমাত্র চিপটি সস্তা হওয়ার কারণে ভুল আর্কিটেকচার বেছে নেওয়ার কোনও অর্থ নেই।

হট চিপস ২০২৬-এ ভেরা স্পিচে নভেডিয়াও এটি জোর দিয়েছে এবং একই আয়ের গ্রাফ দেখিয়েছে: “আজকের ডেটা সেন্টারগুলি বিদ্যুতের সীমাবদ্ধতায় রয়েছে।” বিদ্যুত অত্যন্ত গুরুত্বপূর্ণ এবং আয়কে পরিচালিত করে।

অপারেটরদের সহজেই আরও মেগাওয়াট পাওয়া যায় না। জিপিইউ বৃদ্ধি এবং গ্রিড ক্ষমতা বৃদ্ধির সময়সীমা অত্যন্ত ভিন্ন। ডেটা সেন্টারের বিদ্যুৎ সীমাবদ্ধতা অনেক সীমাবদ্ধতার কারণে ঘটে। উদাহরণস্বরূপ, ইউটিলিটি ইন্টারকানেকশন, অবকাঠামো, শীতলন ক্ষমতা এবং UPS/ব্যাকআপ জেনারেটর ডিজাইন। গ্রিডের দেরি প্রায়শই হার্ডওয়্যার এবং নির্মাণের অগ্রগতির চেয়ে বেশি হয়, যা বিদ্যুৎ মিটারের পিছনের ক্ষমতার প্রয়োজনীয়তা তৈরি করে। অর্থাৎ, ডেটা সেন্টারের স্থানীয়ভাবে গ্যাস টারবাইন এবং স্থানীয় জেনারেটর নির্মাণ। এই ক্ষমতা ইউটিলিটি মিটারের পিছনে অবস্থিত, যা পাবলিক গ্রিডের উপর নির্ভরশীল নয়। এটি অপারেটরদেরকে গ্রিড ইন্টারকানেকশন এবং ইউটিলিটি আপগ্রেডের জন্য 기다িতে হবে না, যা সুবিধাকেই সরবরাহ করে। xAI-এর Colossus 2-এর প্রধানতঃ এইভাবেই বিদ্যুৎ-মিটার-পিছনের ক্ষমতার উপর নির্ভরশীল, যখনকি এটির প্রকৃত গ্রিড-সংযোগটি অনেকটা পিছিয়ে। আরও তথ্যের জন্য,আমাদের শক্তির মডেলটি dekhen।

যেমন আমরা X পোস্টে লিখেছি, tok/s/MW কে প্রতি জুল টোকেন সংখ্যা হিসাবে সরলীকরণ করা যায়। কারণ ওয়াট হল প্রতি সেকেন্ডে জুল। তাই tok/s/MW প্রতিনিধিত্ব করে সিস্টেমের দক্ষতা এবং শক্তিকে টোকেনে রূপান্তর করার ক্ষমতা।

এই দিকে, রুবিনের তুলনায় জালাপেঞ্জো বেশি শ্রেষ্ঠ। ওপেনএআইয়ের জালাপেঞ্জো প্রতি মেগাওয়াট STP-এ টোকেন থ্রুপুট জেনারেট করে, যা ভেরা রুবিনের MTP ফলাফলকে ছাড়িয়ে যায়। এই ফলাফলটি নভেম্বরে নভিডিয়া এবং কোরওয়েভ প্রকাশ করেছে। এটি GB200-এর 2025 সালের MTP ফলাফলকেও অনেক বেশি ছাড়িয়ে যায়। যেমন আমরা ভেরা রুবিন নিবন্ধে উল্লেখ করেছি, VR-এর তুলনা 2025 সালের GB200-এর ফলাফলের সাথে করা হয়েছে। কারণ উভয়ই একই ধরনের প্রাথমিক শুরুর পর্যায়ে। এছাড়াও, 2025 সালের GB200-এর সাথে তুলনা করলে সফটওয়্যার পরিপক্কতা অপরিবর্তিত থাকে। এই যুক্তির ভিত্তিতে, আমরা তিনটি ফলাফলকে তুলনা করি: ভেরা রুবিনের 2026 সালের 7-এর সর্বশেষ ফলাফল, GB200-এর 2025 সালের ফলাফল, এবং বর্তমান Jalapeño-এর ফলাফল। এই তুলনা খুবই যৌক্তিক, কারণ এগুলোই সবচেয়ে ভালো প্রকাশিত Rubin-এর ডেটা। এছাড়াও, OpenAI Rubin-এর পরেই নিজস্ব চিপটি প্রক্রিয়াকরণ (সিলিকন) করেছে। OpenAI এবং Rubin-এরা উভয়ই এখনওঅপরিপক্ক, তাই পারফরম্যান্সটি আরওউন্নতির পথে।

পারফরম্যান্স/সমগ্র মালিকানার খরচের ক্ষেত্রে, ভেরা রুবিন এবং জালাপেঞ্জো সমান পারফরম্যান্স দেখাচ্ছে। প্রতি ডলারে প্রায় একই সংখ্যক আউটপুট টোকেন উৎপাদন করে। তবে আগেই উল্লেখ করা হয়েছে, জালাপেঞ্জোর ফলাফলগুলি স্পেকুলেটিভ ডিকোডিং ব্যবহার করে না। ভেরা রুবিনের ফলাফলগুলি স্পেকুলেটিভ ডিকোডিং ব্যবহার করে। স্পেকুলেটিভ ডিকোডিং প্রতি টোকেনের খরচকে প্রায় 3-5 গুণ কমিয়ে দিতে পারে। যখন জালাপেঞ্জো স্পেকুলেটিভ ডিকোডিং বাস্তবায়িত করবে, তখন এটির টোকেন সরবরাহের খরচ-কার্যকারিতা আরও বেশি হবে। অবশ্যই, TCO-এর কিছু সুবিধা এনভিডিয়ার উচ্চ মার্জিনকে এড়িয়ে ব্রডকমের কম (তবুও খুব উচ্চ) মার্জিনের দিকে যাওয়ার কারণে। কিন্তু এটাই একমাত্র কারণ নয়। উদাহরণস্বরূপ, Meta এবং Microsoft-এর AI ASIC প্রকল্পগুলির দীর্ঘসময়ের বিনিয়োগও সফলভাবে বাস্তবায়িত হয়নি। এটি বোঝায় যে,খরচই সমীকরণের একটি অংশমাত্র। Jalapeño-এর TCO-এর সম্পূর্ণ বিশ্লেষণের জন্য SemiAnalysis AI Cloud TCO Model-এর দিকে তাকান।

আর্কিটেকচারে, ওপেনএআই প্রিফিল (prefill) এবং ডিকোড (decode) কে আলাদা চিপ পুলে বিভক্ত করার পরিবর্তে একই চিপ এবং ইন্টারকানেকশন স্ট্রাকচার শেয়ার করে। এই ডিজাইন ফিলোসফি কিছুটা থিওরেটিক্যাল দক্ষতা ত্যাগ করে বাস্তব অপারেশনাল সুবিধা অর্জন করে। এর উদ্দেশ্য হলো ওয়ার্কলোডের কম্পোজিশন সময়ের সাথে পরিবর্তিত হয়। উদাহরণস্বরূপ, ইনপুট, ক্যাশ লেখা, ক্যাশ পড়া এবং আউটপুট টোকেনের অনুপাত উল্লেখযোগ্যভাবে পরিবর্তিত হয়েছে। এই পরিবর্তনটি আমরা তিনটি মডেল জেনারেশন—জ্ঞান, রিজনিং এবং এজেন্ট—অতিক্রম করার পরে ঘটেছে, যেগুলি আমাদের সম্প্রতির নিবন্ধে আলোচনা করা হয়েছে। তাই, যদি আমরা হেটারোজিনিয়াস প্রিফিল এবং ডিকোড সিলিকনের জন্য পূর্বনির্ধারিত, স্থির সংখ্যা নির্ধারণ করি, তবে সময়ের সাথে সাথে এটি অদক্ষতা সৃষ্টি করবে। OpenAI-এর এই আর্কিটেকচারে, একইভাবে (homogeneous) পুলকেই বেছে নেওয়া হয়েছে, এবং চিপগুলির সমস্ত টাস্কেইভালোভাবেই পারফরম্যান্স নিশ্চিতকরণের চেষ্টা করা হচ্ছে।

এবং এটি সত্যিই করেছে। Kimi K2.5 (যার উপর ভিত্তি করে Cursor Composer 2.5 তৈরি করা হয়েছে) এ, Jalapeño প্রতি ব্যবহারকারী প্রায় 700 tok/s পৌঁছেছে। এই গতি দ্বিতীয় সেরা চিপের 100 tok/s/user-এর চেয়ে 9 গুণেরও বেশি।

GPT-OSS-এ, আবারও একটি পুরোপুরি বিজয়। Jalapeño-এর প্রতি মেগাওয়াট ইন্টারেক্টিভ থ্রুপুট, GB200-এর সর্বোচ্চ থ্রুপুট পয়েন্টের প্রায় দ্বিগুণ। এটি GB200-এর 1-পয়েন্ট কনকারেন্সির চেয়ে 50 গুণেরও বেশি। উচ্চতর কনকারেন্সির জন্য Jalapeño পয়েন্ট EP8 ব্যবহার করে।

এই ফলাফলগুলি অসাধারণ! তবে আমাদের কিছুটা কঠোর হতে হবে: এগুলি শুধুমাত্র 8k1k, যার টিউনিং খুব সহজ, এবং এখনও AgentX-এর রানিং ডেটা নেই। AgentX নিবন্ধে আমরা উল্লেখ করেছি যে, মাল্টি-রাউন্ড এবং দীর্ঘ কনটেক্সট ওয়ার্কলোডগুলি ইনফারেন্স স্ট্যাকের অনেক দিককে চাপে ফেলে। উদাহরণস্বরূপ, রাউটার এবং প্রিফিক্স ক্যাশ। এজেন্ট ওয়ার্কলোডে ভালোভাবে পারফর্ম করতে, আরও অপ্টিমাইজেশনের প্রয়োজন। AgentX নিবন্ধটি পড়ুন।

AgentX - InferenceXv3: কি এজেন্ট ইনফারেন্সে CUDA প্রতিরক্ষা বেষ্টনী এখনও টিকে আছে?

গভীর স্পেসিফিকেশন এবং আর্কিটেকচার

এই সমস্ত ফলাফল Jalapeño-এর A0 স্টেপ থেকে এসেছে, যা প্রকল্পটি শুরু হওয়ার মাত্র 9 মাস পরে। কিন্তু B0 স্টেপ এখন ওয়েফার ফ্যাক্টরিতে রয়েছে! B0-এর অপ্টিমাইজেশন A0 সিলিকনের তুলনায় প্রতি ওয়াটে পারফরম্যান্স প্রায় 25% বাড়িয়েছে। বিশদভাবে, B0 স্টেপ একটি মাস্ক সাইজে 13.4 PFLOPs MXFP4 অর্জন করে। এই চিপটি TSMC N3P-এ তৈরি। তুলনায়, একটি একক Rubin কম্পিউটিং চিপ সমান আকার এবং একই নোডে 17.5 PFLOPs ঘনত্বপূর্ণ Rubin NVFP4 অর্জন করে।

জালাপেঞ্জোর TDP মাত্র 700W, যখন রুবিন প্রতি কম্পিউটিং চিপে 900-1150W ব্যবহার করে, তাই এই পারফরম্যান্স আরও প্রশংসনীয়। যেহেতু জালাপেঞ্জো ট্রেনিংয়ের পরিবর্তে ইনফারেন্সের জন্য ডিজাইন করা হয়েছে, OpenAI-কে FLOPs-কে সর্বোচ্চে নিয়ে যাওয়ার জন্য TDP বাড়ানোর প্রয়োজন হয়নি। এটি বোঝা যায়। তবুও, উপরের ফলাফলগুলি দেখায় যে জালাপেঞ্জো উল্লেখযোগ্য শীর্ষ থিওরেটিক্যাল FLOPs প্রদান করে।

জালাপেঞ্জো অন্যান্য অ্যাক্সেলারেটরের সাথে তুলনা করলে প্রতি ওয়াটে সর্বোচ্চ HBM ব্যান্ডউইথ এবং প্রতি ওয়াটে সর্বোচ্চ FLOPs প্রদান করে। এই স্তরটি 1800W রুবিন ম্যাক্স-কিউ কনফিগারেশনের সাথে তুলনীয়।

জালাপেঞ্জো HBM4 সহ চিপ হিসেবে আসছে, যা Nvidia এবং AMD-এর পরে এই প্রযুক্তি অন্তর্ভুক্ত করা প্রথম চিপগুলির মধ্যে একটি হবে, এমনকি বিদ্যমান TPU এবং Trainium প্রকল্পগুলির চেয়েও এগিয়ে। জালাপেঞ্জোর একটি মূল আর্কিটেকচারাল নীতি হল HBM ব্যান্ডউইথকে সর্বোচ্চ ব্যবহার করা, তাই উচ্চতর HBM-এর পরিবর্তে কম মানের HBM ব্যবহার করা এই লক্ষ্যের বিরুদ্ধে। এটি প্রতি প্যাকেজে 15.4TB/s মেমোরি ব্যান্ডউইথ অর্জন করে, যা HBM3E ব্যবহার করা অন্যান্য সমস্ত বিক্রিত অ্যাকসেলারেটরগুলির চেয়ে বেশি। 15.4TB/s ব্যান্ডউইথের মাধ্যমে HBM4-এর পিন রেট 10Gbps-এরও বেশি হওয়ার ইঙ্গিত পাওয়া যায়, যা Nvidia-এর Rubin-এ HBM4-এর 9.6Gbps-এর চেয়ে কিছুটা বেশি। HBM-এর সম্ভাব্য সরবরাহকারী Samsung।

2025 নভেম্বরে, ওপেনএআই Jalapeño কে কোওয়োস ডিজাইন ফ্লাশে প্রক্রিয়াকরণ করেছে, শুধুমাত্র টপ-লেয়ার ডাইয়ের জন্য নয়। 2025 নভেম্বরে ফ্লাশের পর 9 মাসে, এবং শুধুমাত্র বাস্তব সিলিকনে 3 মাসের ডিবাগিংয়ের পর, ওপেনএআই Jalapeño দিয়ে অসাধারণ ফলাফল অর্জন করেছে। সফটওয়্যার স্ট্যাকে টিমটি শূন্য থেকে শুরু করেছিল, এটি আরও অসাধারণ।

এর সমান্তরালে, রুবিনের CoWoS ফ্লাই টেস্ট ২০২৫ সালের অক্টোবরে সম্পন্ন হয়েছিল, এক মাস আগে, কিন্তু আমরা এখন পর্যন্ত যে কোনও প্রাথমিক ফলাফল দেখেছি, তা হল CoreWeave-এর ইঞ্জিনিয়ারিং প্রোটোটাইপ থেকে। Nvidia ওপেনএআইয়ের মতো আমাদের পরীক্ষা করে বেঞ্চমার্ক প্রকাশের অনুমতি দেয়নি, যা ইঙ্গিত করে যে তাদের চিপের সফটওয়্যার এখনও অপরিপক্ব। যেহেতু OpenAI তাদের নিজস্ব চিপে এত দ্রুত নতুন মডেল চালাতে সক্ষম, CUDA-এর প্রতিরক্ষা প্রাচীরটি হয়তো অদৃশ্য হয়ে গেছে।

এখনও এগুলি অত্যন্ত অপ্টিমাইজ করা হয়নি, এবং আমরা দেখতে পাচ্ছি যে সামগ্রিকভাবে Jalapeño ভালো ডেটা দিয়েছে। আমরা মনে করি না যে Nvidia হার্ডওয়্যার খারাপ, বরং Jalapeño-এর সফটওয়্যার ডিবাগিং Nvidia-এর চেয়ে দ্রুত এগিয়েছে। এটি হার্ডওয়্যার/সফটওয়্যার কো-ডিজাইনের শক্তির প্রতিফলন, যা শীর্ষস্থানীয় অগ্রগামী ল্যাব ASIC দলগুলিকে বড়, পরিপক্ক বাণিজ্যিক চিপ প্রস্তুতকারকদের ছাড়িয়ে যেতে সক্ষম করে। বিপরীতভাবে, শূন্য থেকে শুরু করা OpenAI-এরও সুবিধা দিতে পারে, কারণ এটি পিছনের সঙ্গতি বা পুরনো সফটওয়্যার ভার্সনগুলির সীমাবদ্ধতা ছাড়াই সম্পূর্ণভাবে নতুন আর্কিটেকচারের সিদ্ধান্ত নিতে পারে।

যদিও ওপেনএআই-এর জালাপেঞ্জো প্রোটোটাইপ ইতিমধ্যে রয়েছে, বর্তমানে বড় পরিমাণে উৎপাদন ২০২৭ সালে ধাপে ধাপে বাড়ানোর পরিকল্পনা রয়েছে, এবং বেশিরভাগ উৎপাদন আগামী বছরের শেষের দিকে নির্ধারিত। ইউনিটের সংখ্যা এবং গড় বিক্রয়মূল্যের আরও বিস্তারিত তথ্যের জন্য SemiAnalysis Accelerator Model দেখুন।

ওপেনএআই জালাপেনো হল একটি প্রকৃত বড় স্কেল ASIC।

রুবিনের টাইমলাইনের তুলনায় জালাপেঞ্জোর গতি অবিশ্বাস্য হারে দ্রুত। যেমন আগে দেখানো হয়েছে, রুবিন আগে শুরু করলেও, জালাপেঞ্জোর ফলাফল রুবিনকে ছাড়িয়ে গেছে।

জালাপেঞ্জো আর্কিটেকচার

গভীর আর্কিটেকচারের দিক থেকে, এই চিপের ম্যাট্রিক্স ইঞ্জিন MXFP নিউমেরিক ফরম্যাট এবংওয়েট রেজিড পালসেটেড অ্যারে ব্যবহার করে, যা TPU-এর মতো। তবে TPU-এর সাথে সরাসরি তুলনা করলে, এটি ছোট আকার/ডাইমেনশনগুলির জন্য সমর্থন করে, যার অর্থ এটি বড় পালসেটেড অ্যারেতে ম্যাট্রিক্স গুণনের জন্য আকার মিলছে না এমন অদ্ভুত পারফরম্যান্স ক্লিফগুলির মতো হবে না।

এটির আরও 64-বিট স্কেলার কোর এবং FP32/INT32 ভেক্টর কোর রয়েছে। ওপেনএআই ট্রে লেভেলে রিডানডেন্সি ডিজাইনেও বিনিয়োগ করেছে এবং কোর এবং চ্যানেল লেভেলে ইনবিল্ট ইয়ার্ড রিকভারি রাখেছে। তারা দাবি করে যে, AI-সহায়িত চিপ ডিজাইনে SIMD এরিয়া 8% কমিয়েছে এবং ম্যাট্রিক্স ইঞ্জিনের এরিয়া 10% কমিয়েছে। যদিও তারা নির্দিষ্ট PVT (প্রসেস/ভোল্টেজ/টেম্পারেচার) শর্তগুলি উল্লেখ করেননি, তবে AI-সহায়িত মডিউলটি প্রাথমিক মডিউলের তুলনায় টাইমিং এবং পাওয়ার খরচ উন্নত করেছে।

জালাপেঞ্জো আর্কিটেকচারটি KVCache এবং ওজনের মেমোরি কপি এবং স্থির ল্যাটেন্সি ও ওভারহেড সমাপ্ত করার উপর ফোকাস করে, যাতে অন্যান্য অ্যাক্সেলারেটরের তুলনায় ছোট ব্যাচ বা ছোট আকৃতির ক্ষেত্রেও মূল শীর্ষ ক্ষমতা/ব্যান্ডউইথের কাছাকাছি পৌঁছানো যায়।

কোর এবং HBM কে বিভিন্ন স্লাইসে বিভক্ত করা হয়েছে, যেখানে প্রতিটি কোর স্লাইস তার নিজস্ব HBM স্লাইসের জন্য নিম্ন ল্যাটেন্সি স্থানীয় দৃশ্য রাখে। স্লাইসগুলির মধ্যে সিঙ্ক্রোনাইজেশন উচ্চ ব্যান্ডউইথ বিশেষ সংগঠন নেটওয়ার্কের মাধ্যমে করা হয়। এই অত্যন্ত সরল মেমোরি হায়ারার্কির কারণে Jalapeño GPU-এর তুলনায় বড় সম্ভাব্য সুবিধা অর্জন করেছে, কারণ GPU-এর মেমোরি অ্যাক্সেসকে জটিল মেমোরি সিস্টেমের মধ্যে দিয়ে যেতে হয়, যা বড় আকারের উপর বণ্টন বা লুকানোর প্রয়োজনীয়তা তৈরি করে।

এই পদ্ধতি কার্যকর, কারণ ওজন এবং KV-কে সুন্দরভাবে স্থাপন করে কোরগুলির মধ্যে সিঙ্ক্রোনাইজেশনকে সীমিত এবং পরিচিত উচ্চ ব্যান্ডউইথ যোগাযোগের সীমার মধ্যে সীমাবদ্ধ করা যায়, যেমন গণনার সাথে ওভারল্যাপ করা যায় এমন টেনসর প্যারালাল যোগাযোগ।

এছাড়াও, সাধারণ যোগাযোগ এবং বিস্তৃত নেটওয়ার্কে অ্যাক্সেসের জন্য একটি অতিরিক্ত সাধারণ NoC রয়েছে। সামগ্রিকভাবে, OpenAI একটি সরলীকৃত NOC এবং মেমোরি সাবসিস্টেমের মাধ্যমে Nvidia এবং Google-এর তুলনায় প্রচুর শক্তি সঞ্চয় করেছে এবং উল্লেখযোগ্য পারফরম্যান্স বৃদ্ধি অর্জন করেছে।

মূল স্তরে, ওপেনএআই একটি লেভেল-1 ক্যাশে সহ অর্ডার-অউট-অফ-সিকোয়েন্স (OoO) কোরের বর্ণনা দিয়েছে। এটি অন্যান্য অ্যাক্সেলারেটরগুলিতে দেখা যাওয়া প্যাটার্নের থেকে অনেক ভিন্ন, যেখানে সফটওয়্যার-পরিচালিত স্ট্রেচ মেমোরি, প্রায়শই অ্যাসিঙ্ক্রোনাস DMA সমর্থনসহ ব্যবহৃত হয়। এখানের যুক্তি হলো, এটি Jalapeño-কে ব্লকিং ল্যাটেন্সির মতো ফিক্সড ওভারহেড এড়াতে দেয়, যেখানে অন্যান্য অ্যাক্সেলারেটরগুলিতে (যেমন GPU) এই ওভারহেডগুলি প্রতি-কোর কাজের পরিমাণ বাড়িয়ে লুকানো বা বণ্টন করতে হয়, যা মূল শীর্ষ ব্যান্ডউইথ/কম্পিউটেশনের কাছাকাছি আসাকে আরও কঠিন করে তোলে।

এর মূল্য হলো, Jalapeño-এর জন্য মেমোরি অনুরোধগুলি সময়মতো পৌঁছানোর জন্য ভালো প্রিফেচ একটি নির্ভরশীলতা, যা পূর্বানুমান এবং যুক্তিসঙ্গতভাবে ব্যাখ্যা করা কঠিন। তবে, Codex-এর মাধ্যমে ভালো ফ্রেমওয়ার্কে বিস্তারিত ট্রেস পাওয়া যাওয়ার ফলে, একটি নির্দিষ্ট আকারের জন্য সেরা প্রিফেচ সহ অপ্টিমাল কার্নেল খুঁজে পাওয়ার জন্য মানব হস্তক্ষেপের প্রয়োজন হতে পারে প্রায় কিছুই না। আমরা মনে করি, এটিই OpenAI-এর DeepSeek R1, Kimi K2.5 এবং GPT-OSS-এর সাথে এতটাই দ্রুত কাজ করার কারণ।

কোর ছোট ম্যাট্রিক্স মাত্রাগুলিও সমর্থন করে, যা (যতটা ছোট তার উপর নির্ভর করে) বিভিন্ন মডেল এবং ব্যাচ মাত্রার উপর আরও সাধারণীকরণ করে, ম্যাট্রিক্স মাত্রা সমন্বয়, প্যাডিং ওভারহেড এবং ব্লকিংয়ের অকার্যকরতার প্রতি কম সংবেদনশীল করে। উদাহরণস্বরূপ, TPU, Trainium এবং Etched চিপগুলির খুব বড় পালসেড অ্যারে রয়েছে, যা ব্লকিংয়ের অকার্যকরতা এড়ানোর জন্য বড় ব্যাচ বা সঠিকভাবে বিভাজ্য মডেল মাত্রা প্রয়োজন।

জালাপেঞ্জোর মাধ্যমে, ওপেনএআই সিস্টেমের স্থির ল্যাটেন্সি দূর করার উপর ফোকাস করছে যাতে প্যারেটো বক্ররেখার সমস্ত অঞ্চলে রুফলাইন পারফরম্যান্সের সম্ভবত কাছাকাছি যাওয়া যায়। তাত্ত্বিকভাবে, এটি বিভিন্ন কাজের বিন্দুতে GPU-এর তুলনায় সুবিধা আনতে পারে:

লো-ল্যাটেন্সি/স্মল-ব্যাচ ইনফারেন্সের উপরের পারফরম্যান্স GPU-এর চেয়ে অনেক ভালো। GPU শুরুর ল্যাটেন্সি, ব্যারিয়ার ল্যাটেন্সি, মেমোরি সিস্টেম ল্যাটেন্সি ইত্যাদি ফিক্সড ওভারহেডের কারণে সীমাবদ্ধ।

বড় পরিমাণ বা দীর্ঘ কনটেক্সটের ক্ষেত্রেও হার্ডওয়্যার রুফলাইনের কাছাকাছি যাওয়ার সম্ভাবনা রয়েছে।

এটি একটি সতর্কবার্তা সহ আসে: যদিও তাত্ত্বিকভাবে একটি সর্বোচ্চ কর্মক্ষমতা থাকে, বাস্তবিক কোরগুলি সেই কর্মক্ষমতা অর্জন করতে আরও কঠিন হতে পারে। তাই, এর পদ্ধতিটি মনে হয়:

সমস্ত ওয়ার্কলোড ফর্ম্যাটের জন্য সর্বোচ্চ পারফরম্যান্স সীমা ডিজাইন করুন

কোডেক্সকে ভারী কাজটি করতে দিন এবং এই সীমার জন্য কার্নেল খুঁজে বার করুন

OpenAI টিম Jalapeño-এ InferenceX ওয়ার্কলোড শুরু করেছে, যার টার্নারাউন্ড সময় অত্যন্ত দ্রুত।

আমরা এই পদ্ধতির প্রতি আশাবাদী।

যদি জালাপেঞ্জো সফল হয়, তবে এটি শক্তিশালী সংকেত প্রকাশ করবে।

প্রোগ্রামিং মডেল এবং পারফেক্ট জেনারেল-পারপাস কম্পাইলারের প্রতি শিল্পের আসক্তি অগ্রগামী এআই মডেল দ্বারা ভাঙ্গা হবে।

OpenAI জালাপেঞ্জো কার্নেল অ্যাসেম্বলি লিখের মতো লিখেছে।

প্রতিটি কোরে হাতে টিউন করা কোড রয়েছে, যার কিছু প্রায় 3000 লাইন।

এছাড়াও সঠিকতা পরীক্ষা এবং কাস্টম স্যানিটাইজার সমর্থন রয়েছে।

প্রাথমিক কোর কাজগুলি মানুষের হস্তক্ষেপ সহ ছিল, পুরোপুরি স্বয়ংক্রিয় নয়।

পরে আরও বড় স্কেলের অভ্যন্তরীণ সংস্করণ কোডেক্সে স্থানান্তরিত হয়।

OpenAI এই সংস্করণটি কর্পোরেট গ্রাহকদের কাছে বিক্রি করার পরিকল্পনা করছে।

অভ্যন্তরীণ সার্ভিস ইঞ্জিনের নাম "Teacup"।

আকর্ষণীয় বিষয় হলো, আগে ওপেনএআই-এর কোনো অভ্যন্তরীণ MLA কোর বাস্তবায়ন ছিল না।

যতক্ষণ না তারা InferenceX ব্যবহার করে DeepSeek-এর বেঞ্চমার্ক নেয়।

কোডেক্স এত দ্রুত কার্যকরী কার্নেল লিখতে পারে এবং কার্নেল ইঞ্জিনিয়ারিং টিমের হস্তক্ষেপ ছাড়াই।

এটি সফটওয়্যার পাইপলাইনের বিকাশ ক্ষমতা প্রদর্শন করে।

OpenAI জালাপেঞ্জোর জন্য Gluon ব্যবহার করে প্রোগ্রামিং করছে।

গ্লুন হল ওপেনএআই-এর কোর প্রোগ্রামিং ভাষা।

গ্লুন ট্রিটনের উপর নির্মিত, যা ট্রিটনের SPMD (সিঙ্গেল প্রোগ্রাম মাল্টিপল ডেটা) প্রোগ্রামিং মডেলকে বজায় রাখে।

কিন্তু এটি নিহিত প্রোগ্রামিং অ্যাবস্ট্রাকশনকে প্রকাশ করে।

উদাহরণস্বরূপ, NVIDIA GPU-এর জন্য, এটি PTX নির্দেশের সাথে ম্যাপ করা API প্রদান করে।

এমএমএ নির্দেশ, টিএমএ নির্দেশ, এবং এমবারিয়ার মেকানিজম ইত্যাদি অন্তর্ভুক্ত।

গ্লুঅন দ্বারা প্রদানকৃত সবচেয়ে অনন্য অ্যাবস্ট্রাকশন হল লেআউট।

সাধারণত, লেআউট হার্ডওয়্যার সংস্থান এবং টেনসর উপাদানের মধ্যে ম্যাপিং সংজ্ঞায়িত করে।

যেমন ওয়ার্প 9-এর ৫ম রেজিস্টার, যা টেনসর উপাদানের ৬ষ্ঠ সারি এবং ৭ম কলামের সাথে মিলে যায়।

গ্লুনের লেআউট অ্যাবস্ট্রাকশন লিনিয়ার লেআউটের উপর ভিত্তি করে।

এটি ওপেনএআই দ্বারা উদ্ভাবিত একটি লেআউট বীজগণিত।

লিনিয়ার লেআউটগুলি লেআউট কী তা গাণিতিকভাবে ফর্মালাইজ করে।

এবং অপারেশন লেআউটের জন্য টুল প্রদান করুন।

এটি প্রমাণযোগ্য সঠিক লেআউট রূপান্তরের মতো অনেক ফাংশনকে সমর্থন করে।

সর্বোত্তম মেমোরি সুইজলিংও রয়েছে।

জালাপেঞ্জোর প্রোগ্রামিং মডেলে, প্রতিটি Gluon প্রোগ্রাম একটি স্থায়ী থ্রেডে ম্যাপ হয়।

আমরা মনে করি এটি ইঙ্গিত করে যে Jalapeño টেকসই কার্নেল প্রোগ্রামিং প্যাটার্নের জন্য উপযুক্ত।

প্রতিটি প্রোগ্রাম একাধিক টাইলে কাজ করে, যেখানে কাজ বণ্টন করে প্রোগ্রামার, হার্ডওয়্যার স্কিডিউলার নয়।

OpenAI টেনসরইনফো উল্লেখ করেছে।

এটি একটি স্পষ্টভাবে কোডিং করা লেআউটের বিমূর্তি।

এটি জালাপেঞ্জোর জন্য ডিজাইন করা একটি লেআউট সেট হতে পারে।

এটি লিনিয়ার লেআউট দ্বারা চালিত হবে।

শেষ করে, প্রতিটি কোর ডেটা প্রিফেচ এবং ডিকপলড আউট-অফ-অর্ডার ইউনিট প্রদান করে।

উদাহরণস্বরূপ, ব্যবহারকারী প্রিফেট ডেটা অপেক্ষা করার জন্য প্রোগ্রাম করতে পারেন।

এই ডেটা সেমাফোর দ্বারা লক করা হয়েছে।

একটি বিচিত্র পরিস্থিতি হলো, বর্তমানে GPT 5.6 Sol এর মতো OpenAI মডেলগুলি NVIDIA GPU-এ চলছে।

এগুলি চিপ ডিজাইনের জন্য ব্যবহার করা হয়, যা CUDA-এর প্রতিরক্ষা বেষ্টনীকে বাস্তবিক হুমকি দেয়।

NVIDIA-এর নিজস্ব GPU গুলি বর্তমানে সম্ভাব্য উত্তরাধিকারীদের প্রতি বাস্তবসময়ে সহায়তা করছে।

সময়ের সাথে তুলনা করে, আমরা জালাপেঞ্ঞোর ডেভেলপমেন্ট গতি দেখতে পাই।

দুই সপ্তাহের কম সময়ের মধ্যে, কিছু ইন্টারঅ্যাকশন স্কেনারিওর থ্রুপুট ২ গুণের বেশি বৃদ্ধি পেয়েছে।

জালাপেঞ্জো টিম থেকে আমরা যে প্রতিটি tarball পাই, তার প্রতিটিতেই অসাধারণ বিশ্ব লুকিয়ে আছে।

কেবল কোর পারফরম্যান্স উন্নত হয়নি, জালাপেঞ্জো দল 8 দিনের মধ্যে TP32 সক্রিয় করেছে।

আগের TP8 কনফিগারেশনের ভিত্তিতে, একক সিস্টেমের বাইরে প্রসারিত করে বড় মডেল চালানোর জন্য পূর্ণাঙ্গ র্যাক-লেভেল কনফিগারেশন বাস্তবায়ন করুন।

এই ডেভেলপমেন্ট গতি সত্যিই অসাধারণ।

বাস্তব হার্ডওয়্যারে চালানোর আগে পারফরম্যান্স যাচাইয়ের জন্য OpenAI-এর একটি সিমুলেটর আছে যার নাম "chilisim"।

এটি নির্দিষ্ট প্রস্থের ট্রেস বাস ব্যবহার করে বাস্তব হার্ডওয়্যারের 5% এর মধ্যে সঠিকতা প্রদান করে।

A0-এ ট্র্যাকিং ক্ষমতা সীমিত, কিন্তু B0-এ উল্লেখযোগ্যভাবে উন্নতি হয়েছে।

এটি A0 সিলিকন ওয়াফার বাস্তব চলমান ডেটার কারণে সম্ভব হয়েছে।

ইঞ্জিনিয়ার কোডেক্স সিএলআই ব্যবহার করে অন্তর্নিহিত মডেল চালানোর প্রদর্শন করেছেন।

এটির উপনাম "Raiku" বা "5.3 Codex Spark", TPOT 1.2ms।

টিমটি কোডেক দ্বারা লেখা একটি ডেমো সরাসরি চিপে চালানোর প্রদর্শনও করেছে।

36 FPS ডুম এবং FP32 ফ্লুইড ডায়নামিক্স সিমুলেশন সহ।

এছাড়াও "লিকুইড লাইট" মাউস ড্র্যাগ ভিজুয়ালাইজেশন।

মডেল সম্পর্কে, OpenAI-এর অভ্যন্তরীণ megakernel সমাধানের উপনাম "gigakernel"।

এটি একটি একক মেগাকার্নেলের উপর ভিত্তি করে ডিভাইসে লুপ করে CPU ওভারহেড এবং স্টার্টআপ সময় কমায়।

টিম পরীক্ষার সময় কৌশল গণনা আরও এগিয়ে নিচ্ছে।

100 লাখ রোলআউট ব্যবহার সমন্বয় করার বিষয়ে অভ্যন্তরীণ বিশেষ মনোযোগ।

ডিস্যাগ করা উচিত কি না, এটাই প্রশ্ন

আমরা আগে উল্লেখ করেছিলাম যে, ওপেনএআই এই চিপগুলিতে প্রিফিল-ডিকোড বিচ্ছিন্নতা ব্যবহার করেনি।

এটি আমাদের আশ্চর্য করেছে, কারণ NVIDIA এবং AMD GPU পারফরম্যান্স PDD থেকে উল্লেখযোগ্যভাবে লাভ করেছে।

এমনকি একই ধরনের হার্ডওয়্যারেও।

আসুন জালাপেঞ্জো দল এটি কেন করেছে তা গভীরভাবে বিশ্লেষণ করি।

যখন ওয়ার্কলোড স্থির থাকে, তখন prefill-decode বিচ্ছিন্নতা আকর্ষণীয় মনে হয়।

Prefill এবং decode হার্ডওয়্যারের উপর ভিন্ন চাপ ডালে।

প্রতিটি পর্যায়কে আলাদা টিউন করা পুলে বরাদ্দ করুন, যা নির্বাচিত ইনপুট-আউটপুট অনুপাতে দক্ষতা বাড়ায়।

কিন্তু উৎপাদন ট্রাফিক এই অনুপাত বজায় রাখবে না।

ইনপুট আউটপুট সিকোয়েন্স দৈর্ঘ্য, সমান্তরালতা, ক্যাশ হিট রেট, অনুমান গ্রহণ হার এবং ল্যাটেন্সি লক্ষ্য সম্পূর্ণ দিন জুড়ে পরিবর্তনশীল।

যখন ডিভাইসটিকে prefill এবং decode পুলে বিভক্ত করা হয়, তখন prefill-এর অতিরিক্ত চাহিদা decode চিপগুলিকে অক্রিয় রাখে এবং অনুরোধগুলি কত্ত্বকে প্রতীক্ষা করে।

কিন্তু ডিকোডের চাহিদা বেশি হলে বিপরীত হয়।

অপারেটরদের সঠিক বিভাজন পূর্বানুমান করতে হবে এবং উভয় পাশের জন্য ব্যাকআপ ক্ষমতা রাখতে হবে।

একটি আদর্শ অনুপাত যা সময়ের সাথে পরিবর্তিত হচ্ছে, তাকে পুনর্ভার করুন।

একীকৃত সিস্টেমে, কিছু সম্পদ নির্দিষ্ট পর্যায়ে অপর্যাপ্তভাবে ব্যবহৃত হতে পারে।

তবে প্রতিটি ডিভাইস পরবর্তী অনুরোধ পরিষেবা দেওয়ার জন্য ব্যবহার করা যায়।

একটি বিচ্ছিন্ন সিস্টেমে, একটি পুরো চিপ শুধুমাত্র ভুল পুলের অংশ হওয়ার কারণে অকার্যকর হয়ে যেতে পারে।

স্থানীয় ব্যবহার ভালো দেখাচ্ছে, কিন্তু বিশ্বব্যাপী ব্যবহার খারাপ হতে পারে।

বিচ্ছিন্নতা স্থানীয়তাকেও নষ্ট করে দেয়।

prefill worker বড় KV cache তৈরি করে যা decode worker তাত্ক্ষণিকভাবে প্রয়োজন।

অবস্থা প্রক্রিয়াকরণ চালিয়ে যাওয়ার জন্য এটি নেটওয়ার্কের মধ্যে প্রেরণ করতে হবে।

এটি ব্যান্ডউইথ খরচ, সিঙ্ক্রোনাইজেশন, কিউ এবং অন্য একটি ব্যর্থতার ক্ষেত্র বাড়ায়।

কারণ KV ক্যাশে বাড়ছে, তাই খরচ ইনপুট সিকোয়েন্সের দৈর্ঘ্যের সাথে বাড়ছে।

তবে, KV মোবাইল করা এড়ানো মূলত শক্তি খরচ এবং ল্যাটেন্সি অপ্টিমাইজেশনের জন্য।

কিছু KV সরানোর মাধ্যমে হার্ডওয়্যার ব্যবহারের দক্ষতা বাড়ানো যায়, যার বিনিময়ে শক্তি খরচ এবং একক অনুরোধের দেরি বাড়ে।

একটি বিনিময়যোগ্য ক্লাস্টার দ্বারা লেটেন্সি-সংবেদনশীল অনুরোধ এবং থ্রুপুট-উন্মুখী ব্যাচের মধ্যে ক্ষমতা স্থানান্তরিত হতে পারে।

ফিক্সড স্প্লিট ট্রাফিক কম্বিনেশন পরিবর্তনের সময় হার্ডওয়্যারকে অব্যবহৃত রাখে।

এছাড়াও, কনটেক্সট দৈর্ঘ্য পরিবর্তন করে অ্যাটেনশন এবং FFN কাজের মধ্যে ভারসাম্য।

যেকোনো স্থির হার্ডওয়্যার অনুপাত শুধুমাত্র ডিজাইন পয়েন্টের কাছাকাছি দক্ষ।

ঠিক একই সীমাবদ্ধতা স্পেকুলেটিভ ডিকোডিং-এর জন্যও প্রযোজ্য। ড্রাফট মডেলটিকে অত্যন্ত কম ল্যাটেন্সিতে ভেরিফায়ারকে ক্যান্ডিডেট টোকেন প্রদান করতে হবে। দুটিকে আলাদা বিশেষায়িত পুলে রাখা হলে, ঘনিষ্ঠভাবে সংযুক্ত ডিকোডিং লুপটি একটি বিতরণকৃত প্রোটোকলে পরিণত হয়ে যায়। অতিরিক্ত যোগাযোগ এবং সমন্বয় ড্রাফট দ্বারা সঞ্চয়কৃত ল্যাটেন্সি খেয়ে ফেলতে পারে। শুধুমাত্র দুটি মডেলকে একই ডিভাইস এবং কম ল্যাটেন্সি স্ট্রাকচারে রাখলেই স্পেকুলেটিভ ডিকোডিংকে যৌক্তিক করে তোলা সম্ভব।

তবে, যেখানে চাহিদা যথেষ্ট বড়, স্থিতিশীল এবং পূর্বানুমানযোগ্য, সেখানে ডিকাপ্লিং এখনও বিজয়ী। বিশেষ করে যখন প্রাচীন GPU-এর জন্য ভালো থ্রুপুট অর্জনের জন্য বড় ব্যাচ এবং পর্যায়ক্রমিক ব্যাচিং প্রয়োজন হয়। কিন্তু এটি বিনামূল্যের লাঞ্চ নয়।

জাপানি থেকে ভারতীয় (সামান্য মসুরা থেকে অত্যন্ত মসুরা): কাতসু, ভিন্দালু এবং চানা—এই কারি খাবারগুলি কীভাবে র‍্যাক সিস্টেম গঠন করে?

জালাপেঞ্জো সিস্টেমটি র্যাক ইউনিট লেভেলে CPU হোস্ট র্যাক এবং ASIC র্যাক দ্বারা গঠিত। হোস্ট র্যাকটিতে ১৬টি “কাতসু” নামের হোস্ট CPU ট্রে অন্তর্ভুক্ত রয়েছে। প্রতিটি কাতসু ডানদিকের ১৬টি “ভিন্দালু” নামের ASIC ট্রের মধ্যে একটির সাথে মিলে যায়। প্রতিটি হোস্টে দুটি টুরিন-ক্লাস AMD EPYC CPU, ১.৫TB DRAM, 2x E1.S এবং 2x M.2 SSD রয়েছে। প্রতিটি ট্রেতে ৪০০G (2x200G) ফ্রন্টএন্ড নেটওয়ার্কও রয়েছে। প্রতিটি কাতসু ট্রে ৮টি বাইরের PCIe DAC কেবলের মাধ্যমে প্রতিটি ভিন্দালু ট্রের সাথে সংযুক্ত। এই কেবলগুলি র্যাকের সামনের দিকে অনুভূমিকভাবে সজ্জিত। সিস্টেম-লেভেলের ডিজাইনটি Celestica-এর সাথে সহযোগিতায় তৈরি করা হয়েছে।

ASIC র্যাকটি 16টি Vindaloo ট্রে এবং 8টি এক্সটেনশন সুইচ ট্রে (6টি লোকাল + 2টি গ্লোবাল) দিয়ে গঠিত, যার নাম “Chana”। প্রতিটি Vindaloo ট্রেতে 8টি Jalapeño ASIC রয়েছে, যার ফলে প্রতিটি র্যাকে মোট 128টি Jalapeño ASIC থাকে। ASICগুলি প্রতিটি Chana সুইচ ট্রের সাথে তামা ক্যাবল ব্যাকপ্লেনের মাধ্যমে সংযুক্ত, যা Nvidia-এর Oberon-এর মতো। এক্সটেনশন টপোলজিটি লোকাল ডোমেইন এবং গ্লোবাল ডোমেইনে বিভক্ত। লোকাল ডোমেইনটি র্যাকের মধ্যে 128টি ASICকে কভার করে। গ্লোবাল ডোমেইনটি সর্বোচ্চ 16টি র্যাক বা 2,048টি ASICকে সংযুক্ত করে। আমরা নিচে ব্যান্ডউইথ এবং টপোলজি সম্পর্কে আরও বিস্তারিতভাবে ব্যাখ্যা করব।

সাইড-মাউন্টেড হোস্ট র্যাকের বিদ্যুৎ খরচ প্রায় 50kW (উৎপাদনে 31kW), ASIC র্যাক 130kW খরচ করে। সম্পূর্ণ ডুয়েল র্যাক সিস্টেমের বিদ্যুৎ খরচ প্রায় 160kW। শক্তি খরচের দিক থেকে, এটি প্রায় একটি ডুয়েল-উইড GB300 র্যাকের সমান।

OpenAI একক এক্সটেনশন নেটওয়ার্কে সর্বোচ্চ 2,048টি Jalapeño XPU কে সংযুক্ত করতে পারে। এক্সটেনশন নেটওয়ার্কটি দুটি ডোমেইন দিয়ে গঠিত। লোকাল ডোমেইনটি ব্যাকপ্লেনের মাধ্যমে একটি র্যাকের সমস্ত 128টি XPU কে সংযুক্ত করে। গ্লোবাল ডোমেইনটি তামা ক্যাবল এবং অপটিক্যাল ইন্টারকনেক্টের মিশ্রণ ব্যবহার করে 16টি র্যাকের 2,048টি XPU কে সংযুক্ত করে। প্রতিটি র্যাকে 8টি Chana সুইচ ট্রে রয়েছে। স্থানীয় ডোমেইনের জন্য মধ্যবর্তী 6টি Chana সুইচ ব্যবহার করা হয়। প্রতিটির সঙ্গে 102.4T Tomahawk 6 সুইচ ASIC রয়েছে। গ্লোবাল ডোমেইনের জন্য শীর্ষ এবং নিচের 2টি Chana সুইচ ব্যবহার করা হয়। আমরা ধারণা করি এগুলি 2x 102.4T Tomahawk 6 সুইচ, প্রতিটি সুইচ ট্রেতে সর্বোচ্চ 204.8T।

স্থানীয় পরিসরে, প্রতিটি XPU-এ 128টি Jalapeño চিপ রয়েছে, যার একমুখী ব্যান্ডউইথ 4.8Tb/s। এগুলি 6টি 102.4Tb/s Tomahawk 6 ASIC-এর সাথে ফুল-টু-ফুল পদ্ধতিতে সংযুক্ত। এটি প্রতিটি XPU-এর জন্য 48 জোড়া ডিফারেনশিয়াল পেয়ার (DP) মেল-এন্ড-মেয়ার কানেক্টরের সমান। মোট প্রতি র্যাকে 6,144 জোড়া DP প্যাসিভ কপার ক্যাবল স্থানীয় বিস্তারের জন্য ব্যবহৃত হয়।

গ্লোবাল ডোমেইনে, 16টি র্যাকে 2,048টি XPU কপার ব্যাকপ্লেন, ইলেকট্রিক্যাল 204.8T TH6 সুইচ, 1.6T অপটিক্যাল মডিউল এবং অপটিক্যাল সুইচের সংমিশ্রণ দ্বারা সংযুক্ত। প্রতিটি XPU-এর গ্লোবাল লিংকের একমুখী ব্যান্ডউইথ 1.6Tb/s। অর্থাৎ, XPU এবং গ্লোবাল সুইচের মধ্যে ব্যাকপ্লেনের জন্য প্রতিটি XPU-এ 16টি ডিফারেনশিয়াল পেয়ার (DP) মেল-মহিলা কানেক্টর রয়েছে। প্রতিটি গ্লোবাল সুইচ ট্রেতে 2টি ASIC রয়েছে, যার আউটপুট ব্যান্ডউইথ ব্যাকপ্লেন এবং ফ্রন্টপ্যান অপটিক্সের মধ্যে বণ্টিত হয়।

স্থানীয় এবং বিশ্বব্যাপী ডোমেইনের মধ্যে, প্রতিটি XPU-এর জন্য 64 জোড়া DP ব্যাকপ্লেন কানেক্টর রয়েছে। মোট 8,192 জোড়া DP প্যাসিভ কপার ক্যাবল প্রতি র্যাকে।

গ্লোবাল ডোমেইনটি শুধুমাত্র রেল আর্কিটেকচার ব্যবহার করে, যা 8টি রেল দ্বারা গঠিত। আমরা ধারণা করি যে OpenAI প্রতিটি র্যাকে ইনস্টল করা অপটিক্যাল সুইচ (OCS) ব্যবহার করে গ্লোবাল ডোমেইনের অপটিক্যাল লিংকগুলি রাউট করে। প্রতিটি XPU-এর 1.6Tb/s গ্লোবাল ব্যান্ডউইথ কপার ব্যাকপ্লেনের মাধ্যমে গ্লোবাল সুইচ ট্রেতে পৌঁছায়। তারপর সুইচ থেকে ফ্রন্টপ্যানের 1.6T অপটিক্যাল মডিউলের মাধ্যমে বেরিয়ে যায়। এটি প্রথমে প্যাসিভ অপটিক্যাল সুইচের মধ্যে প্রবেশ করে, তারপর র্যাক থেকে বেরিয়ে আসে। এটি 2,048টি XPU-এর স্কেলযোগ্যতা প্রদান করে, যা 16টি র্যাক, প্রতিটি 128টি XPU-এর সমন্বয়ে গঠিত।

যেহেতু বিস্তৃত নেটওয়ার্ক মোট সিস্টেম খরচের প্রায় 10% এর মতো শুধুমাত্র অংশ গ্রহণ করে, এই নমনীয়তা ভবিষ্যতের 10 ট্রিলিয়ন থেকে 20 ট্রিলিয়ন প্যারামিটার মডেল বা 2 মিলিয়ন থেকে 4 মিলিয়ন টোকেন কনটেক্সট উইন্ডোর জন্য মূল্যবান বিকল্প প্রদান করে। ডিপ্লয়মেন্টের ক্ষেত্রে, OpenAI neocloud-এর সাথে কাজ করে। এটি 1 মাস আগে ডেটা সেন্টার পার্টনারদের সাথে বিশ্বস্ততা ডেটা সংগ্রহ করেছিল, একইসাথে ডক থেকে র‍্যাকের ডিপ্লয়মেন্ট সময়কে অপ্টিমাইজ করেছিল।

পরবর্তী পদক্ষে

পরবর্তীতে, আমরা জালাপেঞ্জোর ভবিষ্যৎ নিয়ে আলোচনা করব, যার প্রথম প্রোডাকশন টোকেন আসন্ন। পরবর্তী লক্ষ্য 100MW, প্রধান বাধা হার্ডওয়্যারে: তারা কতটা উৎপাদন করতে পারবে, ডেটা সেন্টারগুলি কতটা ভালোভাবে স্থাপন ও পরিচালনা করতে পারবে, মনিটরিং এবং টেকসইতা প্রতিষ্ঠা করতে কীভাবে সামনে এগিয়ে যাবে। সফটওয়্যারটি প্রমাণিত, এবং অভ্যন্তরীণ মডেলগুলির সাথে, যেকোনো সফটওয়্যার-প্রথম-মুভ সুবিধা সহজেই অনুসরণ করা যায়। পে-ওয়ালের পর, আমরা NVIDIA, AMD, Cerebras-এর মতো চিপ কোম্পানিগুলির উপর প্রভাব নিয়ে আলোচনা করব, যারা ভবিষ্যতের বছরগুলিতে OpenAI-এর সাথে চুক্তি করেছে।

আমরা অ্যাক্সেলারেটর মডেলে পরবর্তী প্রজন্মের চিপের উৎপাদন, পরিমাণ এবং সময়সূচীও অন্তর্ভুক্ত করেছি।

পরবর্তী অংশটি পেইড কনটেন্ট, অনুমতির সমস্যার কারণে এটি আরও বেশি অনুবাদ করা হয়নি, তবে আগের অংশে ইন্টেলের চিপগুলির চ্যালেঞ্জের বিষয়ে পর্যাপ্ত তথ্য উপস্থাপন করা হয়েছে। চিপ সেক্টর এবং নভেডিয়ার শেয়ার মূল্যের দিকে মনোযোগ দেওয়া ব্যক্তিদের জন্য, এই তথ্যগুলি নতুন এবং শক্তিশালী রেফারেন্স প্রদান করবে।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।