GPT-6 Astra-এর প্রকাশিত তথ্য অনুযায়ী, এটি প্রায় 100,000টি Grace Blackwell GPU ব্যবহার করে প্রশিক্ষিত হয়েছে, যা অগ্রণী মডেল প্রতিযোগিতাকে অতি-বৃহৎ ক্লাস্টার যুগে নিয়ে গেছে।লেখক, উৎস: ME News

TL;DR:
- GPT-6 Astra-এর প্রকাশিত তথ্য অনুযায়ী, এটি প্রায় 100,000টি Grace Blackwell GPU ব্যবহার করে প্রশিক্ষিত হয়েছে, যা অগ্রণী মডেল প্রতিযোগিতাকে অতি-বৃহৎ ক্লাস্টার যুগে নিয়ে গেছে।
- চীনের শীর্ষ মডেল কোম্পানিগুলির বড় পরিসরের ক্যালকুলেশন ক্ষমতা নেই না, তবে প্রকাশিত তথ্য অনুযায়ী, উন্নত GPU প্রজন্ম এবং একক কেন্দ্রীয় বিন্যাসের পরিসরে এখনও স্পষ্ট ব্যবধান রয়েছে।
- বাইটডান্স, কিমি, ডিপসিক ইত্যাদি কোম্পানিগুলির ক্যালকুলেশন বিন্যাস বাড়ছে, তবে বর্তমানে এগুলি বেশিরভাগই Hopper আর্কিটেকচার বা দেশীয় বিকল্পগুলিতে কেন্দ্রীভূত, Blackwell ক্লাস ক্লাস্টারের তুলনায় এখনও দূরে।
- AI প্রতিযোগিতার মূল বিষয় এখন “GPU আছে কি না” থেকে পরিবর্তিত হয়েছে “সর্বশেষ প্রজন্মের GPU পাওয়া যাচ্ছে কি না এবং হাজার হাজার এমনকি লক্ষ লক্ষ চিপকে কার্যকরভাবে সংগঠিত করা যাচ্ছে কি না”।
- যদিও ব্ল্যাকওয়েল নভেডিয়ার সর্বশেষ আর্কিটেকচার নয়, রুবিনের প্রশিক্ষণ খরচ আরও কমানোর প্রবণতা বোঝায় যে এগিয়ে থাকার ফারাক সম্ভবত অবকাঠামোর ক্ষমতার দিকেই কেন্দ্রীভূত হবে।
10 লক্ষ ব্ল্যাকওয়েলের পিছনে, বড় মডেল প্রতিযোগিতা ক্যালকুলেশন ইনফ্রাস্ট্রাকচার যুগে প্রবেশ করেছে
হুয়াং রেনক্সন জি পি টি-6 আস্ট্রা প্রশিক্ষণের স্কেল প্রকাশ করার সময়, বাইরের মনোযোগ শুধুমাত্র “10 হাজার জিপিইউ” এই সংখ্যাটির উপর নয়, বরং এই সংখ্যার পিছনে একটি নতুন এআই প্রতিযোগিতার প্যারাডাইমকে নির্দেশ করে।
গত কয়েক বছর ধরে, বড় মডেলের প্রতিযোগিতা প্রায়শই অ্যালগরিদম, ডেটা এবং ইঞ্জিনিয়ারিং ক্ষমতার প্রতিযোগিতা হিসাবে বুঝা হয়েছে। মডেল আর্কিটেকচারের উদ্ভাবন, প্রশিক্ষণ পদ্ধতির উন্নতি, এবং অনুমান দক্ষতা বৃদ্ধি প্রকৃতপক্ষে AI পণ্যের চূড়ান্ত ক্ষমতা নির্ধারণ করে। কিন্তু 2026 সালের পর থেকে, একটি ক্রমাগতভাবে স্পষ্ট প্রবণতা গড়ে উঠছে: যখন মডেলের আকার ধারাবাহিকভাবে বৃদ্ধি পায়, তখন অবকাঠামোগত ক্ষমতা নিজেই প্রযুক্তির সীমানা নির্ধারণের একটি গুরুত্বপূর্ণ কারণ হয়ে উঠছে।
হুয়াং রেনক্সনের প্রকাশিত তথ্য অনুযায়ী, GPT-6 Astra ট্রেনিংয়ের জন্য প্রায় 10 লক্ষেরও বেশি Grace Blackwell GPU ব্যবহার করা হয়েছে এবং এগুলি NVLink72 দ্বারা উচ্চগতির ইন্টারকানেকশন ক্লাস্টারে সংযুক্ত করা হয়েছে। তিনি আরও বলেছেন, পরবর্তী পর্যায়ে 40 লক্ষ GPU চালু হবে, কিন্তু নির্দিষ্ট মডেল এবং মালিকানা প্রকাশ করেননি।
যেকোনো পরবর্তী বাস্তবায়ন বিস্তারিতের উপর নির্ভর করে না, এই তথ্যটি খুব স্পষ্ট সংকেত দেয়: সবচেয়ে উন্নত মডেলের প্রশিক্ষণ, গতকালের কয়েক দশক ট্রিলিয়ন প্যারামিটার, হাজার হাজার GPU-এর প্রতিযোগিতা থেকে সহস্র বা দশহাজার স্তরের উন্নত GPU ক্লাস্টারের মধ্যে প্রতিযোগিতায় রূপান্তরিত হচ্ছে।
এখানে কী গুরুত্বপূর্ণ তা শুধুমাত্র পরিমাণ নয়।
শুধু জিপিইউ সংখ্যার তুলনা করলে, চীনা কোম্পানিগুলি বড় পরিমাণে ক্যালকুলেশন সম্পদ বহন করে না। প্রকৃত পার্থক্য হলো, সর্বশেষ প্রজন্মের হাই-পারফরম্যান্স জিপিইউ পাওয়ার ক্ষমতা এবং এই জিপিইউগুলিকে একই ট্রেনিং টাস্কে দক্ষতার সাথে সমন্বিতভাবে কাজে লাগানোর ক্ষমতা।
বড় মডেলের জন্য, একটি একক GPU-এর শীর্ষ কার্যক্ষমতা শুধুমাত্র একটি ভিত্তি। একটি বড় মডেল প্রশিক্ষণের জন্য, অসংখ্য GPU-এর মধ্যে প্যারামিটার এবং ডেটা নিয়মিতভাবে আদান-প্রদান প্রয়োজন। যদি ইন্টারকানেকশনের দক্ষতা অপর্যাপ্ত হয়, তবে অসংখ্য চিপ থাকলেও কার্যকরী কম্পিউটিং ক্ষমতা গঠন করা সম্ভব হবে না।
অতএব, এআই অবকাঠামোর প্রতিযোগিতা মূলত “কতগুলি কার্ড কেনা” থেকে “কী ধরনের কম্পিউটিং সিস্টেম তৈরি করা”-এ উন্নীত হয়েছে।
চীনের শীর্ষ মডেল কোম্পানিগুলির ক্যালকুলেশন বিন্যাস, ব্ল্যাকওয়েল যুগের সাথে প্রজন্মগত পার্থক্য রয়েছে
বর্তমানে প্রকাশিত তথ্য অনুসারে, চীনের শীর্ষ মডেল কোম্পানিগুলির ক্যালকুলেশন ক্ষমতা দ্রুত বৃদ্ধি পাচ্ছে, তবে GPT-6 Astra-এর প্রতিনিধিত্বকারী Blackwell-স্তরের ট্রেনিং ক্লাস্টারের সাথে তুলনায় এখনও স্পষ্ট ব্যবধান রয়েছে।
বাই트ダンس হল দেশীয় প্রকাশিত ক্যালকুলেশন ক্ষমতা বিনিয়োগের মধ্যে একটি যা আন্তর্জাতিক শীর্ষ স্তরের কাছাকাছি। এই বছর বাইটড্যান্স মালয়েশিয়ার মাধ্যমে প্রায় 36,000টি B200 GPU সংযুক্ত করেছে। এই চিপগুলি নভেডিয়ার ব্ল্যাকওয়েল আর্কিটেকচারের অংশ, যা Astra-এর ব্যবহৃত GB200-এর সাথে একই প্রজন্মের।
তবে মনে রাখতে হবে যে এই ব্যাচের B200 বিদেশে স্থাপন করা হয়েছে। বাইটডান্স চীনের ভিতরে AI অবকাঠামোর প্রকাশ্যে প্রধানত Hopper আর্কিটেকচারের চীন-বিশেষ সংস্করণ H20 এবং আগে প্রাপ্ত H800 এবং অন্যান্য চিপগুলি ব্যবহার করে।
এটি শুধুমাত্র পরিমাণগত পার্থক্য নয়, বরং সরবরাহ শৃঙ্খলা এবং বাস্তবায়ন পরিবেশের পার্থক্যকে প্রতিফলিত করে।
Blackwell, Hopper-এর তুলনায় গণনা ক্ষমতা, ভিডিও মেমোরি এবং ইন্টারকানেকশন ক্ষমতায় উন্নতি করেছে। বিশেষ করে GB200, এটি শুধুমাত্র একটি GPU নয়, বরং Grace CPU এবং Blackwell GPU-কে একত্রিত করে, NVL72 সিস্টেমের মাধ্যমে 72টি GPU-কে একই হাই-স্পিড ইন্টারকানেকশন ডোমেইনে সংযুক্ত করেছে।
বড় মডেল ট্রেনিংয়ের জন্য, এই সিস্টেম-লেভেল ডিজাইনের গুরুত্ব বাড়ছে। কারণ মডেলের আকার যত বড় হয়, GPU-এর মধ্যে যোগাযোগের অনুপাত তত বেশি হয়, এবং চিপগুলির মধ্যে কার্যকরভাবে সমন্বয় হওয়া ট্রেনিং দক্ষতাকে সরাসরি প্রভাবিত করে।
কিমির পিছনের মুন অফ দ্য ডার্ক সাইডকেও আলিবাবা থেকে প্রায় ২০,০০০টি হপার GPU পাওয়ার দাবি করা হয়েছে। ব্লুমবার্গ সংবাদের উদ্ধৃতি দিয়ে বলেছে যে মডেলটি H200, কিন্তু আলিবাবা H200 মডেলের দাবি অস্বীকার করেছে।
যদি H200 এর ভিত্তিতে বিবেচনা করা হয়, তবে এটি এখনও পুরনো Hopper আর্কিটেকচারের অংশ, যেখানে B200 ইতিমধ্যে Blackwell যুগে প্রবেশ করেছে। এদের মধ্যে শুধুমাত্র পুরনো ও নতুনের প্রতিস্থাপনের সম্পর্ক নয়, বরং এগুলি AI ইনফ্রাস্ট্রাকচারের বিভিন্ন পর্যায়ের ক্ষমতা প্রতিনিধিত্ব করে।
ডিপসিকের পরিস্থিতি আরও বিশেষ।
2025 এর শুরুতে ডিপসিক উচ্চ দক্ষতাসম্পন্ন মডেলের মাধ্যমে বিশ্বব্যাপী মনোযোগ আকর্ষণ করে, যার প্রযুক্তি পথ প্রমাণ করে যে অ্যালগরিদম অপ্টিমাইজেশন এবং ইঞ্জিনিয়ারিং দক্ষতা কিছুটা কম্পিউটেশনাল চাহিদা কমাতে পারে। তবে প্রকাশিত তথ্যের ভিত্তিতে, কোম্পানিটি V4-এর সম্পূর্ণ ট্রেনিং হার্ডওয়্যার কনফিগারেশন প্রকাশ করেনি।
প্রবাহিত লিয়াং উয়েনফেং বিনিয়োগকারী আলোচনার ট্রান্সক্রিপ্ট অনুসারে, কোম্পানির মে মাসে প্রায় ২০,০০০টি H-সমতুল্য ক্যালকুলেশন ক্ষমতা ছিল, যার বেশিরভাগই সাম্প্রতিক আগমন; ভবিষ্যতের ক্রয় "মূলত নভেডিয়া" হবে। হুয়াওয়ে DeepSeek-এর জন্য ৯৫০ ক্ষমতা প্রদান করেছে, যা প্রায় ১৬,০০০টি কার্ড। লিয়াং উয়েনফেং বলেছেন, এই দেশীয় কার্ডগুলি প্রায় ৪,০০০টি Nvidia B-সিরিজের সমতুল্য, যা বর্তমান প্রজন্মের মডেল ট্রেনিংয়ের জন্য পর্যাপ্ত।
এই তথ্যগুলি একটি বাস্তবতা প্রকাশ করে: যদিও চীনা কোম্পানিগুলির প্রচুর পরিমাণে AI ক্যালকুলেশন ক্ষমতা রয়েছে, তবুও একটি প্রশিক্ষণ কাজে 10 হাজারটি একই প্রজন্মের উন্নত GPU একসাথে ব্যবহার করার জন্য এখনও পরিসরের ব্যবধান রয়েছে।
চীনের এআই কম্পিউটিং ক্ষমতার প্রকৃত দুর্বলতা হল চিপ না থাকা নয়, বরং উন্নত ক্লাস্টার ক্ষমতা অভাব।
চীনের এআই ক্যালকুলেশন ক্ষমতা নিয়ে আলোচনা করার সময় দুটি চরমে পড়া সহজ।
একটি মতামত অনুসারে, চীনে উন্নত এআই চিপের পুরোপুরি অভাব রয়েছে, তাই এটি প্রতিযোগিতায় অংশ নিতে পারে না; অন্য একটি মতামত অনুসারে, যতক্ষণ দেশীয় চিপের সংখ্যা বৃদ্ধি পাচ্ছে, ততক্ষণ নভেডিয়াকে দ্রুত অনুসরণ করা সম্ভব।
বাস্তবে, পরিস্থিতি আরও জটিল।
AI ট্রেনিং ক্ষমতা বিভিন্ন ধাপের সমন্বয়ে নির্ধারিত হয়, যার মধ্যে চিপের পারফরম্যান্স, অ্যাডভান্সড প্রসেস, গ্রাফিক্স মেমোরি ক্ষমতা, হাই-স্পিড ইন্টারকানেকশন, সার্ভার ডিজাইন, ডেটা সেন্টারের বিদ্যুৎ সরবরাহ, সফটওয়্যার ইকোসিস্টেম এবং বড় পরিসরের স্কেলিং ক্ষমতা অন্তর্ভুক্ত।
GPU এর মধ্যে সবচেয়ে গুরুত্বপূর্ণ অংশ, কিন্তু সবকিছু নয়।
নভেডিয়ার দীর্ঘমেয়াদী সুবিধা শুধুমাত্র GPU হার্ডওয়্যার থেকেই আসে না, বরং CUDA ইকোসিস্টেম, নেটওয়ার্ক ইন্টারকানেকশন প্রযুক্তি, সার্ভার সমাধান এবং ক্লাউড কম্পিউটিং ফার্মগুলির সাথে গঠিত সম্পূর্ণ ব্যবস্থা থেকেও আসে।
ব্ল্যাকওয়েল যুগে, এই সিস্টেমের সুবিধা আরও বাড়িয়ে দেওয়া হয়।
যখন একটি মডেল ট্রেনিংয়ের জন্য ১০ লাখটি GPU প্রয়োজন হয়, তখন সমস্যাটি কেবল কয়েক লাখ চিপ কিনতে সমস্যা নয়, বরং একটি স্থিতিশীলভাবে কাজ করার জন্য একটি বড় কম্পিউটিং ফ্যাক্টরি নির্মাণ করা।
এটিই কারণ যে, পাবলিক ডকুমেন্টেশনে চীনা কোম্পানিগুলি এখনও 100,000টি একই প্রজন্মের অগ্রগতি সম্পন্ন GPU ব্যবহার করে একটি মডেল ট্রেনিং সম্পন্ন করার কেস প্রকাশ করেনি।
চীনা কোম্পানিগুলি বিদেশে ক্যালকুলেশন ক্ষমতা স্থাপন, স্থানীয় চিপ সামঞ্জস্যতা বাড়ানো, মডেল আর্কিটেকচার অপ্টিমাইজ এবং প্রশিক্ষণ দক্ষতা বাড়ানোর মাধ্যমে ক্ষমতা বৃদ্ধি করছে। এই পথগুলির প্রতিটিরই মূল্য রয়েছে, তবে সংক্ষিপ্ত সময়ের মধ্যে এগুলি সবচেয়ে উন্নত GPU ক্লাস্টারগুলির দ্বারা প্রদানকৃত মৌলিক ক্ষমতার সুবিধাকে সম্পূর্ণরূপে প্রতিস্থাপন করা কঠিন।
গত কয়েক বছরে, চীনের এআই শিল্প একটি সত্য প্রমাণ করেছে: অ্যালগরিদমের উদ্ভাবন কিছু ব্যবধান উল্লেখযোগ্যভাবে কমাতে পারে।
ডিপসিক ইত্যাদি কোম্পানির উত্থান দেখায় যে, দক্ষ ইঞ্জিনিয়ারিং টিমগুলি মডেল স্ট্রাকচার অপ্টিমাইজেশন, ট্রেনিং স্ট্র্যাটেজি সমন্বয় এবং সম্পদ ব্যবহারের দক্ষতা বৃদ্ধির মাধ্যমে সীমিত কম্পিউটেশনাল ক্ষমতার শর্তে বিপ্লব ঘটাতে পারে।
কিন্তু আরেকটি বাস্তবতা একইভাবে বিদ্যমান: যখন বিশ্বব্যাপী প্রতিযোগিতা পরবর্তী প্রজন্মের মৌলিক মডেলের পর্যায়ে প্রবেশ করে, তখন ক্যালকুলেশন স্কেলের গুরুত্ব আরও বাড়বে।
দক্ষতা উন্নয়ন খরচ কমাতে পারে, কিন্তু উন্নত হার্ডওয়্যার এবং সুপারস্কেল ক্লাস্টার দ্বারা নির্ধারিত ক্ষমতার সীমানা সম্পূর্ণরূপে পরিবর্তন করা কঠিন।
ব্ল্যাকওয়েলের পর, রুবিন যুগ প্রতিষ্ঠানগত ব্যবধান আরও বাড়াতে পারে
আরও গুরুত্বপূর্ণ বিষয় হলো, ব্ল্যাকওয়েল নভেডিয়ার বর্তমান প্রযুক্তি পথের শেষ নয়।
নভেডিয়ার পরবর্তী প্রজন্মের ভেরা রুবিন আর্কিটেকচার এখন বড় পরিমাণে উৎপাদনে প্রবেশ করেছে। নভেডিয়ার প্রকাশিত অনুমান অনুযায়ী, বড় MoE মডেল ট্রেনিংয়ের জন্য রুবিনের প্রয়োজনীয় GPU সংখ্যা ব্ল্যাকওয়েলের চারভাগের একভাগের কাছাকাছি হবে।
এর অর্থ হল ভবিষ্যতে এআই প্রতিযোগিতায় একটি নতুন চক্র দেখা দিতে পারে।
প্রথম স্থানীয় প্রতিষ্ঠানগুলি সর্বশেষ আর্কিটেকচার ব্যবহার করে, যার ফলে কম চিপ দিয়ে বড় স্কেলে ট্রেনিং সম্ভব হয়; কম ট্রেনিং খরচের ফলে প্রতিষ্ঠানগুলি আরও বেশি পরীক্ষা করতে পারে, যা মডেলের ক্ষমতা আরও বাড়ায়।
যদি পিছনে পড়ে থাকা প্রতিষ্ঠানগুলি শুধুমাত্র পুরনো হার্ডওয়্যার পায়, তবে তাদের দুটি সমস্যা হতে পারে: একদিকে প্রশিক্ষণের দক্ষতা কম, অন্যদিকে সবচেয়ে বড় মডেলগুলির প্রতিযোগিতায় অংশগ্রহণ করা কঠিন।
অবশ্যই, এর অর্থ এই নয় যে চীনা এআই কোম্পানিগুলির কোনো সুযোগ নেই।
এআই-এর ইতিহাস বারবার প্রমাণ করেছে যে, প্রযুক্তিগত প্রতিযোগিতা শুধুমাত্র একটি হার্ডওয়্যার দ্বারা নির্ধারিত হয় না। মডেল উদ্ভাবন, প্রয়োগের ক্ষেত্র, বাণিজ্যিককরণের ক্ষমতা এবং প্রকৌশলগত দক্ষতা—এগুলি সবই নতুন বিপ্লব ঘটাতে পারে।
তবে যদি প্রতিষ্ঠানগত দৃষ্টিকোণ থেকে দেখা যায়, GPT-6 Astra-এর 100,000টি Blackwell GPU ব্যবহার ঘটনাটি একটি চলমান পরিবর্তনকে প্রকাশ করে: বিশ্বব্যাপী AI প্রতিযোগিতার মূল মঞ্চটি মডেল স্তর থেকে আরও বেশি করে ক্যালকুলেশন ইনফ্রাস্ট্রাকচার স্তরের দিকে সরে যাচ্ছে।
আগামী কয়েক বছরে, একটি এআই কোম্পানির প্রতিযোগিতামূলক সামর্থ্য নির্ধারণ করবে শুধুমাত্র একটি উত্তম মডেল ট্রেন করার ক্ষমতা নয়, বরং পরবর্তী প্রজন্মের মডেল ট্রেন করার স্থায়ী ক্ষমতা গড়ে তোলার ক্ষমতা।
চীনের এআই শিল্পের জন্য, একটি মডেল বা একটি প্রকাশের পিছনে পিছনে যাওয়ার পরিবর্তে, চিপ প্রাপ্তি, ডেটা কেন্দ্র নির্মাণ, ক্লাস্টার সমন্বয় এবং সফটওয়্যার ইকোসিস্টেম পর্যন্ত একটি সম্পূর্ণ সিস্টেমের ক্ষমতা প্রয়োজন।
10 লক্ষ ব্ল্যাকওয়েলের গুরুত্ব শুধু একটি অবাক করে দেওয়া সংখ্যা তৈরি করার মধ্যে নয়, বরং এটি বাজারকে স্মরণ করিয়ে দেয় যে কৃত্রিম বুদ্ধিমত্তা শিল্পায়নের পর্যায়ে প্রবেশ করেছে, এবং শিল্পায়নের প্রতিযোগিতা চূড়ান্তভাবে অবকাঠামোর উপর নির্ভর করে।
উৎস উল্লেখ:
- NVIDIA-এর ব্ল্যাকওয়েল, GB200 NVL72, ভেরা রুবিন আর্কিটেকচার এবং AI ইনফ্রাস্ট্রাকচার সম্পর্কিত প্রকাশিত তথ্য।
- হুয়াং রেনশুনের প্রকাশ্য বক্তৃতা এবং মিডিয়া সাক্ষাত্কারের তথ্য।
- ব্লুমবার্গ কিমি ক্যালকুলেশন ক্রয় এবং এইচ২০০ সংক্রান্ত প্রতিবেদন।
- বাই트ダンس দ্বারা প্রকাশিত এআই অবকাঠামো এবং বিদেশে ক্যালকুলেশন ক্ষমতা বিন্যাসের তথ্য।
- ডিপসিকের প্রকাশিত তথ্য এবং লিয়াং উয়েনফেং বিনিয়োগকারীদের সাথে আয়োজিত আলোচনার ট্রান্সক্রিপ্ট ডকুমেন্ট।
- অ্যালিবাবা ক্লাউড সম্পর্কিত এআই ইনফ্রাস্ট্রাকচার এবং বড় মডেল কম্পিউটিং ক্ষমতা সহযোগিতার প্রকাশিত তথ্য।
