জিপুএআই দুই সপ্তাহে ১০০,০০০ ঘরোয়া এআই অ্যাক্সেলারেটর স্থাপন করেছে

iconMetaEra
শেয়ার
AI summary iconসারাংশ
AI + ক্রিপ্টো সংবাদ অনুযায়ী, জিপুAI তার GLM-5.3-Flash ইনফারেন্স সিস্টেমকে মাত্র দুই সপ্তাহে ১০০,০০০টিরও বেশি দেশীয় AI অ্যাক্সেলারেটরের ক্লাস্টারে ডিপ্লয় করেছে। এই সিস্টেমের এন্ড-টু-এন্ড থ্রুপুট ৩.২ গুণ বৃদ্ধি পেয়েছে, যেখানে একটি AI-চালিত Infra Agent সাধারণত সিনিয়র ইঞ্জিনিয়ারদের দ্বারা সম্পন্ন অপ্টিমাইজেশন কাজগুলি হ্যান্ডল করছে। অন-চেইন সংবাদটি AI-এর অবকাঠামোতে দ্রুত একীভূতকরণকে উল্লেখ করে, যা দেখায় কিভাবে অটোমেশন প্রযুক্তিগত কাজপ্রবাহকে পুনর্গঠন করছে। এই ডিপ্লয়মেন্টটি চীনের AI + ক্রিপ্টো সংবাদ খাতে বৃদ্ধি পাওয়া গতিশীলতাকে প্রতিফলিত করে।
দুই সপ্তাহে, ১০ লাখ দেশীয় এআই অ্যাক্সেলারেটর, একটি নিজস্ব মডেল অপ্টিমাইজ করার শুরু।

লেখক: APPSO

উৎস: ওয়াল স্ট্রিট ভিজন

এখনই, জিজ্ঞাসা GLM-এর প্রধান বিজ্ঞানী ট্যাং জিয়ে এক্স প্ল্যাটফর্মে GLM-5.3-Flash ইনফারেন্স সিস্টেম অপ্টিমাইজেশন সম্পর্কিত একটি গবেষণা শেয়ার করেছেন।

তিনি উল্লেখ করেন যে, GLM-5.3-Flash এর প্রথম চালু থেকে সম্পূর্ণ উৎপাদন ট্রাফিক বহন করা পর্যন্ত মাত্র দুই সপ্তাহ সময় লাগে। এই প্রক্রিয়ায়, সিস্টেমের এন্ড-টু-এন্ড থ্রুপুট ক্ষমতা 3.2 গুণ বৃদ্ধি পায়।

যে বিষয়টি ট্যাং জিয়েকে সবচেয়ে বেশি প্রভাবিত করেছিল, তা হলো অসংখ্য অপ্টিমাইজেশনের কাজ শুধুমাত্র ইনফ্রাস্ট্রাকচার ইঞ্জিনিয়ারদের দ্বারা নয়, বরং GLM-5.3 দ্বারা চালিত একটি Infra Agent-এর দ্বারাও সম্পন্ন হয়েছিল।

“একটি মডেল যা নিজের সেবা অপ্টিমাইজ করতে সাহায্য করে।” টাং জিয়ে এই পরিবর্তনটিকে এভাবে বর্ণনা করেন।

তার মতে, এর অর্থ হল এআই নিজের চালানোর জন্য ব্যবহৃত সিস্টেমের অপ্টিমাইজেশনে অংশগ্রহণ শুরু করেছে। বাস্তবিক অর্থে রিকার্সিভ সেলফ-ইমপ্রুভমেন্ট (RSI) এখনও দূরে, কিন্তু একটি প্রাথমিক রূপ প্রকাশ পেয়েছে।

জিপু দল উল্লেখ করেছে যে গত বছর তারা লক্ষ্য করেছে যে GLM-এর ভূমিকা পরিবর্তিত হচ্ছে।

প্রাথমিকভাবে, দলটি GLM-এর কোড বুঝতে এবং সাইবার নিরাপত্তা ক্ষেত্রে ক্ষমতা অনুসন্ধান করেছিল, যাতে মডেলটি জটিল কোডের ভিতরের দুর্বলতা বিশ্লেষণে সহায়তা করতে পারে। কিন্তু মডেলের ক্ষমতা বৃদ্ধির সাথে সাথে, GLM শুধুমাত্র AI সিস্টেম তৈরির জন্য সহায়তা করা শুরু করেছিল।

টিম বলেছে যে তারা দেখেছে যে মডেলগুলি কিছু কাজ সম্পন্ন করেছে যা আগে অভিজ্ঞ অবকাঠামো ইঞ্জিনিয়ারদের কয়েক সপ্তাহ লাগত, এবং এই কাজগুলি পরবর্তী প্রজন্মের মডেল ট্রেনিং এবং ডিপ্লয়মেন্টের উপায়কে সরাসরি প্রভাবিত করবে।

দুই সপ্তাহে স্থানীয় ক্যালকুলেশন ক্লাস্টার স্থাপন করা হয়েছে

একটি বড় মডেলকে নতুন হার্ডওয়্যারে প্রথমবারের মতো চালু করে থেকে স্থিতিশীলভাবে উৎপাদন অনুরোধ পরিচালনা করতে পারে এমন ইনফারেন্স সার্ভিসে পরিণত করতে বহু সিস্টেম ইঞ্জিনিয়ারিংয়ের প্রয়োজন।

GLM-5.3-Flash এই ডিপ্লয় বেশি হয়েছে 10 লাখ ভারতীয় AI অ্যাক্সেলারেটর দিয়ে গঠিত ক্লাস্টারে। জিজ্ঞাপ দল বলেছেন, এটি আগের কোনো পরিপক্ক অভিজ্ঞতা ছাড়াই একটি বৃহৎ ডিপ্লয়।

টিমকে কয়েকটি সমস্যা সমাধান করতে হবে, যার মধ্যে রয়েছে দেশীয় চিপের মেমোরি ক্ষমতা এবং ইন্টারকানেকশন ব্যান্ডউইথের সীমাবদ্ধতা, নতুন মডেল আর্কিটেকচারের সামঞ্জস্য, 100 লক্ষ টোকেন দীর্ঘ কনটেক্সট সমর্থন এবং মাল্টিমোডাল অনুরোধ প্রক্রিয়াকরণ। একইসাথে, দেশীয় AI অ্যাক্সেলারেটরের সফটওয়্যার ইকোসিস্টেম এখনও বিকাশের পর্যায়ে রয়েছে, কিছু Kernel-এর সমর্থন অপর্যাপ্ত, এবং অনেক তথ্য ইঞ্জিনিয়ারিং টিমকে নিজেদের দ্বারা অনুসন্ধান করতে হবে।

ট্যাং জিয়ে বলেন যে, এই সীমাবদ্ধতাগুলির অধীনে, GLM-5.3 চালিত ইনফ্রা এজেন্ট যুক্তিসঙ্গত সিস্টেম অপ্টিমাইজেশন প্রক্রিয়ায় অংশগ্রহণ করেছে, যা পারফরম্যান্স বোতলের গলা বিশ্লেষণ, অপ্টিমাইজেশন প্রস্তাব এবং কিছু কোড সংশোধন সম্পন্ন করতে সাহায্য করেছে।

সম্পূর্ণ অপ্টিমাইজেশন প্রক্রিয়াটি শুধুমাত্র গণনা সংস্থান বাড়ানোর চেয়ে বেশি, এটি ক্ষমতা, মেমোরি, যোগাযোগ এবং সময়সূচীর মধ্যে একটি নতুন ভারসাম্য খুঁজে পাওয়ার বিষয়।

জিট্সু দল একটি সিরিজ অপ্টিমাইজেশন পদ্ধতি ব্যবহার করেছে। উদাহরণস্বরূপ, কম্পিউটেশন ব্যবহার করে মেমোরি স্পেস বাঁচানোর জন্য ReplaySSM, নোড-ভিত্তিক টেনসর প্যারালালাইজেশন ব্যবহার করে জিপিইউ মেমোরির চাপ কমানো, INT8, FP8, BF16 মিক্সড-প্রিসিশন ক্যাশিং ব্যবহার করে ক্ষমতা ব্যবহারের দক্ষতা বাড়ানো, এবং Encode-Prefill-Decode (EPD) সেপারেটেড আর্কিটেকচার চালু করে বিভিন্ন ইনফারেন্স পর্যায়গুলিকে আরও নমনীয়ভাবে স্কেডিউল করা।

শেষ পর্যন্ত, GLM-5.3-Flash-এর এন্ড-টু-এন্ড সার্ভিস পারফরম্যান্স প্রাথমিক সংস্করণের তুলনায় প্রায় 3 গুণ উন্নত হয়েছে, যা হার্ডওয়্যার ব্যবহার এবং একক টোকেন খরচকে প্রধান নিভিয়া জিপিইউ প্ল্যাটফর্মের স্তরের কাছাকাছি নিয়ে আসে।

ডিপ্লয়ের পরে, GLM-5.3-Flash বাস্তব ব্যবহারের পরীক্ষায় প্রবেশ করে। জিজ্ঞাপ দল জানান, এই মডেলটি অ্যানোনিমাস মডেল নাম Ox-Alpha হিসেবে OpenCode এবং OpenRouter প্ল্যাটফর্মে চলেছিল, এক সপ্তাহের মধ্যে এটি দুটি প্ল্যাটফর্মের সবচেয়ে বেশি ব্যবহৃত মডেলগুলির একটি হয়ে ওঠে, যা ছয় দিনে 62 ট্রিলিয়নেরও বেশি token প্রক্রিয়া করে।

তবে, এই পরীক্ষার প্রকৃত পরিবর্তন শুধুমাত্র AI-এর কোড লেখার ক্ষমতা নয়, বরং AI-এর জটিল সিস্টেমের কারণে কেন পারফরম্যান্সে পরিবর্তন ঘটে তা বুঝতে পারা।

উদাহরণস্বরূপ, যখন সিস্টেম "থ্রুপুট ২০% কমে গেছে" বলে ফিডব্যাক দেয়, তখন এটি শুধু এটি বোঝায় যে কোথাও অস্বাভাবিকতা ঘটেছে, কিন্তু এটি সরাসরি Agent-কে বলতে পারে না যে কোন লেয়ারে সমস্যা হয়েছে, বর্তমান ধারণা ভুল কিনা, এবং পরবর্তীতে কী যাচাই করা উচিত।

অভিজ্ঞ ইঞ্জিনিয়ারদের জন্য, এই ধরনের বিচার দীর্ঘমেয়াদী অভিজ্ঞতার উপর নির্ভর করে। ইঞ্জিনিয়াররা জানেন কখন একেকটি কার্যক্রমের সময়রেখা পরীক্ষা করবেন, কখন মাইক্রো-বেঞ্চমার্ক চালাবেন, এবং কোন মডিউলের আউটপুট তুলনা করবেন।

জিজং দল এই প্রকৌশল অভিজ্ঞতাকে একটি এআই যা ফিডব্যাক মেকানিজম কল করতে পারে তার মধ্যে রূপান্তরিত করতে চায় এবং এটিকে "dense feedback" নামে ডাকে।

এই প্রক্রিয়ার মূল বিষয় হল এজেন্টকে প্রকৌশল বিচারের প্রক্রিয়ার সাথে আরও কাছাকাছি তথ্য প্রদান করা।

যখন মডেলটি গণনাটি সঠিক কিনা তা নিশ্চিত করতে চায়, তখন এটি সংশ্লিষ্ট সঠিকতা ফিডব্যাক পেতে পারে; যখন মডেলটি পারফরম্যান্স হ্রাসের কারণ বিশ্লেষণ করতে চায়, তখন এটি সিস্টেমের রানটাইম খরচ দেখতে পারে; যখন মডেলটি নতুন অপ্টিমাইজেশন পদ্ধতি চেষ্টা করে, তখন এটি পরীক্ষার মাধ্যমে বুঝতে পারে যে এই পদ্ধতিটি বর্তমান পরিস্থিতির জন্য উপযুক্ত কিনা।

চিগ্লু দল মনে করেন যে প্রকৃতপক্ষে কার্যকরী ফিডব্যাকের জন্য কিছু শর্ত পূরণ করা প্রয়োজন: এটি যথেষ্ট নির্দিষ্ট সমস্যার কাছাকাছি হতে হবে, দ্রুত পাওয়া যাবে এবং বস্তুনিষ্ঠ পরীক্ষার মাধ্যমে যাচাই করা যাবে। অন্যথায়, বড় পরিমাণে লগ এবং সূচকগুলি এজেন্টকে পরবর্তী পদক্ষেপের দিকনির্দেশনা দিতে কঠিন করে তুলতে পারে।

মডেল অপ্টিমাইজেশন সিস্টেম, সিস্টেম সার্ভিস মডেল

ঘন ফিডব্যাকের সাহায্যে, ইনফ্রা এজেন্ট লুকানো সমস্যাগুলি চিহ্নিত করার জন্য যুক্তিসঙ্গত সিস্টেমে অংশগ্রহণ শুরু করেছে।

KDA-এর প্রেক্ষাপটে সম song পথে, এজেন্ট দীর্ঘ প্রেক্ষাপট গণনার সঠিকতা প্রভাবিত করা একটি সমস্যা আবিষ্কার করেছে।

বিভিন্ন কনটেক্সট শার্ডের মধ্যে স্টেট ম্যাট্রিক্স অবিরাম একীভূত করার কারণে, TF32 গণনা দ্বারা উৎপন্ন রাউন্ডিং ত্রুটি ধারার দৈর্ঘ্যের সাথে সাথে জমা হয়ে শেষ পর্যন্ত গণনার বিচ্যুতি ঘটায়।

এজেন্ট বিভিন্ন বাস্তবায়ন পথের ফলাফলের তুলনা করে সমস্যাটিকে অবস্থা প্রচার এবং একীভূতকরণ প্রক্রিয়ার প্রাসঙ্গিক সঠিকতা প্রক্রিয়াকরণের সাথে সম্পর্কিত করেছে। সংশোধনগুলি ইতিমধ্যে Flash Linear Attention প্রকল্পের PR #1180-এ একীভূত করা হয়েছে।

KV ট্রান্সফার এবং ডিপিইপ স্কেডিউলিংয়ের মধ্যে আরেকটি সমস্যা দেখা দিয়েছে।

টেস্টিংয়ের সময়, এজেন্ট দেখেছে যে KV ট্রান্সফার DeepEP ডিসপ্যাচের সাথে কার্যকরভাবে ওভারল্যাপ করছে না, যার ফলে কিছু স্কেনারিওতে ট্রান্সমিশন ওভারহেড 30% এর বেশি হয়েছে।

পরে, এজেন্ট পাইথন এবং সি++ কল চেইনের মাধ্যমে বিশ্লেষণ চালিয়ে যায় এবং দেখে যে নোডের ভিতরের পথ পাইথন GIL-কে সময়মতো মুক্ত করছে না, যার ফলে ট্রান্সমিশন টাস্ক সময়মতো এগিয়ে যাচ্ছে না।

পরিবর্তন সম্পন্ন হওয়ার পর, KV ট্রান্সফারের অতিরিক্ত খরচ 30% এর বেশি থেকে 1% এর নিচে কমিয়ে আনা হয়েছে।

এছাড়াও, এজেন্ট একটি ডিকোড কার্নেলকে অপ্টিমাইজ করেছে।

এটি পাওয়া গেছে যে, কার্নেল বিভাজন পদ্ধতির সমস্যার কারণে একই সেট নর্মালাইজেশন গণনা চারবার পুনরাবৃত্তি হচ্ছে। গণনা কাঠামোকে পুনর্সংগঠিত করে পুনরাবৃত্তি গণনা কমিয়ে, এই কার্নেল শেষপর্যন্ত 1.71 গুণ পারফরম্যান্স বৃদ্ধি পায়।

এই অপ্টিমাইজেশন ধারণাটি Agent এর দ্বারা SGLang, Flash Linear Attention এবং DeepGEMM প্রকল্পগুলির বিদ্যমান Kernel গুলি থেকে শেখা হয়েছে। এটি এই কোডগুলিতে অপ্টিমাইজেশনের অভিজ্ঞতা কে “optimization skeleton” হিসেবে সংক্ষিপ্ত করে, তারপর বর্তমান সিস্টেমের ফিডব্যাকের সাথে মিলিয়ে দেখে এটি প্রযোজ্য কিনা তা নির্ণয় করে।

পূর্বে, এই ধরনের অপ্টিমাইজেশনের অভিজ্ঞতা মূলত ইঞ্জিনিয়ারদের ব্যক্তিগত অভিজ্ঞতার উপর নির্ভর করত।

এই প্রক্রিয়ার মধ্যে, এজেন্ট পূর্ববর্তী কোড থেকে অপ্টিমাইজেশন পদ্ধতি শিখতে শুরু করে এবং এই পদ্ধতিগুলি নতুন হার্ডওয়্যার এবং মডেল পরিবেশের জন্য উপযুক্ত কিনা তা পরীক্ষার মাধ্যমে যাচাই করে।

ট্যাং জিয়ে বলেন, মানুষের ইঞ্জিনিয়াররা এখনও লক্ষ্য নির্ধারণ, ফিডব্যাক পরিবেশ তৈরি এবং উচ্চ-ঝুঁকিপূর্ণ পরিবর্তনগুলি পর্যালোচনা করার দায়িত্ব বহন করেন।

কিন্তু ইঞ্জিনিয়ারদের ভূমিকা প্রতিটি সমস্যা সমাধান করার থেকে ধীরে ধীরে ফিডব্যাক সিস্টেম ডিজাইন করার দিকে পরিবর্তিত হচ্ছে।

চিপু দল মনে করেন যে, বাস্তব অবকাঠামোগত কাজের উপর ভিত্তি করে তৈরি যাচাইযোগ্য ফিডব্যাক পরিবেশ পরবর্তী প্রজন্মের মডেল প্রশিক্ষণের একটি গুরুত্বপূর্ণ ভিত্তি হতে পারে। প্রতিবার এজেন্ট একটি ইঞ্জিনিয়ারিং কাজ সম্পন্ন করলে, তা পরবর্তী প্রজন্মের মডেলের জন্য শেখার ডেটা হয়ে উঠতে পারে।

বর্তমানে, GLM-5.3-Flash-এর কেসগুলি প্রকৃত অর্থে পুনরাবৃত্ত আত্ম-উন্নতির দিকে এখনও দূরে। তবে টাং জিয়ে মনে করেন যে একটি ন্যূনতম আকারের চক্র এখন দেখা যাচ্ছে।

মডেল অপ্টিমাইজেশন সিস্টেম, এবং সিস্টেম সার্ভিস মডেল।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।