জিপু সর্বশেষ মডেল GLM-5.3-Flash প্রকাশ করেছে, যা আগে অ্যানোনিমাস অক্স অ্যালফা নামে টেস্টিং প্ল্যাটফর্মে বিনামূল্যে উপলব্ধ ছিল এবং 5 দিনের মধ্যে 50 ট্রিলিয়ন টোকেনের বেশি ট্রাফিক পেয়েছে। মডেলটির ইনফারেন্স সার্ভিসের জন্য 10 লক্ষেরও বেশি দেশীয় চিপ ক্লাস্টার ব্যবহার করা হয়েছে, যার হার্ডওয়্যার দক্ষতা এবং প্রতি টোকেন খরচ নভিডিয়া GPU-এর সমান। পারফরম্যান্সের ক্ষেত্রে, এই মডেলটি AA কম্প্রিহেনসিভ ইনটেলিজেন্স ইনডেক্সে 57 পয়েন্ট পেয়েছে, যা Claude Opus 4.8-এর সমান। মূল্যনির্ধারণে, প্রতি মিলিয়ন টোকেন ইনপুট 0.8 যুয়ান এবং আউটপুট 2.8 যুয়ান, যা প্রতিদ্বন্দ্বীদের তুলনায় অনেক কম। আর্কিটেকচারটি স্পার্স এবং লিনিয়ার অটেনশনের মিশ্রণ ব্যবহার করে, যা GLM-5 সিরিজের প্রথম ন্যাটিভ মাল্টিমোডাল মডেল। চীনা AI মডেলগুলির সমষ্টিগতভাবে মূল্যবৃদ্ধির পটভূমিতে, জিপু কমদামের কৌশলে বাজারটির দখলদারির চেষ্টা করছে।লেখক, উৎস: ওয়ান্ডিয়াং লেটপোস্ট
২৬ আগস্ট, জিজিপু ঔপস্থিতিকভাবে নিশ্চিত করেছে: ডেভেলপার কমিউনিটিতে বিস্তৃত আলোচনার বিষয় হয়ে উঠা অ্যানোনিমাস মডেল Ox Alpha (চীনা কমিউনিটিতে "নিউলাই" নামে পরিচিত) হল তাদের সর্বশেষ প্রকাশিত GLM-5.3-Flash। মডেলের কোডনেমটি চীনের সম্প্রতি মুক্তিপ্রাপ্ত চলচ্চিত্র "নিউলাই" থেকে অনুপ্রাণিত।
এই মডেলটি আনুষ্ঠানিক প্রকাশের আগে অ্যানোনিমাসভাবে OpenRouter এবং OpenCode-এ বিনামূল্যে পরীক্ষার জন্য উন্মুক্ত করা হয়েছিল, যেখানে 5 দিনের মধ্যে মোট 50 ট্রিলিয়ন টোকেনের ট্রাফিক জমা হয়েছিল, যা দুটি প্ল্যাটফর্মের ট্রাফিক বৃদ্ধির রেকর্ড ভাঙে। বর্তমানে ব্যবহারের পরিমাণ DeepSeek-এর দ্বিগুণেরও বেশি। কিন্তু বাজারের মনোযোগ আকর্ষণ করেছিল একটি বিশদ তথ্য: এই সমস্ত ট্রাফিক সম্পূর্ণরূপে দেশীয় চিপগুলি দ্বারা পরিচালিত হয়েছিল।
জিজং অফিসিয়াল টেকনিক্যাল ডকুমেন্টে উল্লেখ করেছে যে, এই মডেলের ইনফারেন্স সার্ভিসের জন্য 10 লক্ষের বেশি দেশীয় চিপের ক্লাস্টার ব্যবহার করা হয়েছে, "হার্ডওয়্যার দক্ষতা এবং প্রতি টোকেন খরচ এখন প্রধান নভিডিয়া GPU-এর সমতুল্য পর্যায়ে পৌঁছেছে।"
সেমি অ্যানালিসিস নামের একটি সেমিকন্ডাক্টর গবেষণা প্রতিষ্ঠান এক্স প্ল্যাটফর্মে পোস্ট করে মন্তব্য করে: "সমস্ত ট্রাফিক স্থানীয়ভাবে উৎপাদিত চিপগুলি দ্বারা পরিচালিত হচ্ছে, হার্ডওয়্যারের দক্ষতা এবং একক টোকেন খরচ এখন নভেডা GPU-এর সাথে তুলনীয়। জালাপেঞ্জো (OpenAI-এর নিজস্ব ইনফারেন্স চিপ) কেল্লা ঘোষণার পরে, CUDA-এর প্রতিরক্ষা আবারও পরীক্ষার মুখে।"

10 লক্ষ স্থানীয় কার্ড: পরীক্ষা থেকে উৎপাদনে, জিজ্ঞাপ এই স্থানীয় চিপসের ক্লাস্টারের বাস্তবায়ন বিস্তারিত বর্ণনা করেছে।
একটি চিপের প্রধান বাধা হল মেমোরি ক্ষমতা এবং ব্যান্ডউইথ, যা 10 লক্ষ টোকেনের প্রেক্ষাপট দৈর্ঘ্যকে সমর্থন করাকে বিশেষভাবে কঠিন করে তোলে। এই সমস্যার সমাধানে, Zhipu SGLang-এর উপর ভিত্তি করে একটি বিশেষায়িত ইনফারেন্স ইঞ্জিন তৈরি করেছে, যা W8A8 কোয়ান্টাইজেশন, INT8/FP8/BF16 মিশ্র ক্যাশে কোয়ান্টাইজেশন এবং নোড-ভিত্তিক টেনসর প্যারালালিজমের মতো প্রযুক্তি ব্যবহার করে। এছাড়াও, এটি উৎপাদন-প্রিমিয়াম Encode–Prefill–Decode (EPD) বিচ্ছিন্ন আর্কিটেকচার চালু করেছে, যা মাল্টিমোডাল এনকোডিং, prompt-এর প্রিফিলিং এবং টোকেন-ভিত্তিক ডিকোডিংকে স্বতন্ত্রভাবে স্কিডিউলযোগ্য ওয়ার্ক পুলগুলিতে বিভক্ত করে।
智谱表示,与同一硬件上的初始基线相比,端到端服务性能提升了3倍。
দ্য লেটপোস্টের জানা যায়, এই চিপগুলির সরবরাহকারী হতে পারে হুয়াওয়ে, মোয়ার লাইনস বা হাইকুং। জিজ্ঞাপ অফিসিয়ালি এই বিষয়ে কোনও মন্তব্য করেননি এবং প্রযুক্তিগত ডকুমেন্টেও স্পষ্টভাবে কোনও চিপ মডেল উল্লেখ করা হয়নি।
সেমি অ্যানালিসিস মন্তব্যে বিশেষভাবে উল্লেখ করেছে যে, আগে একটি মতামত ছিল যে কেবলমাত্র শীর্ষস্থানীয় অগ্রণী ল্যাবগুলিই দিনে 100 ট্রিলিয়ন টোকেনের ক্যালকুলেশন ক্ষমতা রাখে, “এবং এখানে দিনে 100 ট্রিলিয়ন টোকেনের বিনামূল্যের ট্রাফিক সম্পূর্ণরূপে দেশীয় চিপগুলিতে চলছে।”

মডেলটি নিজে: ডিপসিকের সাথে তুলনা করা হয়েছে, মূল্য ক্লাউড ওপাস 4.8-এর 1/40। GLM-5.3-Flash-এর প্যারামিটার স্কেল 320B মোট প্যারামিটার এবং 18B সক্রিয় প্যারামিটার, যা আগের ফ্ল্যাগশিপ GLM-5.3-এর প্রায় 40% এবং ডিপসিক V4 Flash-এর সাথে প্রায় সমান।
পারফরম্যান্সের ক্ষেত্রে, জিএলএম-5.3-ফ্ল্যাশ আর্টিফিশিয়াল অ্যানালিসিস ইন্টেলিজেন্স ইনডেক্স (AA কম্প্রিহেনসিভ ইন্টেলিজেন্স ইনডেক্স) এ 57 পয়েন্ট পেয়েছে, যা আগের ফ্ল্যাগশিপ জিএলএম-5.2 কে ছাড়িয়েছে, Anthropic-এর Claude Opus 4.8 এর সাথে সমান এবং DeepSeek-এর ফ্ল্যাগশিপ মডেল V4 Pro ফরমাল ভার্সনের 53 পয়েন্টের চেয়ে বেশি।

মূল্য নির্ধারণের ক্ষেত্রে, GLM-5.3-Flash-এর জন্য প্রতি মিলিয়ন টোকেন ইনপুটের জন্য 0.8 যুয়ান এবং আউটপুটের জন্য 2.8 যুয়ান, ক্যাশ হিটের মূল্য 0.23 যুয়ান, যা GLM-5.3-এর দশমাংশ। চালুর পূর্বের দুই সপ্তাহে অর্ধেক মূল্যে চালু করা হবে।
জিপু বলেছেন যে GLM-5.3-Flash-এর দাম GLM-5.3-এর 1/10, সীমিত সময়ের ছাড়ের মধ্যে GLM-5.3-এর 1/20, এবং Claude Opus 4.8-এর 1/40।
ডিপসিক V4 ফ্ল্যাশের সাথে তুলনা করলে (রাতের সময় ইনপুট 1.5 টাকা, আউটপুট 4.5 টাকা), GLM-5.3-ফ্ল্যাশ বেশিরভাগ সাধারণ ব্যবহারের ক্ষেত্রে কম খরচে।

আর্কিটেকচার উন্নতি: প্যারামিটার এবং স্তরের সংখ্যা প্রায় অর্ধেক হ্রাস পেয়েছে GLM-5.3-Flash এর আর্কিটেকচার ডিজাইন GLM-5.3 এর সাথে সম্পূর্ণ ভিন্ন, যা এটিকে কম খরচে উচ্চতর পারফরম্যান্স অর্জনের অনুমতি দেয়।
GLM-4.5 এর তুলনায়, GLM-5.3-Flash এর মোট প্যারামিটার পরিমাণ প্রায় একই (355B বনাম 320B), কিন্তু সক্রিয় প্যারামিটার পরিমাণ 32B থেকে 18B এ কমেছে, স্তরের সংখ্যা 92 থেকে 45 এ কমেছে, প্রায় অর্ধেক।
জিপু বলেছেন যে, GLM-5.3-Flash হল প্রথম ওপেন-সোর্স অগ্রণী মডেল যা স্পার্স অ্যাটেনশন এবং লিনিয়ার অ্যাটেনশনের মিশ্র আর্কিটেকচার ব্যবহার করে। GLM-5.3-এর তুলনায়, এর অ্যাটেনশন ক্যালকুলেশন এবং KV ক্যাশে আকার যথাক্রমে 3.01 গুণ এবং 4.44 গুণ কমেছে।
এছাড়াও, এটি GLM-5 সিরিজের প্রথম ন্যাটিভ মাল্টিমোডাল মডেল, যা ইমেজ এবং ভিডিও ইনপুটকে সমর্থন করে, এবং চিজপু যখন কোডিং-এ তাদের কৌশলগত ফোকাস করেছে তখন থেকে প্রথমবারের মতো মাল্টিমোডাল ক্ষমতা সহ একটি নতুন মডেল চালু করা হয়েছে।

মূল্যবৃদ্ধির ঢেউয়ের মধ্যে কম মূল্যে বেরিয়ে আসা: GLM-5.3-Flash-এর প্রকাশ চীনা AI মডেল বাজারের একটি সাধারণ মূল্যবৃদ্ধির পরে ঘটেছে।
কিমি K3-এর আউটপুট মূল্য প্রতি মিলিয়ন টোকেনে ১০০ টাকা পর্যন্ত পৌঁছেছে, যা আগের মডেল K2.6-এর তিনগুণের বেশি; জিজ্ঞাপ এর অর্ধবার্ষিক মূল্যবৃদ্ধির পর আউটপুট মূল্য ২৮ টাকা পৌঁছেছে; ডিপসিক V4 Pro-এর মূল্য ৬ টাকা থেকে বেড়ে ১৩.৫ টাকা হয়েছে, চূড়ান্ত সময়ে ২৭ টাকা; ডিপসিক V4 Flash-এর আউটপুট মূল্য ২ টাকা থেকে বেড়ে ৪.৫ টাকা হয়েছে, চূড়ান্ত সময়ে ৯ টাকা।
দাম বাড়ানোর সরাসরি প্রভাব হল চাহিদার বহির্বাহিতা। দ্য ওয়ান্টিং লেটপোস্ট উল্লেখ করেছে যে, ডিপসিক V4 ফ্ল্যাশের দাম বাড়ানোর পর, ওপেনকোড প্ল্যাটফর্মে এর ব্যবহারের পরিমাণ অর্ধেক কমে গেছে, এবং এই চাহিদাটি দেশীয় মডেল প্রস্তুতকারকদের জন্য নতুন বৃদ্ধির সুযোগ হয়ে উঠেছে।
GLM-5.3-Flash-এর মূল্যনির্ধারণ কৌশল ঠিক এই ফাঁকটিকে লক্ষ্য করে।
