2 বিলিয়ন প্যারামিটার সহ একটি মডেল কম্পিউটেশনাল সম্পদ একটি বিলাসিতা, একটি নির্দিষ্ট কিছু নয় এমন ফোন, ল্যাপটপ এবং অন্যান্য ডিভাইসে চালানোর জন্য ডিজাইন করা OpenBMB-এর MiniCPM5-2B, যা তসিংহুয়া বিশ্ববিদ্যালয়ের NLP ল্যাব এবং ModelBest-এর সহযোগিতায় তৈরি, Artificial Analysis Intelligence Index v4.2-এ 4 বিলিয়ন প্যারামিটারের নীচে খোলা মডেলগুলির মধ্যে শীর্ষস্থান অধিকার করেছে, 15 পয়েন্ট স্কোর করে।
বেঞ্চমার্কটি বাস্তবে কী পরিমাপ করে
Artificial Analysis ৪.২ সংস্করণটি তার ইন্টেলিজেন্স সূচক প্রকাশ করে ৪ সেপ্টেম্বর, ২০২৬-এ, যা MiniCPM5-2B চালু হওয়ার তিন দিন আগে। আপডেটকৃত সূচকটিতে এআই মডেলগুলির মূল্যায়নের পদ্ধতিতে অর্থপূর্ণ পরিবর্তন আনা হয়েছে।
ব্যক্তিগত পরীক্ষা এখন মোট ওজনের 40% অংশ গ্রহণ করে, যা আগের সংস্করণের তুলনায় বৃদ্ধি পেয়েছে। এটি গুরুত্বপূর্ণ কারণ ব্যক্তিগত পরীক্ষাগুলি গেমিংয়ের জন্য কঠিন। যখন মডেল ডেভেলপারদের পরীক্ষার প্রশ্নগুলি আগে থেকে দেখতে পাওয়া যায় না, তখন স্কোরগুলি প্রকৃত ক্ষমতার বিশ্বস্ত সংকেত হয়ে ওঠে।
v4.2 আপডেটটি দুটি নতুন মূল্যায়ন উপাদানও যোগ করেছে: AA-Briefcase এজেন্টিক মূল্যায়ন এবং Surge-এর GDP.pdf দীর্ঘ-প্রসঙ্গ পরীক্ষা। এই যোগসমূহ শিল্পের এমন মডেলগুলির প্রতি বাড়তি আগ্রহকে প্রতিফলিত করে যেগুলি স্বায়ত্তশাসিতভাবে কাজ করতে পারে এবং শুধুমাত্র ট্রিভিয়া প্রশ্নের উত্তর দেওয়ার চেয়ে অনেক দীর্ঘ দলিলগুলি প্রক্রিয়াকরণ করতে পারে।
সামগ্রিক লিডারবোর্ডের শীর্ষে, স্বকীয় মডেলগুলি এখনও প্রাধান্য বজায় রাখে। Anthropic-এর Claude Fable 5.1 শীর্ষে রয়েছে। কিন্তু সাব-4B প্যারামিটার শ্রেণীতে, যেখানে কেবলমাত্র ক্ষমতা নয়, দক্ষতা এবং অ্যাক্সেসযোগ্যতা গুরুত্বপূর্ণ, MiniCPM5-2B ওপেন-ওয়েট র্যাঙ্কিংয়ের শীর্ষে রয়েছে।
ছোট মডেল, ব্যাপক আকাঙ্ক্ষা
MiniCPM5-2B একটি ঘন ট্রান্সফরমার, যার অর্থ উপসংহারের সময় প্রতিটি প্যারামিটার সক্রিয় থাকে, একটি মিক্সচার-অফ-এক্সপার্ট আর্কিটেকচারের মধ্যে দিয়ে রুটিং নয়। ঘন মডেলগুলি সাধারণত তাদের সম্পদ ব্যবহারে বেশি পূর্বানুমানযোগ্য হয়, যা ঠিক আপনি চান যখন এআইকে এজ ডিভাইসে ডিপ্লয় করেন।
মডেলটি 131K থেকে 512K টোকেন পর্যন্ত কনটেক্সট উইন্ডো সমর্থন করে, যা কনফিগারেশনের উপর নির্ভর করে। রেফারেন্সের জন্য, 512K টোকেন প্রায় একক পাসে 1,000-পৃষ্ঠার একটি বই প্রসেস করার সমতুল্য।
OpenBMB এ AMD, ইন্টেল, মিডিয়াটেক এবং Qualcomm-এর চিপসের জন্য MiniCPM5-2B অপ্টিমাইজ করেছে।
ক্ষমতার দিক থেকে, দলটি কোডিং, গণিত, দীর্ঘ-সংদর্ভ বোঝাপড়া, টুল ব্যবহার এবং এজেন্টিক প্রবাহের মধ্যে তাদের প্যারামিটার পরিসরের মধ্যে সর্বশ্রেষ্ঠ পারফরম্যান্সের দাবি করে।
মডেলটির প্রশিক্ষণে শক্তিশালী শিক্ষা সমন্বয় এবং OpenBMB যা উচ্চমানের ট্রাজেক্টরি হিসাবে বর্ণনা করে, সেই প্রযুক্তিগুলি ব্যবহার করা হয়েছে, যা জটিল, ক্রমিক সিদ্ধান্ত গ্রহণে মডেলটির পারফরম্যান্স উন্নত করার জন্য ডিজাইন করা হয়েছে।
মিনি সিপিএম লাইনেজ
MiniCPM5-2B একটি অনুসরণীয় রেকর্ডের উপর ভিত্তি করে তৈরি। এর পূর্বসূরি, MiniCPM5-1B, আগের সংস্করণের কৃত্রিম বিশ্লেষণ সূচকে 17.9 স্কোর করেছিল এবং 2 বিলিয়ন প্যারামিটারের নিচের মডেলগুলির মধ্যে শীর্ষ অবস্থান অধিকার করেছিল।
দুটি মডেলের মধ্যে স্কোরিং পার্থক্য, 1B সংস্করণের জন্য 17.9 এবং 2B সংস্করণের জন্য 15, এটি সূচকের পদ্ধতির পরিবর্তনকে প্রতিফলিত করে, একটি পিছনের পদক্ষেপকে নয়। ভার্সন 4.2-এর বেশি নির্ভরশীলতা ব্যক্তিগত টেস্ট সেট এবং নতুন মূল্যায়ন ক্যাটাগরিগুলির উপর অর্থাৎ, ভার্সনগুলির মধ্যে স্কোরগুলি সরাসরি তুলনা করা যায় না।
ডিভাইসে এআই-এর জন্য এটির অর্থ কী
ছোট মডেলের প্রতিযোগিতামূলক পরিস্থিতি বাড়তে শুরু করেছে। মেটা-এর Llama সিরিজ, মাইক্রোসফট-এর Phi মডেল এবং গুগল-এর Gemma ভ্যারিয়েন্টগুলি সমান প্যারামিটার পরিসরে প্রতিদ্বন্দ্বিতা করছে। সাব-4B শ্রেণিতে MiniCPM5-2B-এর বেঞ্চমার্ক এগিয়ে থাকা উল্লেখযোগ্য, কিন্তু বেঞ্চমার্কের প্রাধান্য এবং বাস্তব জীবনের ব্যবহারিকতা সবসময় একসাথে চলে না।
মডেলের দাবি করা কর্মক্ষমতার স্বাধীন যাচাই এখনও প্রকাশ্যে দলিলভুক্ত হয়নি। এআই বেঞ্চমার্কিংয়ে, ফলাফলের তৃতীয় পক্ষের পুনরুৎপাদনই একটি প্রেস রিলিজ এবং প্রমাণিত ক্ষমতার মধ্যে পার্থক্য করে।
