ওডেইলি প্ল্যানেট ডেইলি সংবাদ: কিমি প্রকাশ্যে আনে মাল্টিমোডাল বড় মডেল ভিজুয়াল পারসেপশন মূল্যায়ন বেঞ্চমার্ক PerceptionBench, যা ভিজুয়াল পারসেপশন ক্ষমতাকে 10টি পরম ক্ষমতায় বিভক্ত করে স্বতন্ত্রভাবে মূল্যায়নের উদ্দেশ্যে তৈরি করা হয়েছে, যা ভিজুয়াল সম্পর্ক, গণনা, বৈশিষ্ট্য, গভীরতা ও 3D, অবস্থান, তুলনা, সূক্ষ্ম-কণা চিহ্নিতকরণ, প্রসঙ্গ একীকরণ, OCR এবং হ্যালুসিনেশন চিহ্নিতকরণসহ বিভিন্ন মাত্রা কভার করে। এই বেঞ্চমার্কটি 42টি বিদ্যমান মূল্যায়ন সেটের মডেলের ব্যর্থতার কেসগুলির উপর ভিত্তি করে তৈরি করা হয়েছে, যাতে 3000টি মানব-যাচাইকৃত প্রশ্ন রয়েছে, প্রতিটি প্রশ্ন শুধুমাত্র একটি ভিজুয়াল ক্ষমতা পরীক্ষা করে, যার জন্য যুক্তি বা বাহ্যিক জ্ঞানের প্রয়োজন হয় না।
মূল্যায়নের ফলাফল অনুযায়ী, 16টি অগ্রণী মাল্টিমোডাল বড় মডেলের মধ্যে কোনো মডেলই সামগ্রিক সঠিকতা 60% ছাড়িয়েছে। GPT-5.6-Sol 59.7% সঠিকতার সাথে প্রথম স্থান অধিকার করেছে, যখন Kimi K3 (58.5%), Claude-Fable-5 (57.2%), Gemini-3.1-Pro (56.2%) এবং GPT-5.5 (55.8%) শীর্ষ পাঁচের মধ্যে রয়েছে। রিপোর্টটি উল্লেখ করেছে যে, দৃশ্যমান প্রতারণা (Hallucination) এখনও সমস্ত মডেলের সবচেয়ে দুর্বল ক্ষমতা, এবং সামগ্রিক পরিপ্রেক্ষিত বোধগম্যতা এখনও উল্লেখযোগ্যভাবে উন্নতির পথ রেখেছে।
