ChainThink মেসেজ, ৫ আগস্ট, সিকিউরিটি কোম্পানি Aikido কোড অডিট এজেন্ট ব্যবহার করে ৭টি মডেল পরীক্ষা করেছে, যার মধ্যে রয়েছে Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna এবং Terra।
পরীক্ষাটি 32টি সাম্প্রতিক প্রকাশিত ভালনের সমাহার নিয়ে গঠিত, প্রতিটি মডেল 3 বার চালানো হয়েছে। Qwen3.8-Max তিনটি রাউন্ডে মোট 26টি ভালন খুঁজে পেয়েছে, যার রিকল 81.3%, যা Claude Opus 5-এর সাথে প্রথম স্থানে সমান।
Qwen3.8-Max-এর F1 স্কোর 83.2%, যা Opus 5, Kimi K3 Max এবং GPT-5.6 Sol-এর চেয়ে কিছুটা কম।
এর একক পারফরম্যান্স স্থিতিশীলতা দুর্বল, 26টি ভুলের মধ্যে মাত্র 10টি তিনটি রাউন্ডেই খুঁজে পাওয়া গিয়েছিল, যেখানে Opus 5 এবং Sol প্রত্যেকে 19টি।
খরচের ক্ষেত্রে, Qwen3.8-Max-এর মোট খরচ প্রায় 821 ডলার, যা Opus 5 এবং Sol-এর প্রায় অর্ধেক, কিন্তু DeepSeek V4 Flash-এর 5 গুণ।
