ChainThink کی خبر، 5 اگست، سیکورٹی کمپنی Aikido نے کوڈ اڈٹ ایجنٹ کا استعمال کرتے ہوئے 7 ماڈلز کا ٹیسٹ کیا، جس میں Qwen3.8-Max، Claude Opus 5، Kimi K3 Max، DeepSeek V4 Flash، GPT-5.6 Sol، Luna اور Terra شامل ہیں۔
ٹیسٹ میں 32 حالیہ علنا کیے گئے خامیاں شامل ہیں، جن میں سے ہر ماڈل کو تین بار چلایا گیا۔ Qwen3.8-Max نے تین راؤنڈز میں مجموعی طور پر 26 خامیاں دریافت کیں، جس کی ریکال لیٹ 81.3% ہے، جو Claude Opus 5 کے ساتھ پہلے نمبر پر ہے۔
Qwen3.8-Max کا F1 سکور 83.2% ہے، جو Opus 5، Kimi K3 Max اور GPT-5.6 Sol سے تھوڑا کم ہے۔
اس کی ایک بار کی کارکردگی کی استحکام کم ہے، 26 خامیوں میں سے صرف 10 کو تین لگاتار راؤنڈز میں دریافت کیا گیا، جبکہ Opus 5 اور Sol دونوں کے لیے 19 ہیں۔
لاگت کے لحاظ سے، Qwen3.8-Max کی کل لاگت تقریباً 821 امریکی ڈالر ہے، جو Opus 5 اور Sol کی تقریباً آدھی ہے، لیکن یہ DeepSeek V4 Flash کی 5 گنا ہے۔
