ChainThink का संदेश, 5 अगस्त, सुरक्षा कंपनी Aikido ने कोड ऑडिट Agent का उपयोग करके 7 मॉडलों की जांच की, जिसमें Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna और Terra शामिल हैं।
परीक्षण में 32 हालिया खुले दुरुपयोग शामिल थे, जिनमें प्रत्येक मॉडल को तीन बार चलाया गया। Qwen3.8-Max ने तीनों राउंड में कुल 26 दुरुपयोग खोजे, जिसकी रिकॉल दर 81.3% है, जो Claude Opus 5 के साथ पहले स्थान पर है।
Qwen3.8-Max का F1 स्कोर 83.2% है, जो Opus 5, Kimi K3 Max और GPT-5.6 Sol से थोड़ा कम है।
इसकी एकल प्रदर्शन स्थिरता कमजोर है, 26 विविधताओं में से केवल 10 को लगातार तीन राउंड में ढूंढा गया, जबकि Opus 5 और Sol दोनों के लिए 19 हैं।
लागत के मामले में, Qwen3.8-Max की कुल लागत लगभग 821 डॉलर है, जो Opus 5 और Sol की लागत की लगभग आधी है, लेकिन DeepSeek V4 Flash की तुलना में 5 गुना है।
