Message de ChainThink, 5 août : la société de sécurité Aikido a testé 7 modèles à l'aide de l'agent d'audit de code, couvrant Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna et Terra.
Le test comprend 32 vulnérabilités récemment publiées, chaque modèle étant exécuté 3 fois. Qwen3.8-Max a détecté au total 26 vulnérabilités sur les trois rounds, avec un taux de rappel de 81,3 %, partageant la première place avec Claude Opus 5.
Le score F1 global de Qwen3.8-Max est de 83,2 %, légèrement inférieur à ceux d'Opus 5, Kimi K3 Max et GPT-5.6 Sol.
Sa stabilité de performance individuelle est faible : seulement 10 vulnérabilités sur 26 ont été trouvées lors de trois tours consécutifs, tandis qu'Opus 5 et Sol en ont chacun trouvé 19.
En termes de coûts, le Qwen3.8-Max a un coût total d'environ 821 dollars américains, soit environ la moitié de celui d'Opus 5 et de Sol, mais cinq fois celui de DeepSeek V4 Flash.
