Mensahe ni ChainThink, Agosto 5, ang security company na Aikido ay ginamit ang code audit agent upang subukan ang 7 na modelo, kabilang ang Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna, at Terra.
Ang pagsubok ay naglalaman ng 32 kamakailang ipinahayag na vulnerabilities, at bawat modelo ay pinagpapatakbo ng 3 beses. Ang Qwen3.8-Max ay nakakita ng 26 vulnerabilities sa lahat ng tatlong ronda, na may recall rate na 81.3%, at nagkakaroon ng pagkakasunod-sunod na unang lugar kasama ang Claude Opus 5.
Ang F1 score ng Qwen3.8-Max ay 83.2%, kaunting mas mababa kaysa sa Opus 5, Kimi K3 Max, at GPT-5.6 Sol.
Kamakailan lamang ang kanyang pagkakaroon ng katatagan sa isang pagkakataon, kung saan sa 26 na vulnerabilities, lamang ang 10 ang natagpuan nang tuloy-tuloy sa tatlong round, samantalang ang Opus 5 at Sol ay parehong 19.
Sa aspeto ng gastos, ang kabuuang gastos ng Qwen3.8-Max ay humigit-kumulang $821, na halos kalahati ng gastos ng Opus 5 at Sol, ngunit limang beses ang gastos ng DeepSeek V4 Flash.
