ChainThink mensagem, 5 de agosto, a empresa de segurança Aikido testou 7 modelos usando o agente de auditoria de código, abrangendo Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna e Terra.
O teste inclui 32 vulnerabilidades recentemente divulgadas, com cada modelo executado 3 vezes. O Qwen3.8-Max identificou um total de 26 vulnerabilidades nas três rodadas, com uma taxa de recall de 81,3%, empatando em primeiro lugar com o Claude Opus 5.
O F1 score do Qwen3.8-Max é de 83,2%, ligeiramente inferior ao do Opus 5, Kimi K3 Max e GPT-5.6 Sol.
Sua estabilidade de desempenho individual é fraca; apenas 10 das 26 vulnerabilidades foram encontradas em três rodadas consecutivas, tanto o Opus 5 quanto o Sol encontraram 19.
Em termos de custo, o Qwen3.8-Max tem um custo total de aproximadamente 821 dólares, cerca da metade do Opus 5 e do Sol, mas cinco vezes o valor do DeepSeek V4 Flash.
