Mensaje de ChainThink, 5 de agosto: la empresa de seguridad Aikido probó 7 modelos utilizando el agente de auditoría de código, cubriendo Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna y Terra.
La prueba incluye 32 vulnerabilidades recientemente divulgadas, con cada modelo ejecutado 3 veces. Qwen3.8-Max encontró un total de 26 vulnerabilidades en las tres rondas, con una tasa de recuperación del 81,3%, empatando en el primer lugar con Claude Opus 5.
Qwen3.8-Max tiene una puntuación F1 general del 83,2%, ligeramente por debajo de Opus 5, Kimi K3 Max y GPT-5.6 Sol.
Su estabilidad en desempeño individual es débil; solo 10 de los 26 vulnerabilidades fueron encontradas en tres rondas consecutivas, tanto Opus 5 como Sol tuvieron 19.
En términos de costos, Qwen3.8-Max tiene un costo total de aproximadamente 821 dólares, alrededor de la mitad del costo de Opus 5 y Sol, pero cinco veces el costo de DeepSeek V4 Flash.
