ChainThink повідомляє, 5 серпня компанія з безпеки Aikido протестувала 7 моделей за допомогою аудиторського агента, включаючи Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna та Terra.
Тест містить 32 недавно опубліковані вразливості, кожна модель запускалася 3 рази. Qwen3.8-Max за три раунди знайшов 26 вразливостей, показник відновлення — 81,3%, що посідає перше місце разом з Claude Opus 5.
F1-показник Qwen3.8-Max становить 83,2%, трохи нижчий, ніж у Opus 5, Kimi K3 Max і GPT-5.6 Sol.
Його стабільність у одноразовому виконанні слабка: лише 10 із 26 вразливостей були знайдені в усіх трьох раундах поспіль, Opus 5 і Sol — по 19.
Щодо витрат, загальна вартість Qwen3.8-Max становить приблизно 821 долар США, що приблизно вдвічі менше, ніж у Opus 5 і Sol, але в п’ять разів більше, ніж у DeepSeek V4 Flash.
