ChainThink сообщает, 5 августа компания безопасности Aikido протестировала семь моделей с помощью агента аудита кода, включая Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna и Terra.
Тест включал 32 недавно опубликованных уязвимости, каждая модель запускалась 3 раза. Qwen3.8-Max обнаружил в сумме 26 уязвимостей за три раунда, показатель полноты поиска — 81,3%, что совпадает с Claude Opus 5 и занимает первое место.
F1-показатель Qwen3.8-Max составляет 83,2%, что немного ниже, чем у Opus 5, Kimi K3 Max и GPT-5.6 Sol.
Его однократная стабильность работы слаба: только 10 из 26 уязвимостей были найдены в течение трех последовательных раундов, Opus 5 и Sol — по 19.
С точки зрения затрат, общая стоимость Qwen3.8-Max составляет около 821 доллара США, что примерно вдвое меньше, чем у Opus 5 и Sol, но в пять раз больше, чем у DeepSeek V4 Flash.
