ChainThink 消息,8 月 5 日,安全公司 Aikido 使用代碼審計 Agent 測試 7 款模型,涵蓋 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash、GPT-5.6 Sol、Luna 和 Terra。
測試包含 32 個近期公開漏洞,每款模型運行 3 次。Qwen3.8-Max 三輪合計找到 26 個漏洞,召回率為 81.3%,與 Claude Opus 5 並列第 1 名。
Qwen3.8-Max 的 F1 綜合分為 83.2%,略低於 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。
其單次表現穩定性較弱,26 個漏洞中僅有 10 個連續三輪均被找到,Opus 5 和 Sol 均為 19 個。
在成本方面,Qwen3.8-Max 的總成本約為 821 美元,約為 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。
