ChainThinkのメッセージ、8月5日、セキュリティ企業Aikidoがコード監査Agentを用いて7つのモデルをテストし、Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash、GPT-5.6 Sol、Luna、Terraをカバーした。
テストは32の最近公開された脆弱性を含み、各モデルを3回実行しました。Qwen3.8-Maxは3回の実行で合計26の脆弱性を検出でき、再現率は81.3%で、Claude Opus 5と並んで第1位となりました。
Qwen3.8-MaxのF1総合スコアは83.2%で、Opus 5、Kimi K3 Max、GPT-5.6 Solやや下回っています。
単回の性能の安定性が弱く、26個の脆弱性のうち連続3ラウンドで見つかったのは10個のみで、Opus 5とSolはそれぞれ19個です。
コスト面では、Qwen3.8-Maxの総コストは約821ドルで、Opus 5およびSolの約半分だが、DeepSeek V4 Flashの5倍である。
