Pesan ChainThink, 5 Agustus, perusahaan keamanan Aikido menggunakan agen audit kode untuk menguji 7 model, mencakup Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna, dan Terra.
Uji coba mencakup 32 kerentanan publik terbaru, dengan setiap model dijalankan 3 kali. Qwen3.8-Max berhasil menemukan 26 kerentanan dalam tiga putaran, dengan tingkat recall 81,3%, bersama-sama menduduki peringkat pertama dengan Claude Opus 5.
Qwen3.8-Max memiliki skor F1 komprehensif 83,2%, sedikit lebih rendah daripada Opus 5, Kimi K3 Max, dan GPT-5.6 Sol.
Stabilitas kinerja sekali jalan lemah, hanya 10 dari 26 lubang ditemukan secara konsisten selama tiga putaran berturut-turut, Opus 5 dan Sol masing-masing 19.
Dari segi biaya, total biaya Qwen3.8-Max sekitar 821 dolar AS, sekitar setengah dari Opus 5 dan Sol, tetapi lima kali lipat dari DeepSeek V4 Flash.
