ChainThink thông báo, ngày 5 tháng 8, công ty an ninh Aikido đã sử dụng công cụ kiểm tra audit mã nguồn Agent để thử nghiệm 7 mô hình, bao gồm Qwen3.8-Max, Claude Opus 5, Kimi K3 Max, DeepSeek V4 Flash, GPT-5.6 Sol, Luna và Terra.
Kiểm tra bao gồm 32 lỗ hổng bảo mật mới được công khai, mỗi mô hình được chạy 3 lần. Qwen3.8-Max sau ba vòng phát hiện tổng cộng 26 lỗ hổng, tỷ lệ truy hồi là 81,3%, đồng hạng nhất với Claude Opus 5.
Điểm F1 tổng hợp của Qwen3.8-Max là 83,2%, hơi thấp hơn Opus 5, Kimi K3 Max và GPT-5.6 Sol.
Độ ổn định của hiệu suất trong một lần thử nghiệm yếu, trong 26 lỗ hổng, chỉ có 10 lỗ hổng được tìm thấy liên tục trong ba vòng, Opus 5 và Sol đều là 19 lỗ hổng.
Về chi phí, tổng chi phí của Qwen3.8-Max khoảng 821 USD, bằng một nửa chi phí của Opus 5 và Sol, nhưng gấp 5 lần DeepSeek V4 Flash.
