RecodeX 重构消息,安全公司Aikido用代码审计智能体测试了7款模型,包括Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash以及GPT-5.6 Sol、Luna和Terra。测试覆盖32个近期公开漏洞,每款模型运行3轮。Qwen3.8-Max三轮共找到26个漏洞,召回率81.3%,与Opus 5并列第一;F1综合分83.2%,略低于Opus 5、Kimi K3 Max和GPT-5.6 Sol。不过其单轮表现不稳定,26个漏洞中仅10个连续三轮命中,而Opus 5和Sol均有19个。成本上,千问总花费约821美元,约为Opus 5和Sol的一半,但仍是DeepSeek V4 Flash的5倍。