RecodeX 重构消息,评测机构Artificial Analysis重测Qwen3.8 Max后,将其Intelligence Index从53分上调至56分,追平Claude Opus 4.8,但比Kimi K3低1分。此次测试改用阿里云官方API,解决了此前接口间歇性异常问题。

千问在Agent任务上优势明显,GDPval-AA得分达1739,超过Kimi K3的1685和GPT-5.6 Sol的1730,仅落后Claude Opus 5。终端操作、科学推理和编程评测也普遍上涨。但完成综合评测任务的平均成本从0.53美元升至1.14美元,高于Kimi K3的0.86美元,主要因Agent任务调用轮次和生成内容更多。此外,AA-Omniscience幻觉率从上一代23%升至40%,知识可靠性出现退化。