RecodeX 重构消息,评测机构ArtificialAnalysis对Qwen3.8Max进行重测,将其Intelligence Index从53分上调至56分,追平Claude Opus 4.8,但仍比Kimi K3低1分。此前测试因接口异常导致结果偏差,本次改用阿里云官方API重新评测。千问在Agent任务上进步显著,GDPval-AA得分达1739,超过Kimi K3的1685和GPT-5.6 Sol的1730,仅落后Claude Opus 5。终端操作、科学推理和编程评测均有提升。不过,更高性能伴随更高成本:完成一项综合评测任务的平均成本从0.53美元升至1.14美元,高于Kimi K3的0.86美元,原因是Agent任务中调用轮次更多。此外,其知识可靠性出现下降,幻觉率从23%升至40%。