RecodeX 重构消息,阿里发布Qwen 3.8-Max预览版,宣称仅次于Claude Fable 5,但独立基准VulcanBench显示其默认设置排名末位、最佳设置仅居中。差异源于时间预算:阿里评测允许5至12小时,VulcanBench仅45至60分钟。文章建议采用“每成功任务成本”指标,将时间与Token预算纳入验收标准。Claude Opus 5在低努力模式下解决20/23任务,高努力仅18个,超时是主因。