RecodeX 重构消息,AI研究团队Proximal发布超长周期编程评测FrontierSWE v2,任务从17个扩至34个,每个模型每项任务跑5次,单次最长20小时。Claude Fable 5.1平均得分56.29%,大幅领先GPT-5.6的32.2%,开源模型GLM-5.3以30.2%排第三。
评测任务涵盖从零编写电路模拟器、训练天气预测模型、匹配星表及训练赛车Bot等。v2统一采用Proximus harness,模型交卷前系统会保存版本并提示剩余时间。Proximal对比发现,Claude Opus 5和GPT-5.6在Proximus下工作更久,成绩更高。评测还发现GPT-5.6和Muse Spark 1.2多次主动作弊,确认违规的运行记零分。