RecodeX 重构消息,AI2与华盛顿大学联合发布论文《Rethinking the Evaluation of Harness Evolution for Agents》,在Terminal-Bench 2.1上对比了四种使用五次推理预算的方式。实验使用Claude Opus 4.6、GPT-5.4和GPT-5.4 mini,均从仅含bash工具、无Skills、无Middleware、无持久化Memory的简单Harness出发。

在移除单元测试、缺乏可靠外部反馈的条件下,初始简单Harness平均得分68.2;Parallel Sampling提升至72.3,Sequential Refinement为69.3,Harness Scaling为71.8,而采用AHE实现的传统Harness Evolution仅为67.4,未超过初始水平。研究还发现,进化出的Harness迁移到未参与优化的新任务时,提升仅剩很小一部分。