🎯 事件追踪 · 持续发展中

Harness Evolution评估研究

持续追踪Harness Evolution评估研究相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序
🎯

持续追踪Harness Evolution评估研究相关报道与进展。

投资界中性

字节Seed等提出Self-Developing Agents三项新基准

RecodeX 重构消息,字节跳动Seed、TokenWave等机构研究者提出Self-Developing Agents研究方向,并发布ASPIRE、S³Gym和HarnessDev三项基准,分别研究Agent如何从模糊目标中学习、能否从经验中学习,以及执行系统(Harness)改进能否保留。

ASPIRE包含6个能力目标、520道专家编写的隐藏评测题及48对“模糊目标/明确任务”匹配运行;实验中30个单元仅1个增益被保留,LoRA使用率从24.1%升至89.8%。S³Gym在七个文字游戏中研究自我测试、自我判断与自我改进,发现自我判断准确度与后续收益关联很弱。HarnessDev则显示,开发阶段的正向反馈未必迁移到隐藏任务,部分系统修改因破坏原有功能被回滚。

🎯

持续追踪Harness Evolution评估研究相关报道与进展。

投资界中性

AI2与华盛顿大学研究:Harness Evolution未稳定胜过简单多次采样

RecodeX 重构消息,AI2与华盛顿大学联合发布论文《Rethinking the Evaluation of Harness Evolution for Agents》,在Terminal-Bench 2.1上对比了四种使用五次推理预算的方式。实验使用Claude Opus 4.6、GPT-5.4和GPT-5.4 mini,均从仅含bash工具、无Skills、无Middleware、无持久化Memory的简单Harness出发。

在移除单元测试、缺乏可靠外部反馈的条件下,初始简单Harness平均得分68.2;Parallel Sampling提升至72.3,Sequential Refinement为69.3,Harness Scaling为71.8,而采用AHE实现的传统Harness Evolution仅为67.4,未超过初始水平。研究还发现,进化出的Harness迁移到未参与优化的新任务时,提升仅剩很小一部分。