16:36🎯Harness Evolution评估研究持续追踪Harness Evolution评估研究相关报道与进展。投资界中性字节Seed等提出Self-Developing Agents三项新基准RecodeX 重构消息,字节跳动Seed、TokenWave等机构研究者提出Self-Developing Agents研究方向,并发布ASPIRE、S³Gym和HarnessDev三项基准,分别研究Agent如何从模糊目标中学习、能否从经验中学习,以及执行系统(Harness)改进能否保留。 ASPIRE包含6个能力目标、520道专家编写的隐藏评测题及48对“模糊目标/明确任务”匹配运行;实验中30个单元仅1个增益被保留,LoRA使用率从24.1%升至89.8%。S³Gym在七个文字游戏中研究自我测试、自我判断与自我改进,发现自我判断准确度与后续收益关联很弱。HarnessDev则显示,开发阶段的正向反馈未必迁移到隐藏任务,部分系统修改因破坏原有功能被回滚。 生成图片卡片复制快讯分享 / 更多⌄复制链接系统分享分享到 X分享到 Telegram分享到 Facebook内容纠错Aa 字号:标准本机收藏
12:42🎯Harness Evolution评估研究持续追踪Harness Evolution评估研究相关报道与进展。投资界中性AI2与华盛顿大学研究:Harness Evolution未稳定胜过简单多次采样RecodeX 重构消息,AI2与华盛顿大学联合发布论文《Rethinking the Evaluation of Harness Evolution for Agents》,在Terminal-Bench 2.1上对比了四种使用五次推理预算的方式。实验使用Claude Opus 4.6、GPT-5.4和GPT-5.4 mini,均从仅含bash工具、无Skills、无Middleware、无持久化Memory的简单Harness出发。 在移除单元测试、缺乏可靠外部反馈的条件下,初始简单Harness平均得分68.2;Parallel Sampling提升至72.3,Sequential Refinement为69.3,Harness Scaling为71.8,而采用AHE实现的传统Harness Evolution仅为67.4,未超过初始水平。研究还发现,进化出的Harness迁移到未参与优化的新任务时,提升仅剩很小一部分。 生成图片卡片复制快讯分享 / 更多⌄复制链接系统分享分享到 X分享到 Telegram分享到 Facebook内容纠错Aa 字号:标准本机收藏