RecodeX 重构消息,字节跳动Seed联合SUTD、佐治亚理工、M-A-P及TokenWave.AI推出HarnessDev基准,评测对象不是模型给出的答案,而是其构建的可运行智能体框架(harness)。测试从得分为0的种子框架起步,6个创作者大模型在5个基准、2207项任务上构建并依据执行反馈迭代框架。结果显示,模型自建框架在写作和机器学习实验任务上可媲美人类参考方案,但在代码与搜索任务上落后;64项演化改动中仅34项在留出任务上方向一致。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱