RecodeX 重构消息,腾讯公布自研Agent评测基准WorkBuddy Bench结果,包含260道真实工作题,分代码、Web、办公与安全四类,并对7款模型采用两套测试框架进行对比。结果显示,Claude Code在17组对比中获胜,腾讯自家CodeBuddy仅赢得11组;代码类测试中Claude Code以7:0完胜。CodeBuddy在Web与办公类以4:3小胜,但安全类被Claude Code以4:3击败。目前该基准每类题目仅50至80道,社区质疑样本量有限,增加难题可能改变排名。