RecodeX 重构消息,腾讯发布自研Agent基准WorkBuddy Bench,用260道真实工作题评估多个模型,涵盖代码、Web、办公、安全四类。测试显示,同一模型搭载Claude Code执行层(Harness)后整体表现更优:在28组对比中Claude Code赢17组,CodeBuddy赢11组;其中代码类别Claude Code以7:0全胜。Web和办公领域CodeBuddy以4:3小幅领先,安全类Claude Code以4:3获胜。腾讯指出,更换Harness可使同一模型成绩改变十余分,Agent能力不再仅取决于底层模型。但该基准题量有限,每类仅50-80题,且只对比了两套Harness,未包含Codex,社区对其稳定性存疑。
腾讯WorkBuddy Bench基准出炉:Claude Code胜自家CodeBuddy
AI 辅助判断中性仅供信息参考,不构成投资建议
原始信息来源区块律动theblockbeats.info
查看原文 ↗