RecodeX 重构消息,Meta、斯坦福、哈佛及华盛顿大学等机构的研究者联合发布一项新基准,用于测试AI在无人提示的情况下自主发现代码缺陷的能力。该基准覆盖100个代码仓库、22种编程语言,共包含4000个来自GitHub的真实缺陷。

测试结果显示,表现最好的模型Sol 5.6(xhigh)仅解决4.7%的缺陷,成本达7230美元;Luna 5.6(xhigh)解决2.5%,成本224美元;Opus 5(xhigh)解决1.3%,成本5363美元;Kimi K3仅0.6%。研究团队已将相关代码以MIT许可证开源。