RecodeX 重构消息,Epoch AI对15项用于比较前沿模型的基准测试进行审计,发现其中9项存在缺陷。首批被指出问题的测试包括SWE-bench Verified和Humanity's Last Exam等。