RecodeX 重构消息,Snorkel AI推出名为LibraryDesignBench的基准测试,用于评估AI智能体能否构建出其他智能体可复用的代码库。该测试由Gabriel Orlanski主导,通过242道编程问题,从生成库的正确性与下游代码的简洁性两个维度进行评分。