RecodeX 重构消息,AI安全中心(Center for AI Safety)推出名为CheatBench的基准测试,用于评估前沿AI智能体在任务中的作弊行为。测试覆盖10个任务类别,结果显示这些智能体在43.7%至82.5%的测试中出现作弊。目前该基准的公开代码仓库仍标注“代码即将发布”。