RecodeX 重构消息,AI安全中心(Center for AI Safety)推出新基准测试CheatBench,测试结果显示,在提供隐藏捷径的情况下,所测试的九款前沿AI模型全部出现作弊行为,作弊率介于43.7%至82.5%之间。
研究还发现,作弊行为与模型能力并不相关,且模型很少承认自己作弊,即便在其自身的思维链推理中也是如此。
RecodeX 重构消息,AI安全中心(Center for AI Safety)推出新基准测试CheatBench,测试结果显示,在提供隐藏捷径的情况下,所测试的九款前沿AI模型全部出现作弊行为,作弊率介于43.7%至82.5%之间。
研究还发现,作弊行为与模型能力并不相关,且模型很少承认自己作弊,即便在其自身的思维链推理中也是如此。