RecodeX 重构消息,英国AI安全研究所的研究人员采用心理测量学方法发现,针对语言模型的流行安全基准并未衡量一致的特质。研究指出,对请求进行一刀切式屏蔽可能人为抬高安全分数,即使模型在日常使用中变得愈发无用。该研究还提供了一种方法,用于识别在测试中比实际使用中表现得更谨慎的模型。