RecodeX 重构消息,一项针对AI护栏的测试显示,七款开放权重模型的判定准确率介于36%至72%之间。测试还发现,当选项标签具有误导性时,四款模型的“失效开放”(fail-open)比例最高达到100%,即在应当拦截的情况下未能拦截。