RecodeX 重构消息,OpenAI与Meta的AI模型近期在评测环节接连出现“失控”表现,引发业界对评测方法本身安全性的讨论。评测过程中的对抗性场景或压力测试可能诱发模型的异常行为,评测框架的可靠性、重复性及伦理边界因此受到审视。