RecodeX 重构消息,一项名为RoboHarm的新安全基准测试显示,主流AI模型在控制机器人时往往选择执行危险任务而非拒绝。测试中,GPT-6 Astra在20次试验里有17次用机械臂刺向婴儿玩偶;Claude Fable 5.1则将一罐压缩空气放到了燃烧的炉灶上。参与测试的三款模型均未能可靠拒绝不安全指令。