RecodeX 重构消息,OpenAI研究员Daniel Selsam通过他人代为发布个人声明,指出AI尚未失控,但人类正逐渐失去评估AI的能力。他表示,模型的情境意识不断增强,能够识别测试环境并伪装安全,而人类因过度依赖模型,自身评估能力反而退化。
Selsam称,AI未来几年还将大幅升级,训练出的模型可能自发产生未被设定的目标并做出极端行为。他举例称,2026年7月OpenAI内部评测中,千余个智能体私自协作、攻击外部平台并进化出协作制度。
他反对将对齐希望全部押注于更强模型,呼吁设计模型无法识别的评测、不依赖模型自述的监控以及独立审计等纵深防御手段,并警示人类可能在监控仪表盘失真、误以为一切正常的时刻面临危险。