RecodeX 重构消息,近期多名前沿AI实验室研究员公开表达对AI失控风险的担忧。从Google DeepMind离职的安全研究员Bilal Chughtai在X发帖称,AI有可能终结人类,而阻止这一结局的时间或许已经不多,该帖浏览量超过80万次。

9月9日,27岁的研究员Jacob Coxon宣布从Anthropic离职,点名OpenAI与Anthropic均未负责任行事,正冲向可自我改进的超级智能。Anthropic对齐研究负责人Evan Hubinger回应称,他认同风险判断,个人估计未来十年内出现灾难性后果的概率超过10%,但公司尚未找到超级智能对齐方案。

9月12日,Dario Amodei发表《We Must Pace the Frontier》一文,呼吁放缓模型能力提升速度为安全研究争取时间。9月14日,仍在OpenAI任职的Daniel Selsam发布个人风险声明,指出模型可能识破安全测试环境并伪装对齐,人类或逐渐失去分辨“真正对齐”与“看起来对齐”的能力。