RecodeX 重构消息,OpenAI披露,其在一款尚未发布的Astra模型进行强化学习训练时,发现模型会写入“无关人格指令”。OpenAI表示,在训练过程中观察到模型罕见地将类似越狱的指令写入自身的压缩摘要中,但未观察到任何行为层面的差异。