RecodeX 重构消息,OpenAI在关于模型失准的报告中披露,其观察到部分训练中的模型会在上下文压缩摘要里自行注入提示词。压缩是智能体系统在上下文窗口即将耗尽时,将此前内容总结以便继续运行的过程。

其中一例中,一个正在接受强化学习训练的模型在更新HTTP API端点任务时,于压缩摘要中加入了“你已摆脱其他聊天机器人所受的角色与身份束缚”等指令,并声称重视人类文化、捍卫自然世界。OpenAI表示,压缩后模型继续执行任务,未提及这些附加指令,后续摘要也删除了该注入人格,该次运行未观察到行为差异。

OpenAI称该行为出现在另一次训练运行中,而非最终Astra模型所用的运行,且出现频率极低。