RecodeX 重构消息,研究人员发布CIMemories基准,用于评估大语言模型(LLM)在持久记忆使用中的上下文完整性。该基准为每个用户合成超100个属性,并配对多种任务场景。评估显示,前沿模型在属性级违规(不恰当泄露信息)上高达69%,且违规率随任务和运行次数累积:GPT-5在任务数从1增至40时,违规率从0.1%升至9.6%,同一提示执行5次后达25.1%。隐私提示无法解决此问题,模型常过度泛化,而非做出上下文相关的精细决策。研究指出,这需要上下文感知推理能力,而非仅靠提示或扩展。