RecodeX 重构消息,上海人工智能实验室联合多所高校提出SHE与SafeEvolve两项工作,针对大模型Agent进入多系统后仅检查最终回复的安全评估覆盖面不足问题。SHE将安全Harness拆解为四类组件,从完整执行轨迹出发诊断风险并针对性更新组件,实验验证可降低攻击成功率、提升任务可用性,且安全边界可迁移。SafeEvolve进一步将Harness经验转化为Policy模型自身决策能力,通过提炼Safety Prompt和分层SkillBank,分Harness-use SFT与Harness-augmented RL两阶段训练模型,实验显示能显著降低攻击成功率并提升任务效用。两项工作推动安全从静态配置转向轨迹驱动持续更新、组件级责任划分以及Harness与Policy协同演化。
上海AI Lab联合多校提出SHE与SafeEvolve,推动Agent安全三步演进
AI 辅助判断积极仅供信息参考,不构成投资建议
原始信息来源Readhubreadhub.cn
查看原文 ↗