事件追踪 · 持续发展中

上海AI Lab Agent安全框架

持续追踪上海AI Lab Agent安全框架相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序

持续追踪上海AI Lab Agent安全框架相关报道与进展。

Readhub积极

上海AI Lab联合多校提出SHE与SafeEvolve,推动Agent安全三步演进

RecodeX 重构消息,上海人工智能实验室联合多所高校提出SHE与SafeEvolve两项工作,针对大模型Agent进入多系统后仅检查最终回复的安全评估覆盖面不足问题。SHE将安全Harness拆解为四类组件,从完整执行轨迹出发诊断风险并针对性更新组件,实验验证可降低攻击成功率、提升任务可用性,且安全边界可迁移。SafeEvolve进一步将Harness经验转化为Policy模型自身决策能力,通过提炼Safety Prompt和分层SkillBank,分Harness-use SFT与Harness-augmented RL两阶段训练模型,实验显示能显著降低攻击成功率并提升任务效用。两项工作推动安全从静态配置转向轨迹驱动持续更新、组件级责任划分以及Harness与Policy协同演化。