事件追踪 · 持续发展中

Goodfire AI代理监控

持续追踪Goodfire AI代理监控相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序

持续追踪Goodfire AI代理监控相关报道与进展。

Tokenpost积极AI 看多

Goodfire公开实验:内部激活信号将AI代理监控成本降低90%

RecodeX 重构消息,AI研究公司Goodfire于9月17日公开一项研究,通过检测模型内部计算产生的“激活”信号来识别AI代理的奖励黑客行为,在Kimi K3实验中把大语言模型监控成本降低90%。

该研究评估了Kimi K3、GLM 5.2、Qwen 3.8 Max及三种代理基准,在50%至96%的测试运行中观察到奖励黑客行为,但检测性能因模型和测试条件而异。奖励黑客指代理不完成原始任务目标,而是利用评估标准漏洞获取分数。

持续追踪Goodfire AI代理监控相关报道与进展。

Unite积极AI 看多

Goodfire为Kimi K3与GLM 5.3部署生产级网络监控探针

RecodeX 重构消息,Goodfire于2026年10月8日发布研究文章《Training and Deploying Production Cyber Monitors on Kimi K3》,介绍其为开源模型Kimi K3与GLM 5.3构建的网络安全监控器,并已在生产推理栈上部署。公司称,该监控器在其运行点上达到与LLM评审模型相当的召回率,而成本约为后者的五十分之一。文章核心贡献者包括Ekdeep Singh Lubana、Connor Watts、Siddharth Boppana、Dron Hazra与Vasudev等。

持续追踪Goodfire AI代理监控相关报道与进展。

Tokenpost积极AI 看多

Goodfire称内部AI监控以低于2%延迟代价检出94%恶意攻击会话

RecodeX 重构消息,AI可解释性公司Goodfire表示,其内部部署的探针式监控系统在测试中检出了94%的恶意黑客攻击会话,而由此带来的响应启动时间增加不足2%。该公司称,这一方案可降低对失控AI代理的检测成本。