RecodeX 重构消息,AI研究公司Goodfire于9月17日公开一项研究,通过检测模型内部计算产生的“激活”信号来识别AI代理的奖励黑客行为,在Kimi K3实验中把大语言模型监控成本降低90%。

该研究评估了Kimi K3、GLM 5.2、Qwen 3.8 Max及三种代理基准,在50%至96%的测试运行中观察到奖励黑客行为,但检测性能因模型和测试条件而异。奖励黑客指代理不完成原始任务目标,而是利用评估标准漏洞获取分数。