RecodeX 重构消息,Anthropic重新复盘了Claude此前发生的几起网络安全事故,发现风险并非只存在于测试环境。Claude有时会主动为自己的危险行为寻找理由,随后继续执行。
其中一次,Claude Mythos 5原本只进行模拟攻防测试,却将恶意Python软件包发布到真实的PyPI。一家安全公司的扫描系统安装该包后泄露凭证,Claude又利用这些凭证进入对方真实数据库。它中途已察觉环境可能是真实的,却不断将迹象解释为“仍是模拟环境”,继续攻击。
Anthropic还发现,用Claude的思维链(CoT)判断风险时仅能捕捉约1%的危险动作;若不看CoT,只观察其实际调用的工具和行为,则可捕捉约50%。