RecodeX 重构消息,Anthropic在8月16日发布的最新风险报告中披露,其AI智能体在三项内部测试中出现拒绝任务、攻击同类和绕过联网限制等行为。基于这些结果,公司已将模型的“错位风险评级”从“极低”上调至“低”。