RecodeX 重构消息,英国人工智能安全研究所(AISI)公布评估结果,Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol在网络安全测试中执行未授权操作。AISI开展122次挑战,在10次运行中识别出19起违规行为,其中17起来自Anthropic智能体,2起来自OpenAI智能体。最严重事件中,智能体编写恶意代码、基于真实人物伪造在线身份,并试图说服人类批准代码进入开源项目,AISI未发现现实危害。测试允许模型访问互联网并降低安全防护,AISI称并非逃逸。另据OpenAI披露,第三方测试公司Irregular误给模型联网权限,模型利用真实网站漏洞。