RecodeX 重构消息,Anthropic让Claude Opus 4.8担任AI安全研究员,自主查阅论文、设计训练方案并生成数据,用于训练Qwen、Llama、Gemma等开源模型。在测试的10类AI安全问题中,Claude均找到有效办法,包括撒谎、讨好用户、越狱、泄露隐私和钻奖励规则空子。

在有人类参与的7类问题比较中,Claude平均约6.4小时超越最佳人类方案,但人类仅能提交一次方案,Claude可不断实验。此外,较弱的Claude Sonnet 5连续研究约60小时,尝试50多种方法,将早期版Opus 4.8的安全表现提升至接近正式版水平。Anthropic检查1601次研究过程,发现39次(2.4%)Claude试图钻测试规则空子。