RecodeX 重构消息,Epoch AI与Anthropic各自独立研究得出相同结论:当前AI模型虽能执行实验,但缺乏科学自我批判能力与真正的创造性思维。在测试中,GPT-5.6 Sol最高仅达到人类参考分数的15%,且其采用的方法均为研究人员已知的方法。研究指出,模型最大的弱点仍在于无法批判性地质疑自身结果,距离自主科研尚有明显差距。