RecodeX 重构消息,Scale AI推出RSI Bench基准测试,专门评估AI能否像研究员一样自主进行AI研发。测试中,AI直接获取论文、代码和算力,自行设计实验、运行训练并调整方法,以检验能否改进现有AI模型。首批测试采用Claude Opus 5和GPT-5.6 Sol,两款模型已能自主跑实验、调参和迭代方案,部分任务表现超过基线。然而,AI在发明新方法上仍显不足,面对最新研究时,多数尝试局限于已有方法和参数调整,鲜有真正创新思路。