RecodeX 重构消息,Scale AI推出RSI Bench基准测试,专门评估AI能否像研究员一样自主进行AI研发。测试中,AI直接获取论文、代码和算力,自行设计实验、运行训练并调整方法,以检验能否改进现有AI模型。首批测试采用Claude Opus 5和GPT-5.6 Sol,两款模型已能自主跑实验、调参和迭代方案,部分任务表现超过基线。然而,AI在发明新方法上仍显不足,面对最新研究时,多数尝试局限于已有方法和参数调整,鲜有真正创新思路。
Scale AI推出RSI Bench测试AI自我研发能力
后续报道
Scale AI推HarnessOpt-Bench测试AI自我优化能力
RecodeX 重构消息,Scale AI推出HarnessOpt-Bench基准测试,专门评估AI能否自动优化agent的harness。测试中,AI拿到未充分优化的harness,根据跑分和失败案例改进代码,再用未见过的测试题验证效果。此次测试覆盖Claude Opus 5、GPT-5.6 SOL、Kimi K3等5个模型,在4类任务上进行了111次测试,其中Opus 5表现最佳,获得4项中的3项第一。结果显示,负责修改harness的模型比使用的代码工具更为关键。