谷歌发布Dream-RSI论文:用历史搜索树做虚拟推演优化AI探索策略
RecodeX 重构消息,谷歌研究人员公开一篇关于AI自我进化(RSI)的论文,提出Dream-RSI框架。该方法不重新训练模型、也不直接修改权重,而是把Agent真实探索留下的历史记录视为一个模拟世界:一次真实探索结束后,Agent可在已有的发现树(Discovery Tree)中虚拟推演新搜索策略,找到更优策略后再回到真实环境执行,由此循环扩大搜索树。
在算法工程、数学优化和GPU内核工程三类共8个发现任务上,Dream-RSI大幅降低探索计算成本,效果达到甚至超越原有方案。以Lasso regularization path为例,Gemini 3.1 Pro下固定探索消耗550次Agent调用、平均运行时间3587.1ms,Dream-RSI为317次调用、2931.0ms;与SimpleTES相比,部分设置下调用量差距最高达162倍。研究还发现,把过往经验教训显式写入下一轮Prompt反而普遍降低表现。