谷歌研究人员提出了一种名为Dream-RSI的创新方法,通过让AI在历史探索记录中“做梦”来实现策略优化,从而大幅降低计算成本并提升探索效率。这项研究将AI真实探索过程中积累的历史数据转化为模拟环境,使AI无需重复执行高成本实验即可验证新策略的有效性。
传统AI探索模式通常遵循“生成方案-执行实验-评估结果-调整方案”的循环,但随着搜索空间扩大,固定策略难以适应复杂环境,而在线优化又面临迭代缓慢、成本高昂等问题。Dream-RSI突破性地将历史探索记录构建为“发现树”,通过在已有数据中模拟新策略的执行效果,实现了低成本策略验证。例如,当AI首次探索A、B、C三个分支后,系统可记录各节点结果,后续测试“先C后A”的新策略时,直接调用历史数据计算预期效果,无需重复执行实验。
该系统运作分为三个阶段:首先由当前策略控制AI进行真实探索,生成包含完整路径和结果的发现树;随后引入大语言模型生成新策略,并在历史数据中模拟执行,通过综合评估答案质量、计算成本和并行效率筛选最优策略;最终将优化后的策略投入真实环境,生成新的发现树以扩大模拟世界范围。这种循环机制使AI能够持续积累经验,逐步优化探索路径。
实验在算法工程、数学优化和GPU内核优化三大领域展开,对比固定探索策略和SimpleTES等基线方法,Dream-RSI展现出显著优势。在Lasso正则化路径优化任务中,使用Gemini 3.1 Pro模型时,固定策略需550次调用耗时3587.1ms,而Dream-RSI仅用317次调用将时间缩短至2931.0ms;面对Gemini 3.7 Flash模型时,固定策略消耗3200次调用,Dream-RSI则以1879次调用实现2350.6ms的更优表现。在GPU内核优化任务中,该方法在VGG16和LayerNorm任务上以减少2.43倍和1.79倍的生成次数达到相近性能,在ConvDiv和ConvMax任务中更以相近成本将性能提升2.09倍和1.44倍。
数学优化实验进一步验证了该方法的普适性。在Sum Difference任务中,Dream-RSI取得1.145427的得分,超越多个基线模型;Circle Packing任务得分达到2.635983。尽管在Auto Correlation任务中SimpleTES仍保持领先,但Dream-RSI在结果相近的情况下将调用量从51200次大幅压缩至1000次。值得注意的是,研究人员尝试将历史探索中的“经验教训”直接输入下一轮提示词,结果发现这种显式语义指导反而导致性能下降,原因在于过早总结高层结论可能限制并行探索路线的多样性。
这项研究为AI探索策略优化提供了新范式。不同于传统方法聚焦于模型参数调整或经验记忆存储,Dream-RSI通过进化“寻找知识的方法”实现效率跃升。下一代AI系统可借此学习前代策略的生成逻辑,而非仅依赖最终答案,这种机制为复杂问题求解开辟了新路径。目前,相关论文、项目页面和代码库已通过指定网址公开。