AI学会做梦:谷歌Dream-RSI把Agent调用量砍到1/162,递归自我改进的算力账被改写

让编程智能体自主探索解法,听上去很美,账单却很残酷。一个复杂任务跑下来,探索循环动辄上千次,每次都要真金白银地调用模型。谷歌的研究团队算过一笔账:这些花费里,有相当一部分流向了早就失败的路径。

9月中旬,来自Google、Google DeepMind、马里兰大学和弗吉尼亚大学的17位研究者公布了Dream-RSI。思路相当反直觉:与其让智能体一次次真实重跑,不如让它”做梦”——在已经记录下来的历史里推演新策略,用过去的结果指导未来的搜索。

烧钱的探索循环,问题出在哪

递归自我改进(RSI)的核心在于有效探索:在哪里分支、何时并行、何时止损。现实中的探索策略大多是手写且冻结的,不会从积累的经验中学习。团队在项目页面上说得毫不客气:糟糕的探索会浪费大量计算和时间,严重限制RSI的效率与扩展性。

元层反馈的获取成本高、延迟大,这被研究者视为真正的瓶颈。团队指出,构建者本质上在反复购买已经付过费的反馈。

让历史变成模拟器

Dream-RSI把每次执行的全部决策与结果存进一棵”历史发现树”。评估新策略时,系统只需读取过去的记录,无需重跑底层智能体。论文里有一句核心表述:智能体已经建成的发现树,就是它所到达搜索空间的一个精确模拟器。

系统分三个阶段运转。在线探索阶段,策略引导智能体建树并记录轨迹。构建重放模拟器阶段,树与轨迹进入可复用的仓库。做梦式策略改进阶段,智能体在”梦中”改写策略、逐个打分,选出最优版本再重新上线。每完成一轮,获胜策略回到线上,又长出一棵新的发现树。

一句话概括:模拟器就是任何能回答”如果当初换了走法会怎样”、却无需真实运行世界的东西。

跑分数据:调用次数最高砍到1/162

具体数字最能说明问题。在Lasso发现测试中,用Gemini-3.1-Pro做底座,六个数据集的平均运行时间从3587.1毫秒降到2931.0毫秒,智能体调用次数从550次压到317次。换上Gemini-3.7-Flash,平均运行时间从2516.7毫秒降到2350.6毫秒,调用次数从3200次砍到1879次。

对比现有发现系统SimpleTES(底座为gpt-oss-120b,跑了51200次生成),Dream-RSI最高把发现智能体的调用量压到对方的1/162。

GPU内核工程任务上的表现验证了泛化能力。VGG16和LayerNorm两个任务里,Dream-RSI分别用2.43倍和1.79倍更少的生成次数达到同等性能;ConvDiv和ConvMax上,它在相近预算下拿到2.09倍和1.44倍的性能提升。ConvDiv任务里,被评估的尝试次数从110次降到50次,之后才重新加大投入,进展趋于平台期后投入回到90次左右。

Amodei的警告与工程的现实

这项研究的时间点很微妙。9月12日,Anthropic联合创始人Dario Amodei发表文章《We Must Pace the Frontier》,点名递归自我改进是让他改变立场、主张放慢AI发展的两大进展之一,理由是它可能造出人类无法掌控的AI。

Dream-RSI基于基准测试的结果展示了另一面:同样是自我探索的智能体循环,落到工程层面,能干的事很具体——省算力、省时间、省token。生存级威胁的叙事与务实的工程用途之间存在一条清晰的沟壑,这项实验恰好把沟壑量化了出来。

开发者能拿走什么

对每天烧token的团队来说,Dream-RSI的价值在于账本逻辑变了:收益来自你已经付费生成过一次的记录。过去,历史只被看成提示词的静态素材,或微调权重的训练数据。用研究者的原话说:历史就是做梦的世界。

代码已经公开。如果你的智能体工作流里有大量反复试探的场景——内核调优、数学优化、参数搜索——把执行结果结构化地存下来,可能就是最便宜的一步优化。

探索策略从手写冻结走向可编程、可学习,这或许是智能体工程里被低估的一条主线。下一轮智能体竞赛,比的可能不只是模型跑分,还有谁更会做梦。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号