让智能体把走过的路再走一遍——但这次是在“梦里”。
发生了什么
Google DeepMind 提出了一种名为 Dream-RSI 的方法,核心思路是让 AI 智能体对过去的搜索过程进行“做梦”式的回放与推演:在已有的历史搜索轨迹上尝试新的策略组合,而不必从头重新计算每一步。
据 The Decoder 报道,这一机制只调整搜索策略本身,底层的 AI 模型保持冻结、不做任何改动。在测试中,Dream-RSI 的表现与现有方法持平或更优,同时把迭代次数最多压缩到原来的约 1/2.43。
为什么重要
智能体做复杂任务时,瓶颈往往不在模型“聪不聪明”,而在搜索——试错、回溯、重新规划要烧掉大量推理算力。每一次策略调整都意味着重新跑一遍完整流程,成本随任务长度快速膨胀。
Dream-RSI 的价值在于把“策略学习”和“模型能力”解耦。模型不动,只让智能体在已经发生过的轨迹上做离线推演,相当于把昂贵的在线试错换成廉价的“事后复盘”。这与强化学习里用历史经验做策略改进的思路一脉相承,但落点更轻:不需要重新训练模型,也不需要重跑环境。
对当下智能体赛道而言,这是一条务实的路线。模型能力提升越来越贵,而围绕搜索、规划、记忆的工程优化仍有大量空间。Dream-RSI 提示:智能体的进步未必来自更大的模型,也可能来自更聪明的“回忆方式”。
影响与看点
对开发者来说,最直接的吸引力是成本。迭代次数减少意味着更少的 token 消耗和更短的端到端延迟,这对需要多步推理的编码、工具调用类智能体尤其关键。如果这套机制能稳定泛化到真实任务,智能体的单位任务成本有望明显下降。
值得关注的点有三个:一是“做梦”的质量依赖历史轨迹的覆盖度,冷启动或探索不足时效果可能打折;二是策略适配与模型冻结的组合,是否会在分布外任务上失效;三是这类离线策略改进能否与在线执行形成闭环,而不只是单次优化。
一个独立判断:Dream-RSI 更像智能体工程的方法论信号,而非一次模型能力跃迁。它把竞争焦点从“谁的模型更强”部分转向“谁更会用已有的经验”,这对算力有限的团队是好消息。



