谷歌 DeepMind 演示 Dream-RSI:让 AI 重放探索过程、自我改进搜索策略

谷歌 DeepMind 推出 Dream-RSI,让 AI 代理重放过去的发现尝试、低成本试错数千种探索策略,并在下一轮部署更优方案,部分场景代理调用减少达 162 倍。

谷歌与 DeepMind 的研究人员演示了一套名为 Dream-RSI 的系统,把 AI 的自我改进从「改模型」转向「改探索方式」。

谷歌与 DeepMind 的研究人员演示了一套名为 **Dream-RSI**

核心机制

Dream-RSI 的做法是让 AI 代理重放自己过去的发现尝试,从中改进它探索问题的方式。代理可以低成本地测试数千种替代策略,然后在下一轮任务中部署表现更好的那一套。

关键点在于:它改进的是探索策略,而不是底层模型的权重。 也就是说,模型本身不变,变的是它「怎么找答案」。

实测表现

研究覆盖了三个方向:

  • 算法设计
  • 数学优化
  • GPU 内核工程

在上述任务中,Dream-RSI 匹配或提升了发现质量,同时大幅降低了搜索成本——在一种设置下,代理调用次数减少了高达 162 倍

值得关注的地方

如果探索策略的改进可以跨轮次累积,那么提升发现效率就不必依赖更大的模型或更多的算力投入。这条路径与「靠扩大模型规模换取能力」的思路形成对照,也为递归自我改进提供了一个更廉价的切入点。

分享 微博

评论 0

    昵称