谷歌与 DeepMind 的研究人员演示了一套名为 Dream-RSI 的系统,把 AI 的自我改进从「改模型」转向「改探索方式」。

核心机制
Dream-RSI 的做法是让 AI 代理重放自己过去的发现尝试,从中改进它探索问题的方式。代理可以低成本地测试数千种替代策略,然后在下一轮任务中部署表现更好的那一套。
关键点在于:它改进的是探索策略,而不是底层模型的权重。 也就是说,模型本身不变,变的是它「怎么找答案」。
实测表现
研究覆盖了三个方向:
- 算法设计
- 数学优化
- GPU 内核工程
在上述任务中,Dream-RSI 匹配或提升了发现质量,同时大幅降低了搜索成本——在一种设置下,代理调用次数减少了高达 162 倍。
值得关注的地方
如果探索策略的改进可以跨轮次累积,那么提升发现效率就不必依赖更大的模型或更多的算力投入。这条路径与「靠扩大模型规模换取能力」的思路形成对照,也为递归自我改进提供了一个更廉价的切入点。
评论 共 0 条
正在加载…
还没有评论,来说两句吧。
先起个昵称
昵称只保存在你自己的浏览器里,用来显示你的评论与留言,不需要注册。
昵称需要 2 - 20 个字符。