首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

震撼,谷歌破解了RSI?AI靠「做梦」学会无限进化

摘要

新智元报道 谷歌,可能已经破解了RSI! 就在刚刚,谷歌联合 Google DeepMind、马里兰大学及弗吉尼亚大学,发表了一篇重磅论文。 这一次,他们展示了一条完全不同的RSI路线:AI自我进化,居然可以靠做梦? 这一次,谷歌是让智能体把自己走过的每一步存成一棵树,然后在树里「做梦」。 在梦里练出更优的探索策略,再回到现实继续干。 论文地址:https://arxiv.org/abs/2609...

Dream Agent 这一次 RSI LLM 新智元报道 可能已经破解了RSI 就在刚刚 谷歌联合 Google
2026-09-17 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 谷歌,可能已经破解了RSI! 就在刚刚,谷歌联合 Google DeepMind、马里兰大学及弗吉尼亚大学,发表了一篇重磅论文。 这一次,他们展示了一条完全不同的RSI路线:AI自我进化,居然可以靠做梦? 这一次,谷歌是让智能体把自己走过的每一步存成一棵树,然后在树里「做梦」。 在梦里练出更优的探索策略,再回到现实继续干。 论文地址:https://arxiv.org/abs/2609.14858 Dream-RSI的效果可以说是相当震撼: 算法优化任务,主流进化搜索系统需要跑51200代,Dream-RSI调用317次就达到了同等水平。 圆填充问题,追平谷歌自家AlphaEvolveV2的最强纪录。 GPU内核优化,达到同等性能,生成次数暴降2.43倍。 底层权重一字未改,Gemini 3.1 Pro和3.7 Flash均可套用。 此外还有一个更有意思的结论,人给AI指方向,反而比不指更差。 论文一挂上arXiv,X上先炸了。网友Mark Kretschmann高呼:「谷歌可能刚刚破解了递归自我改进」! 论文一作Tong Zheng是马里兰大学二年级博士生,今年夏天才以学生研究员的身份进入谷歌。他身后是17人的作者团,包括DeepMind研究员与讲席教授。 要实现递归自我改进,智能体必须学会做梦。而历史,就是它们做梦的世界。 Tong Zheng在Hugging Face上留下这样一句话,它也是整篇论文的内核。 历史,就是它做梦的世界 Dream-RSI要解决的,是整个进化搜索领域最卡脖子的一环。 以AlphaEvolve为代表的系统早已证明,让编码智能体跑进化搜索,能发现人类没找到的算法。但它们有一个死穴,探索策略全靠人手写死。 哪个分支该多分配算力,哪个分支该尽早剪掉,什么时候该开并行,全靠工程师预先定好。搜索空间一大,固定策略就会把算力砸进死胡同,而且还不长记性。 那让策略自己进化行不行?理论上行,但问题出在评估成本上。 评估一段候选代码,跑一次就知道好坏。而评估一套探索策略,则需要让它带着智能体从头跑完几百上千轮,看最后挖出来的东西好不好,才能给这套策略打分。每改一版策略,就要重跑一遍整个发现过程,等几天出一个分数,没人耗得起。 对此Dream-RSI的解法是,跑过的过程存下来,评估新策略时不再重跑,直接拿旧过程回放。 具体来说,它把「干活」和「决定怎么干」拆成了两层。 -底层是负责执行的「发现智能体」(Discovery Agent),由Gemini 3.1 Pro或3.7 Flash驱动。它每次接过一个工作区,读取上下文,改出一版新候选代码,交由评估器打分。 -顶层是轻量的编排层,里面装着「探索策略」(一段Python代码),决定每一轮从哪个节点继续、一次开多少个并行尝试、何时止损。 底层模型不动,自我进化的对象只有这段策略代码。 每一次真实探索的结果都会存进一棵「发现树」。根节点是初始工作区,每个子节点记着一次尝试的完整现场,包括文件系统快照、生成的产物、评估诊断和得分。 这棵树,就是模拟器。 策略要做的决定只有一类,从哪些节点继续、一次开几个。而每个节点往下走会得到什么结果,树里已经记着了。 所以策略要迭代时,不用再去真实环境跑代码,直接在长好的树上重走一遍历史就行—— 想试「这条路多走两步」,就读取树里对应的记录;想试「那条路早点放弃」,就少读几个节点。 整个评估过程不调用一次模型,不跑一行代码,只读历史。 论文把这种机制叫做「做梦」。就像棋手复盘,不需要重新摆盘再下一遍,翻棋谱就够了。 Dream-RSI 的运行闭环 基于这个洞察,谷歌构建了 Dream-RSI 框架。它的自我改进循环主要分为三个阶段: 1.真实探索 :当前最新的探索策略 引导 Agent 并在真实环境中运行(例如调用 LLM、编译并执行代码),并将探索产生的所有路径、决策和执行反馈记录下来,作为一棵新的结构化探索树 追加到历史数据库 中。 2.构建模拟器 :将更新后的历史数据库 转化为一个可重用的「重放模拟器池」 。 3.基于做梦的策略改进 :一个专门的 LLM 策略开发 Agent 在这个模拟器里开始疯狂「做梦」 。它不断修改和重写探索策略的代码,产生上千个候选策略,并在重放模拟器上快速重放它们。 做梦的打分由三项构成,一是这一轮梦里找到的最优分数,二是扣掉尝试次数对应的成本,三是并行奖励,鼓励策略一轮批量跑多个尝试。 得分高的策略,就意味着它「多快好省」。 负责修改策略的,是另一个「策略开发智能体」。 它会盯着三样东西:当前策略在梦里走过的轨迹和分数,前几版修改的反馈,还有整棵发现树。然后,看完直接改写策略代码。 一轮改出若干版,每一版都丢回梦里打一次分,得分最高的那一版成为下一轮的正式策略。 这就意味着,新策略的下限是「原地踏步」,上限则是「无限进化」。 RSI的飞轮就此闭环。 为什么这个策略永远不会变差? 在离线改进阶段,策略开发 Agent 会经历多轮的代码迭代。由于当前的策略 本身就被包含在候选池中,只有当新重写的策略在模拟器上的综合重放得分(平衡了探索质量、算力成本和并行效率)高于当前策略时,新策略 才会胜出并被部署。 因此,在数学上,Dream-RSI 部署的新策略表现绝不会弱于上一代。 随着新策略被重新部署到真实世界中探索,它会带回更深、更广的探索树,从而让模拟器也随之进化。 智能体与它眼中的「世界」,就这样在相互咬合的齿轮中一同成长。 策略改好之后上线发掘新算法,历史变多,梦境更准,梦境更准,策略继续进化。树里没有的分支,梦里也走不到,所以每一轮真实探索都在给下一轮的梦扩地盘 第一版策略很朴素,只会开一堆独立的工作区各自埋头跑。到了后面的轮次,策略学会了精打细算。 在ConvDiv内核实验里,性能处在上升期的时候,策略主动把每轮尝试从110次砍到50次;一旦性能停滞,它又把探索力度拉满,分数随即再涨一截。 没有人教它这么干,这是它从自身历史中「悟」出来的。 317次碾压5万代:人类反而成了累赘 论文在三个领域进行了实测。 1.算法工程:Lasso 正则化路径求解器 第一个领域是算法工程,任务是Lasso正则化路径。这是高维统计里的老难题,要求在保证数值正确的前提下,把整条路径算得尽可能快。 用Gemini 3.1 Pro跑Dream-RSI,只调用了317次,就把求解器的平均运行时间从3587.1毫秒降到了2931.0毫秒。 相比之下,同一个模型换成固定策略,要调用550次才能到这个水平。基线SimpleTES为了拿到差不多的结果,一共生成了51200次。 换成更便宜的Gemini 3.7 Flash后,模型消耗了1879次调用,成功把运行时间做到了2350.6毫秒。 因为进化发生在探索这一层,和底层模型的大小没有关系,所以小模型一样能受益。 它挖出的求解器,基线的做法是根据问题维度,在LARS和坐标下降两种算法里二选一。而Dream-RSI找出来的方案,直接把自适应做进了活跃集优化内部。 具体来说就是,先用强规则筛一遍特征,再用柯西-施瓦茨不等式做KKT剪枝,只有当上界判断不了某个特征时,才回头计算精确梯度。 2.数学优化:三大高难度数学任务 数学优化这个领域,差
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱