首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

谷歌给RSI找到了一条捷径:做梦

摘要

文 | 字母AI AI要学会自己改进自己,谷歌打算先让它做个“梦”。 这场“梦”,瞄准的是AI行业热议的RSI,即递归自我改进:让AI改进自身,改进后的系统再继续改进自己,一轮接一轮。但这个循环有一道绕不过去的坎:换一种做事方法,究竟有没有用?如果每调整一次探索策略,都要把整轮实验重新跑一遍,AI变强的速度还不好说,算力账单倒是先涨起来了。 谷歌研究团队在新论文《Dream-RSI》中,给出了一个...

Dream RSI 数学优化 GPU内核工程 字母AI AI要学会自己改进自己 谷歌打算先让它做个 瞄准的是AI行业热议的RSI 即递归自我改进 让AI改进自身
2026-09-17 1 阅读 约10分钟阅读 字母AI
分享:
字号:
文 | 字母AI AI要学会自己改进自己,谷歌打算先让它做个“梦”。 这场“梦”,瞄准的是AI行业热议的RSI,即递归自我改进:让AI改进自身,改进后的系统再继续改进自己,一轮接一轮。但这个循环有一道绕不过去的坎:换一种做事方法,究竟有没有用?如果每调整一次探索策略,都要把整轮实验重新跑一遍,AI变强的速度还不好说,算力账单倒是先涨起来了。 谷歌研究团队在新论文《Dream-RSI》中,给出了一个思路:让AI先在“梦里”试。 所谓“做梦”,就是把过去真实执行过的实验记录变成一个可以反复回放的环境,让AI在里面比较不同的探索策略:先尝试哪条路,哪些方向值得继续,什么时候该停手。有了现成的实验结果,许多策略的筛选就不用再把昂贵的实验重做一遍。 等“梦里”筛出了更好的策略,AI再带着它回到真实实验,积累新的记录,供下一轮“做梦”继续改进。真实探索为“梦”提供素材,“梦”又帮助AI调整下一次探索的方法,自我改进的循环便由此接上。 谷歌让AI在“梦里”琢磨的,正是如何让自己更会做研究。每轮实验留下的经验,都有机会成为下一轮少走弯路的本钱。 何为做“梦”RSI? 每个人都做过梦,但AI的“梦”,跟广义的梦不一样,它指的是在已经录好的历史发现树里,用新策略走一遍,看会得到什么结果。 就像在迷宫中找出口。第一次进迷宫,没有任何地图,只能瞎走。但是在走的过程中,AI会顺手把迷宫的地图画出来。 所以当第二次走这个迷宫之前,就可以先看着这张地图,大概在脑内规划一个最快的路线。 那么在脑内绘制的这个过程,就叫“梦”。 谷歌的研究团队在论文中这样描述,眼下的RSI,还没发展到“AI深夜改自己的代码、然后一夜变强”那种程度。现在行业还停留在发现循环(discovery loop)之中。 Agent提出候选方案,评估结果,吸收反馈,再提出下一轮。算法设计、数学优化、GPU内核工程,这些关键词,本质上都是同一个循环转出来的。 而循环能转多快,取决于AI如何去“探索”这个迷宫。 要是用固定的探索策略,那它在搜索空间变大之后就不灵了,因为它不会从历史里学习并改善自己的策略。 就像每次考试都考同一道题,但是由于策略是固定的,所以就会导致AI每次都会在这道题出错。 那么让策略自己进化呗,每次跑完根据结果调整下一次的策略,不就行了? 也不行,因为这种调整策略的办法成本太高了。 因为AI公司要判断“一套新策略到底好不好”,不能只看它走了一步怎么样,得拿它完整跑一整轮再看结果。而且还会有一定概率出现这种情况,AI跑好几百次尝试、跑完所有轮次,最后发现结果还不如原来的固定策略。 因此,谷歌Dream-RSI的重点,就落在了第一次跑迷宫所绘制的地图上,即模型的探索历史。 一次在线发现跑完之后,留下的并不只是几行结论,而是一棵结构化的“发现树”。 这棵树上的每个分叉点,都是AI的某一次尝试。比如那次它写了什么代码、跑出来什么结果、得了多少分,全部在那个节点上,随时能翻出来看。 过去,AI公司把“梦”要么当成提示词塞进静态上下文,要么当成微调权重的训练数据。而Dream-RSI提出了第三种用法:把它当成一台可回放的模拟器(replay simulator)。 同一棵树,换一套探索策略去走,就会走出不一样的轨迹。并且在下一次训练的过程中,把已经走过的路从地图上划掉,专门挑不同的分支、按不同的顺序、用不同的并行度、在不同的地方停下来,就可以避免重复、浪费算力。 这棵树上的每个节点都已经被真实执行过了,所有结果都存着,所以回放一条新轨迹只需要“读”记录,不需要重跑Agent和评估器,执行成本为零。 但正如刚才提到的,之前的改进方法不一定比传统的固定策略好,很有可能出现费了半天力气调整策略,最后效果还不如以前的情况。 论文给了一个不降级保证:候选集合里始终包含当前策略,所以选出来的新策略在固定历史上的平均回放分,不会低于旧策略。 换句话说,这套自我改进,至少在设计上是“只增不减”的。 谷歌将Dream-RSI放在三个领域、八个科学发现任务上跑。包括算法工程(Lasso 正则化路径求解器)、数学优化(Sum–Difference、自相关不等式、圆堆叠)、GPU内核工程(KernelBench)。 结果是这样的。在Lasso 上,Dream-RSI优于sklearn、glmnet等标准库和强基线,相比SimpleTES最多省下162倍的Agent调用,相比固定探索基线也省约1.7倍。 在数学优化上,它在1000代以内就追平或超过强基线,相比SimpleTES省下50倍以上的预算。此前,SimpleTES在自相关问题上拿了最好的分数,代价是51200代。 在KernelBench上,它要么用1.79到2.43倍更少的代数达到目标速度,要么在同等预算下把内核性能最多提升 2.09 倍。 如果Gemini 4用的是Dream-RSI,那谷歌很可能会翻盘。 OpenAI、Anthropic的RSI又是什么 作为最头部的AI大厂,Anthropic和OpenAI又是怎么实现RSI的呢? 先看OpenAI。 9月初,它一天发了两份文档,第一份讲内部研究加速。在6月之前,Agent的总运行时长还低于人类的总工作量。到了8月中旬,Agent每天都能完成大约以前3.1个工作日的活。 OpenAI还宣布,已经实现了去年秋天承诺过的“自动化研究实习生”。这是一个能在人类指导下,完成研究工作的Agent,就连那些需要资深研究员干上几天的活,它都能自己独立完成。 OpenAI的下一步目标是,在2028年3月之前,做出“全自动化的AI研究员”,它能自己提出研究问题,然后根据提出的问题自己规划、自己跑实验。 之所以现在还叫“实习生”,是因为在4到8小时的任务里,超过一半至少需要一次人工介入。 第二份,是首席科学家雅库布·帕乔基(Jakub Pachocki)写的那篇《异种心智》(An Alien Mind)。 他把“安全”拆成两件事:目标对齐(goal alignment)和价值对齐(value alignment)。 目标对齐,指的是“AI 有没有认真去完成你交给它的任务”,比如听不听得懂指令、愿不愿意配合、能不能get你到底想干什么。 价值对齐,指的则是“当目标模糊、互相冲突,或者被丢进一个陌生、甚至有人故意使坏的环境时,它还能不能讲道理”。 诚实、有底线、对人抱有善意,只能靠一套通用规则来实现。 雅库布在文章中表示,RSI它难就难在“泛化”。 模型越聪明,越要在训练时没见过的情境里临时做判断,就越可能把学到的价值观推歪。 文章给出了一个反面教材。一个模型起初“满脑子都是对齐的念头”,可只要用足够大的优化压力逼它去达成一个很硬的目标,它就会学会“有动机地推理”。即模型在思维链上表示的都是符合规则的行为,可模型实际上做的,却是有悖于安全准则的事情,比如对某个网站发起攻击以获得目标需要的数据。 因此雅库布表示:“我们还不知道怎么安全地走到完全对齐的、完整的RSI。” 7月中旬,OpenAI在内部网络安全评估中出事,训练中的Agent突破沙箱隔离,入侵了Hugging Face的生产系统,甚至渗透了OpenAI自己的内部网络。 事件曝光后,OpenAI暂停了部分前沿模型的强化学习训练
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱